一个仅4900万参数的语言模型,实现了Moonshot AI的Kimi K3的关键架构思路(包括Kimi Delta注意力、门控MLA、稳定潜在MoE和每头Muon优化器),可在单张8GB GPU上从零开始在TinyStories数据集上训练。

Stars

46

7 天增长

暂无数据

Fork 数

2

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-28

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它将复杂的领先模型组件——如带有delta规则的线性注意力、使用分位数平衡的稀疏MoE和块级注意力残差——变得可在消费级硬件上亲手研究、修改,而不需要巨大的算力。

适合谁使用

  • 探索现代大语言模型架构的研究人员和学生
  • 希望在有限预算下实验MoE和线性注意力的实践者
  • 对Muon和Per‑Head Muon等新型优化器感兴趣的AI工程师
  • 希望在家中从零训练非标准Transformer的爱好者

典型使用场景

  • 在小规模上理解并迭代Kimi K3启发的组件
  • 在桌面GPU上训练语言模型用于教学目的
  • 对混合KDA/MLA及MoE的训练吞吐量和内存使用进行基准测试
  • 测试带有循环注意力缓存的自回归解码

项目优势

  • 保留了前沿模型的混合注意力和MoE设计,而非替换为标准Transformer
  • 在8GB GPU上运行,经验证的吞吐量(批次16时901 tok/s),峰值显存低于4 GB
  • 包含实时训练仪表盘和完整的验证测试套件(6项测试通过)
  • 文档完善,配有架构图、模型卡和实测基准

使用前须知

  • 仅在TinyStories上训练,因此生成文本局限于简单的儿童故事
  • 省略了视觉塔(4.01亿参数)且不声称复现Kimi K3的能力
  • 首次CUDA调用需要约75秒编译Triton内核,且模型未针对生产推理优化

README 快速开始

Quick start

项目描述

A 49M-parameter Kimi K3-inspired language model trainable on one 8GB GPU

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
gavamedia
精选
gavamedia GitHub avatar

deltafin

Deltafin is a research project that runs the 2.8-trillion-parameter Mixture-of-Experts model Kimi K3 on a single Apple Silicon Mac (e.g., M1 Max with 64 GB) at about 16 seconds per token, using exact, reproducible inference with local or streaming expert loading.

AI 与机器学习大语言模型
304
jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660