Deltafin 是一个研究项目,能够在单台 Apple Silicon Mac(如 64 GB 的 M1 Max)上运行拥有 2.8 万亿参数的混合专家模型 Kimi K3,每 token 约需 16 秒,使用精确、可复现的推理,支持本地或流式加载专家权重。

Stars

304

7 天增长

暂无数据

Fork 数

27

开放 Issue

2

开源协议

NOASSERTION

最近更新

2026-07-29

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它证明了一个远大于笔记本电脑内存的模型可以通过利用 MoE 层的稀疏性,结合精心设计的 I/O、融合内核和双缓冲技术,在消费级硬件上实现可用的(尽管缓慢的)推理。

适合谁使用

  • 研究大型 MoE 模型推理的研究人员
  • 探索设备端推理的机器学习工程师
  • 对在 Mac 上运行最先进模型感兴趣的爱好者
  • 学习量化与流式传输技术的学生和从业者

典型使用场景

  • 在 Mac 上运行 K3 进行自然语言生成实验
  • 通过记录的轨迹文件(router_trace.jsonl)研究路由器行为
  • 提供兼容 OpenAI API 的端点,供聊天界面集成
  • 测试流式推理技术和 I/O 优化策略

项目优势

  • 精确、可复现的贪婪解码,与参考模型一致
  • 可在 64 GB MacBook 上运行,远低于模型内存需求
  • 提供完整下载与流式两种模式,并支持平滑升级
  • 开源(MIT),包含透明的性能测量和失败记录

使用前须知

  • 非常慢 —— 在 M1 Max 上约 16 秒每 token(每分钟 3.75 token)
  • 完整本地安装需要约 1.7 TB 磁盘;流式模式有网络延迟
  • 仅支持贪婪解码(忽略 temperature/top_p);仅允许单个并发请求

README 快速开始

Usage

项目描述

Run Kimi K3, a 2.8T-parameter Mixture-of-Experts LLM, on a single Apple Silicon Mac. Streams MXFP4 experts on demand over HTTP into a local disk cache — fused NEON kernels, Metal/MPS compute, exact reproducible decoding, and an OpenAI-compatible API server for local chat and coding agents.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

deerwork-ai
精选
deerwork-ai GitHub avatar

deer-workflow

An open-source Dynamic Workflow runtime that combines deterministic TypeScript orchestration with replaceable Agent runtimes.

AI 与机器学习大语言模型
312
7-e1even
精选
7-e1even GitHub avatar

learn-agent

A collection of notes on building coding agents, derived from the production development of the desktop agent Reina, with each mechanism simplified into a zero-dependency, single-file Node.js demo.

AI 与机器学习大语言模型
218
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960