MoonEP 是一个专家并行通信库,通过动态冗余专家和在线规划,实现跨所有 ranks 的完美令牌负载平衡。

Stars

718

7 天增长

暂无数据

Fork 数

70

开放 Issue

9

开源协议

MIT

最近更新

2026-07-28

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它解决了路由 MoE 中严重的负载不均问题:无论路由偏差多大,每个 rank 始终处理恰好 S×K 个令牌,迭代时间和内存使用不受影响;同时支持零拷贝通信和静态形状。

适合谁使用

  • 训练大型 MoE 模型的机器学习工程师
  • 研究分布式训练和专家并行的研究人员
  • 部署具有不可预测令牌分布的 MoE 推理系统的开发者
  • 在 NVIDIA GPU(以及即将支持的真武 PPU)上运行 MoE 任务的团队

典型使用场景

  • 训练路由高度偏斜的 MoE 模型,避免性能下降或内存溢出
  • 为令牌分布随请求变化的 MoE 模型提供推理服务
  • 扩展到更多 ranks 的专家并行,同时保持每个 rank 的计算和内存恒定
  • 替换现有 MoE 训练流程中的 DeepEP,获得对负载不均的免疫力和更快的通信

项目优势

  • 完美令牌平衡:无论路由偏差如何,每个 rank 接收恰好 S×K 个令牌
  • 零拷贝融合的 permute/unpermute 消除了通信缓冲区与用户缓冲区之间的复制,降低延迟
  • 静态内存形状避免 GPU 内存碎片,并消除每层 MoE 的主机同步
  • 在线规划内核开销极小,能接近最优地选择冗余专家

使用前须知

  • 要求连续的对称内存权重张量和特定的缓冲区布局,可能无法与所有框架无缝集成
  • 目前仅支持 NVIDIA GPU;真武 PPU 的支持正在审核中
  • 动态冗余专家会额外增加内存占用(每个投影有 B 个预取槽),并且引入了更简单库不需要的规划和预取内核

README 快速开始

Usage

项目描述

MoonEP: A Perfectly Balanced Expert Parallelism Library via Dynamic Redundant Experts

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482