LongCat-2.0 是一个1.6万亿参数的MoE语言模型,每次激活约480亿参数,在AI ASIC超级计算集群上训练,采用新型稀疏注意力和n-gram嵌入技术,在编程和智能体任务上表现出色。

Stars

506

7 天增长

暂无数据

Fork 数

57

开放 Issue

10

开源协议

MIT

最近更新

2026-07-08

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

该模型在非GPU硬件(AI ASIC)上完成了前沿规模的训练且无任何训练回滚或不可恢复的损失尖峰,同时引入了LongCat稀疏注意力和n-gram嵌入以提升效率与长上下文能力,在多个基准上与领先的闭源模型竞争。

适合谁使用

  • 研究大规模MoE和稀疏注意力机制的AI研究者
  • 构建代码智能体和自动化任务工作流的开发者
  • 探索非GPU硬件训练的组织
  • 需要百万token长上下文语言模型的工程团队

典型使用场景

  • 代码仓库级别的编辑与理解
  • 自动化任务执行与智能体工作流
  • 百万token长度的文档分析与推理
  • 集成Claude Code、OpenClaw等开发框架

项目优势

  • 大规模参数量(1.6万亿)通过MoE实现高效激活(480亿)
  • 新型LongCat稀疏注意力降低内存访问开销和索引成本
  • 在代码和智能体基准(如SWE-bench Pro 59.5、Terminal-Bench 2.1 70.8)上达到或超越顶级闭源模型
  • 在AI ASIC超级计算集群上训练超过35万亿token且无训练回滚,证明硬件稳定性

使用前须知

  • 未对所有下游应用进行全面评估,不同语言和领域的表现可能有差异
  • 模型规模庞大,需要大量推理资源(GPU或NPU)和专门的部署配置
  • 安全、公平性和偏见评估信息不足

README 快速开始

Usage Considerations

This model has not been specifically designed or comprehensively evaluated for every possible downstream application.

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

MoonshotAI
精选
MoonshotAI GitHub avatar

Kimi-K3

Kimi K3 is an open-weight, 2.8T-parameter native multimodal agentic model with a 1M-token context window, designed for frontier coding, knowledge work, and reasoning tasks.

AI 与机器学习AI 智能体
3,348
xuchonglang
精选
xuchonglang GitHub avatar

investing-for-beginners

A structured investing guide for Chinese beginners covering US stocks, options, and cryptocurrency, with focus on foundational concepts and risk awareness.

区块链与 Web3
2,739
Krishnagangwal
精选
Krishnagangwal GitHub avatar

CS-Fundamentals

A curated collection of Computer Science fundamentals (PDFs, notes, cheatsheets, interview question banks) for placement preparation, covering seven core subjects plus general resources.

数据与数据库数据库与存储
2,326