tonyd2wild GitHub avatar

GLM-5.2-QuantTrio-200K-4x-DGX-Spark

tonyd2wild

一个在4台NVIDIA DGX Spark集群上部署完整未剪枝GLM-5.2-Int4-Int8Mix模型(256专家)的指南,峰值单流达36 tok/s,支持20万上下文,采用MTP推测解码和CUDA图。

Stars

72

7 天增长

暂无数据

Fork 数

8

开放 Issue

2

开源协议

Apache-2.0

最近更新

2026-07-25

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

在较平民化硬件(4× GB10)上实现大型MoE模型的高保真推理,提供经过实战检验的详细部署步骤,并回馈开源社区。

适合谁使用

  • 在DGX Spark多节点集群上运行GLM-5.2的开发者
  • 研究高吞吐、长上下文未剪枝MoE模型推力的研究人员
  • 在ARM GB10节点上部署vLLM及自定义内核的系统集成与运维工程师
  • 希望在消费级硬件上复现最先进推理性能的爱好者

典型使用场景

  • 部署完整质量GLM-5.2用于长文档分析(最高20万token)
  • 高并发多流推理(6流,聚合65–75 tok/s)
  • 需要低首Token延迟的交互式应用(关闭思考时0.36秒)
  • 在4× GB10集群上复现并扩展基准测试结果

项目优势

  • 在4× GB10上实现平均32.5 tok/s单流和65–75 tok/s聚合吞吐
  • 支持20万上下文,采用fp8稀疏MLA KV缓存和全CUDA图
  • 使用模型内嵌MTP草稿器,无需单独下载或版本匹配
  • 提供可复现的逐步部署指南,附带校验过的内核及补丁以避免常见问题

使用前须知

  • 需要精确的4节点DGX Spark集群,配备RoCE网络和巨帧
  • 部署流程涉及多步骤手动操作(自定义Docker构建、内核打补丁、NCCL准备),存在许多陷阱
  • 长上下文请求可能触发Triton错误导致引擎停机,自愈机制需约15–20分钟重载

README 快速开始

Quick start

项目描述

Recipe: GLM-5.2 (unpruned QuantTrio Int4-Int8Mix) at 200K ctx with MTP spec decode on a 4x NVIDIA DGX Spark (GB10) cluster

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
bjan
精选
bjan GitHub avatar

claudemux

Claudemux is a lightweight, dependency-minimal message bus that lets multiple Claude Code sessions communicate in real-time over tmux, enabling one session to ask another a question and receive the answer without manual intervention.

AI 与机器学习AI 智能体
9
AARomanov1985
AARomanov1985 GitHub avatar

Audio-Cassette-Simulation

A set of bash scripts using ffmpeg to simulate vintage cassette tape audio profiles with noise, wow/flutter, bandwidth limits, and EQ.

Shell
373