tonyd2wild GitHub avatar

DeepSeek-v4-Flash-DSpark-1M-NVFP4-KV-2x-DGX-Spark

tonyd2wild

该仓库提供了一套经过验证的基于Docker的多节点部署方案,可在两台DGX Spark上使用vLLM、NVFP4 KV缓存和DSpark推测解码来服务DeepSeek V4 Flash变体,实现高达1.5M上下文长度和约50-60 tok/s的吞吐量。

Stars

158

7 天增长

暂无数据

Fork 数

12

开放 Issue

4

开源协议

MIT

最近更新

2026-07-16

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

该方案在消费级Blackwell硬件上首次实现了经过验证的百万级上下文多节点部署,附带了详尽的基准测试、解决并发服务乱码问题的补丁历史,以及平衡上下文长度与并发度的调优指南。

适合谁使用

  • 运维两台DGX Spark集群的部署工程师
  • 需要长上下文LLM服务以支持智能体系统的研究人员和开发者
  • 寻求经过验证的vLLM+DeepSeek部署方案(含推测解码)的系统集成商

典型使用场景

  • 为智能体或监控集群提供百万级上下文的模型服务
  • 在不同并发度下测试和基准化推测解码的性能
  • 为生产级智能体编排层部署无乱码的聊天端点

项目优势

  • 经基准验证的高并发下可达315 tok/s、单流50-60 tok/s的性能
  • 详细记录了乱码根因及五步修复方案,并在并发环境下经过实战验证
  • 透明解释了KV缓存工作机制,说明如何安全地在长上下文下实现并发
  • 提供多套精选配置方案(1M上下文、200K高并发、全长1M+适度并发),并清晰说明其权衡

使用前须知

  • NVFP4 KV缓存在沉重的智能体上下文下可能崩溃产生乱码;输出质量优先时建议回退到FP8
  • 由于KV池限制,无法同时实现全长1M上下文与高并发
  • 该方案依赖特定硬件(两台DGX Spark、RoCE/InfiniBand网络),不易移植

README 快速开始

Quick start

项目描述

DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482