MiaAI-Lab GitHub avatar

Unsloth-Qwen3.6-35b-NVFP4-DGX-Spark

MiaAI-Lab

该代码仓库提供了在NVIDIA DGX Spark(GB10)上部署unsloth/Qwen3.6-35B-A3B-NVFP4 MoE模型的vLLM方案,采用优化的FP8/NVFP4推理,支持最高256K上下文、多模态输入和推测解码。

Stars

28

7 天增长

暂无数据

Fork 数

4

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-11

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它展示了在单块消费级GPU上运行大型MoE模型(35B总参,3B激活)的生产级部署,集成了FlashInfer B12X线性核、FP8 KV缓存、分块预填充和MTP推测解码等前沿优化,达到约80 tok/s的解码速度和低延迟。

适合谁使用

  • NVIDIA DGX Spark / GB10用户
  • 本地部署大型MoE模型的开发者
  • 在边缘硬件上评估Qwen3.6性能的研究者
  • 关注NVFP4优化的vLLM爱好者

典型使用场景

  • 本地编码助手,支持工具使用和推理
  • 多模态对话,每次请求最多4张图片输入
  • 高上下文文档分析(最高262K token)
  • 在单GPU上原型和测试Qwen3.6模型能力

项目优势

  • 专门针对SM121(GB10)优化,原生支持NVFP4和FlashInfer核
  • 推测解码接受率约86%,提升吞吐量
  • 低首令牌延迟:P50 103ms,P95 107ms(200 token提示)
  • 开箱支持视觉、工具使用和Qwen3思维链推理

使用前须知

  • 需要特定NVIDIA GPU(计算能力12.1,GB10/DGX Spark),不通用
  • 首次启动需10-20分钟(torch.compile和权重缓存)
  • 由于内存限制,并发序列数(24)和批处理token数(32768)有限

README 快速开始

Quick Start

项目描述

vLLM deployment for Unsloth Qwen3.6-35B-A3B-NVFP4-Fast on NVIDIA DGX Spark

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
bjan
精选
bjan GitHub avatar

claudemux

Claudemux is a lightweight, dependency-minimal message bus that lets multiple Claude Code sessions communicate in real-time over tmux, enabling one session to ask another a question and receive the answer without manual intervention.

AI 与机器学习AI 智能体
9
AARomanov1985
AARomanov1985 GitHub avatar

Audio-Cassette-Simulation

A set of bash scripts using ffmpeg to simulate vintage cassette tape audio profiles with noise, wow/flutter, bandwidth limits, and EQ.

Shell
373