MiaAI-Lab GitHub avatar

Qwen3.6-35B-A3B-UD-Q8_K_XL_DGX-Spark-Recipe

MiaAI-Lab

用于启动和停止 llama-server 的 Bash 脚本,专为 Qwen3.6-35B-A3B GGUF 模型设计,针对高显存系统(如 NVIDIA DGX Spark)优化。

Stars

26

7 天增长

暂无数据

Fork 数

4

开放 Issue

0

开源协议

暂无数据

最近更新

2026-07-06

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

提供了一个即开即用、生产级封装,支持庞大 MoE 模型(35B 激活参数/3B 总参数),具备多模态视觉、多 token 预测投机解码和 256K 上下文,自动处理二进制文件检测、模型下载、健康检查和优雅关闭。

适合谁使用

  • 在高显存 NVIDIA GPU(96–128 GB)上部署本地大模型的开发者
  • 使用 Qwen3.6-35B-A3B 进行长上下文或多模态任务的研究人员和工程师
  • NVIDIA DGX Spark(GB10)用户,寻求便捷的 llama.cpp 配置方案
  • 需要稳定服务器启动器来运行重型模型的 llama.cpp 爱好者

典型使用场景

  • 通过 OpenAI 兼容 API 进行本地聊天与补全推理
  • 使用视觉投影仪和 256K 上下文进行多模态 Qwen-VL 推理
  • 利用 MTP 头进行投机解码以加速生成
  • 需要持久后台服务的长期文档分析或智能体工作流

项目优势

  • 自动检测 llama-server 二进制文件并提供优雅的失败回退
  • 启动前通过健康检查轮询并显示加载进度和耗时
  • 自动从 Hugging Face 下载模型,支持断点续传和 token 认证
  • 配套 stop.sh 脚本实现 SIGTERM → SIGKILL 逐级关闭及 PID 文件管理

使用前须知

  • 需要 96–128 GB 显存和较新的 llama.cpp CUDA 构建(不支持 CPU 推理)
  • 仅支持 Linux(bash、nohup、pgrep)—— WSL 可用,原生 Windows 不支持
  • 下载量大(约 40 GB),默认配置对较小 GPU 不友好,需手动调整上下文或量化

README 快速开始

Quick Start

项目描述

llama-server start/stop scripts for Qwen3.6-35B-A3B UD-Q8_K_XL GGUF on DGX Spark

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

jamesob
精选
jamesob GitHub avatar

local-llm

A comprehensive guide for building and configuring a high-end local machine to run state-of-the-art LLMs, with detailed hardware choices, BIOS tuning, and Docker-based model serving.

AI 与机器学习大语言模型
1,660
bjan
精选
bjan GitHub avatar

claudemux

Claudemux is a lightweight, dependency-minimal message bus that lets multiple Claude Code sessions communicate in real-time over tmux, enabling one session to ask another a question and receive the answer without manual intervention.

AI 与机器学习AI 智能体
9
AARomanov1985
AARomanov1985 GitHub avatar

Audio-Cassette-Simulation

A set of bash scripts using ffmpeg to simulate vintage cassette tape audio profiles with noise, wow/flutter, bandwidth limits, and EQ.

Shell
373