DGX Spark 部署笔记
来自 NVIDIA DGX Spark / GB10 社群关于本地 LLM 部署的实战发现。
2026-06-10
llama.cpp b9555 为 Blackwell SM121 推出原生 NVFP4 内核,释放 DGX Spark 完整性能
llama.cpp b9555 为 Blackwell SM121/GB10 推出原生 NVFP4 GEMM 内核——首个绕过 FP16 计算回退路径的版本,DGX Spark 单用户解码吞吐量估计提升 30–40%。
2026-06-09
Google 为整个 Gemma 4 家族推出 QAT 检查点:Q4_0 权重达到接近 BF16 的质量
2026 年 6 月 5 日,Google 为所有 Gemma 4 尺寸发布量化感知训练(QAT)检查点。Q4_0 让 E4B 从 15GB 降至 5GB、纯文本 E2B 降到 1GB 以下,llama.cpp、Ollama、MLX、vLLM 与 SGLang 首日即支持。
2026-06-08
为何 DGX Spark 的 GB10 解码只有 23 tok/s、预填却达 1,884 tok/s:一份带宽预算拆解
对 vLLM 2026 年 6 月 DGX Spark 部署的验证拆解:120B NVFP4 MoE 模型解码约 23 tok/s,但预填达约 1,884 tok/s,而 GB10 的 273 GB/s 内存带宽解释了这个落差。
2026-06-08
llama.cpp 取得原生视频输入:FFmpeg 子进程解码进驻 mtmd 堆栈
2026 年 6 月 8 日,llama.cpp 合并了 PR #24269,为其多模态(mtmd)子系统加入原生视频输入。它并非链接 FFmpeg,而是调用 FFmpeg 子进程来解码帧,并通过新的惰性位图 API,在 tokenization 阶段将单一视频标记展开为已解码的帧。此设计与模型无关,因此 Qwen3-VL 与 Gemma-4 等既有视觉模型只需极少量的 CLI/服务器变更,即可在本地硬件上取得视频功能。
2026-06-08
TensorRT-LLM rc17 为 SM121(DGX Spark)带来 NVFP4 MoE 后端与 NVFP4 KV 缓存
TensorRT-LLM v1.3.0rc17(6 月 2 日)新增一条仅针对 SM120/SM121 启用的 FlashInfer NVFP4 MoE 后端,并在 trtllm-gen attention 中启用 NVFP4 KV 缓存,还修复了 qwen3 在 SM120/121 上的卡死——这是 DGX Spark 在消费级 Blackwell 上的具体支持。
2026-06-07
vLLM 0.22 新增多层 KV Cache 卸载:GPU 到 CPU 再到磁盘,为长上下文本地服务而设
vLLM 0.22.0(2026 年 5 月 29 日)推出多层 KV cache 卸载框架,可将已缓存的块由 CPU DRAM 进一步级联下放到磁盘,并提供 Python 文件系统层与 Mooncake 磁盘后端;6 月 5 日的补丁加入了少数模型与 AMD-CPU 修正。对于服务 128K-token 上下文的单机本地设备而言,把 KV 溢出到 NVMe 而非重新计算 prefill,正是同一张卡只能服务一位用户、还是约八位用户的差
2026-06-07
vLLM 官方 DGX Spark 指南:为何 120B NVFP4 模型解码仅约 23 tok/s,以及这对带宽受限的本地推理带来什么启示
2026 年 6 月 1 日,vLLM 项目发布了在 NVIDIA DGX Spark(GB10 Grace Blackwell、sm_121、128 GB 统一内存)上运行 vLLM 的官方指南。通过 vllm/vllm-openai:cu130-nightly 容器服务 Nemotron-3-Super-120B-A12B-NVFP4,报告解码速度 22.7-23.7 tok/s、预填充最高约 1,884 tok/s、TTFT 为
2026-06-06
Gemma 4 多词元预测登陆 llama.cpp:自推测解码在本地推理进入主流
llama.cpp 于 2026 年 5 月合并了原生多词元预测(MTP)推测解码(PR #22673),报告在 Qwen3.6-27B 上以约 72% 的草稿接受率达成单流生成约 2.4 倍加速,草稿头从同一个 GGUF 加载并拥有自己的 KV-cache。2026 年 6 月 6 日,后续的 Gemma 4 MTP PR(#23398)被标记为可供审查,将此技术扩展到 Google 的 Gemma 4
2026-06-04
NVIDIA 六月 DGX Spark 更新:把桌面机器变成 4 节点集群
NVIDIA 6 月 1 日的 DGX Spark 更新(DGX OS 7.5.0、驱动 580.159.03、NCCL 2.30u1)新增 Sync Cluster Assistant,免交换机可串接 3 台 Spark、有交换机则可串接 4 台,组成多节点推理集群。
2026-05-29
一个 Triton FP8 绕道补丁,为 DGX Spark 的 GB10 挤出多 17% 的 NVFP4 速度
一个社区补丁把 NVFP4 权重改走 GB10 的 FP8 张量核心,而非缓慢的 BF16 后备路径,让 Qwen3.6-35B-A3B 在 DGX Spark 上从 40.8 提升到 47.6 tok/s。
2026-05-24
llama.cpp 合并原生 MTP 推测解码 — Qwen3.6 单请求解码提速约 2.16×,DGX Spark 受益
PR #22673 为 llama.cpp 带来原生多 token 预测(MTP)推测解码(build b9180+)。在 GB10 DGX Spark 上,Qwen3.6-27B Q4_K_M 单请求从 13.1 升到 28.3 tok/s — 但在并发下反而退步。
2026-05-09
DGX Spark + Mac Studio 解耦服务 — 在 GPT-OSS-120B 上以 prefill/decode 分离达到 2.8× 加速
社区分离模式:DGX Spark 负责 prefill(GPT-OSS-120B 约 1,723 tok/s)+ Mac Studio M3 Ultra 负责 decode(819 GB/s),相对单机 Spark FP8 达成 2.8× 端到端加速。
2026-05-09
Litespark 三元 CPU 推理(arXiv 2605.06485)— 9.2× TTFT、52× 吞吐、提供 pip 包
Litespark 用三元 {-1,0,+1} 权重网络将 FP 矩阵乘法替换为整数加减 SIMD。9.2× TTFT、52× 吞吐、14× 内存节省。Pip 安装、HF 集成。
2026-05-09
llama.cpp 上线 Gemma 4 26B-A4B NVFP4(b9080)与 MiMo-V2.5 注意力核(b9085)
llama.cpp b9080–b9085 加入原生 Gemma 4 26B-A4B NVFP4(Spark 上 52 tok/s、82 GB free for KV)与 MiMo-V2.5 flash-attention 对 d_kq=192/d_v=128 GQA 形状的支援。
2026-05-09
TensorRT-LLM v1.3.0rc14 — Qwen3.5 NVFP4 载重修复、Mamba 混合 prefix caching 启用
TRT-LLM 1.3.0rc14(5/7)加入 Qwen3.5 NVFP4 weight_scales 修复、Mamba 混合 prefix caching、NVFP4 weight-update、DFlash one-model spec-dec、与 Spark 命名的 GEMM 性能 PR。
2026-05-04
Qwen3 MoE 在 DGX Spark 上的性能 — NVFP4 vs FP8 基准测试与实际可行的配置
社区验证的 Qwen3.6-35B-A3B 与 Qwen3.5-122B-A10B 在 GB10 上的数据:NVFP4+MTP 单用户可达 55.9 tok/s,c=32 可达 433 tok/s。涵盖 TRITON-only MoE 后端问题与 MTP+prefix-cache 失败模式。
2026-05-03
DGX Spark 部署笔记:社群在 2026 Q2 真正遇到的问题
NVIDIA Developer Forums 上 DGX Spark / GB10 的六个重复出现部署陷阱(大多是软件不是硬件),加上 MoE + NVFP4/MXFP4 的社群共识。
2026-05-02
llama.cpp NVFP4 与 MXFP4 在 GB10(SM121)上的编译指南
DGX Spark GB10(SM121)上 llama.cpp NVFP4/MXFP4 的完整编译标志。gpt-oss-120B MXFP4 达到 pp2048=1,980 tok/s 与 tg32=35 tok/s(PR #22196 合并后)。
2026-05-01
DGX Spark 上 vLLM vs llama.cpp vs Ollama — 该用哪个推理栈
GB10 推理栈决策指南:vLLM 适合 MoE+高并发,llama.cpp 适合 MXFP4 提示与单用户,Ollama 适合零配置开发。包含 NVFP4 tok/s 比较。
2026-04-30
LiteLLM + Claude Code 搭配 DGX Spark — LAN 服务配置与协议转换
通过 LiteLLM 代理将 Claude Code API 调用路由到 DGX Spark 上的自建 Qwen3 模型。涵盖配置、模型别名映射、多 GPU 卸载,以及延迟与云端 API 的权衡分析。