DGX Spark 배포 노트
NVIDIA DGX Spark / GB10 커뮤니티의 로컬 LLM 배포 실전 노하우.
2026-06-10
llama.cpp b9555, Blackwell SM121용 네이티브 NVFP4 커널 탑재 — DGX Spark 풀 퍼포먼스 해제
llama.cpp b9555가 Blackwell SM121/GB10용 네이티브 NVFP4 GEMM 커널을 탑재. FP16 컴퓨팅 폴백을 우회한 첫 빌드로 DGX Spark 싱글 유저 디코드 처리량 30–40% 향상 예상.
2026-06-09
구글, Gemma 4 전체 패밀리에 QAT 체크포인트 공개: BF16에 근접한 품질의 Q4_0 가중치
2026년 6월 5일, 구글이 Gemma 4 전 사이즈에 양자화 인식 훈련(QAT) 체크포인트를 공개했다. Q4_0로 E4B는 15GB에서 5GB로, 텍스트 전용 E2B는 1GB 미만으로 줄었고 llama.cpp, Ollama, MLX, vLLM, SGLang이 첫날부터 지원한다.
2026-06-08
왜 DGX Spark의 GB10은 디코딩 23 tok/s인데 프리필은 1,884 tok/s로 나오는가: 대역폭 예산 분해
vLLM의 2026년 6월 DGX Spark 배포에 대한 검증된 분해: 120B NVFP4 MoE 모델은 디코딩이 약 23 tok/s이지만 프리필은 약 1,884 tok/s이며, GB10의 273 GB/s 메모리 대역폭이 그 격차를 설명한다.
2026-06-08
llama.cpp, 네이티브 동영상 입력 확보: FFmpeg 서브프로세스 디코딩이 mtmd 스택에 안착
2026년 6월 8일, llama.cpp는 PR #24269를 병합하여 멀티모달(mtmd) 하위 시스템에 네이티브 동영상 입력을 추가했다. FFmpeg를 링크하는 대신 FFmpeg 서브프로세스를 호출해 프레임을 디코딩하며, 새로운 지연 비트맵 API가 단일 동영상 마커를 토큰화 시점에 디코딩된 프레임으로 확장한다. 이 설계는 모델 비의존적이어서 Qwen3-VL과 Gemma-4 같은 기존
2026-06-08
TensorRT-LLM rc17, SM121(DGX Spark)용 NVFP4 MoE 백엔드와 NVFP4 KV 캐시 추가
TensorRT-LLM v1.3.0rc17(6월 2일)은 SM120/SM121 전용으로 활성화되는 FlashInfer NVFP4 MoE 백엔드를 추가하고 trtllm-gen attention에서 NVFP4 KV 캐시를 활성화하며, SM120/121에서의 qwen3 행 현상도 수정했다 — DGX Spark의 소비자용 Blackwell에 대한 구체적 지원.
2026-06-07
vLLM 0.22, 다중 계층 KV 캐시 오프로딩 추가: 장문맥 로컬 서빙을 위한 GPU에서 CPU 그리고 디스크로
vLLM 0.22.0(2026년 5월 29일)은 캐시된 블록을 CPU DRAM 너머 디스크까지 캐스케이드하는 다중 계층 KV 캐시 오프로딩 프레임워크를 출시했으며, Python 파일시스템 계층과 Mooncake 디스크 백엔드를 갖췄다. 6월 5일 패치는 몇 가지 모델 및 AMD-CPU 수정을 추가했다. 128K-token 문맥을 서빙하는 단일 박스 로컬 리그에서, prefill을 재계산하는
2026-06-07
vLLM 공식 DGX Spark 가이드: 왜 120B NVFP4 모델의 디코딩이 약 23 tok/s 인가, 그리고 그것이 대역폭 제약 로컬 추론에 대해 가르쳐 주는 것
2026 년 6 월 1 일, vLLM 프로젝트는 NVIDIA 의 DGX Spark(GB10 Grace Blackwell, sm_121, 128 GB 통합 메모리)에서 vLLM 을 실행하는 공식 가이드를 발표했다. vllm/vllm-openai:cu130-nightly 컨테이너에서 Nemotron-3-Super-120B-A12B-NVFP4 를 서빙하며, 디코딩 22.7-23.7 tok/s
2026-06-06
Gemma 4 멀티 토큰 예측이 llama.cpp에 도착: 자기 추측 디코딩이 로컬 추론에서 주류로
llama.cpp는 2026년 5월에 네이티브 멀티 토큰 예측(MTP) 추측 디코딩을 병합했으며(PR #22673), Qwen3.6-27B에서 약 72%의 초안 수락률로 단일 스트림 생성이 약 2.4배 빨라졌다고 보고했다. 초안 헤드는 동일한 GGUF에서 로드되며 자체 KV-cache를 갖는다. 2026년 6월 6일, 후속 Gemma 4 MTP PR(#23398)이 검토 준비 완료로
2026-06-04
NVIDIA의 6월 DGX Spark 업데이트: 데스크톱 박스를 4노드 클러스터로
NVIDIA의 6월 1일 DGX Spark 업데이트(DGX OS 7.5.0, 드라이버 580.159.03, NCCL 2.30u1)는 Sync Cluster Assistant를 추가해, 스위치 없이 3대, 스위치로 4대의 Spark를 멀티노드 추론 클러스터로 연결한다.
2026-05-29
Triton FP8 우회 패치가 DGX Spark의 GB10에서 NVFP4 속도를 17% 더 짜낸다
커뮤니티 패치가 NVFP4 가중치를 느린 BF16 폴백 대신 GB10의 FP8 텐서 코어로 우회시켜, DGX Spark에서 Qwen3.6-35B-A3B를 40.8에서 47.6 tok/s로 끌어올린다.
2026-05-24
llama.cpp, 네이티브 MTP 추측 디코딩 병합 — Qwen3.6 단일 요청 디코딩 약 2.16배, DGX Spark 수혜
PR #22673이 llama.cpp에 네이티브 다중 토큰 예측(MTP) 추측 디코딩을 추가(build b9180+). GB10 DGX Spark에서 Qwen3.6-27B Q4_K_M 단일 요청이 13.1에서 28.3 tok/s로 — 다만 동시 처리에서는 오히려 하락.
2026-05-09
DGX Spark + Mac Studio 분리 서빙 — GPT-OSS-120B에서 prefill/decode 분리로 2.8× 가속
커뮤니티 패턴: DGX Spark가 prefill(GPT-OSS-120B 약 1,723 tok/s) + Mac Studio M3 Ultra가 decode(819 GB/s) 담당, Spark FP8 단일 대비 2.8× 엔드투엔드 가속.
2026-05-09
Litespark 삼진 CPU 추론(arXiv 2605.06485) — 9.2× TTFT, 52× 처리량, pip 패키지 제공
Litespark는 삼진 {-1,0,+1} 가중치 네트워크에서 FP 행렬곱을 정수 가감 SIMD로 대체. 9.2× TTFT, 52× 처리량, 14× 메모리 감소. Pip 설치, HF 통합.
2026-05-09
llama.cpp가 Gemma 4 26B-A4B NVFP4(b9080)와 MiMo-V2.5 어텐션 커널(b9085) 지원
llama.cpp b9080–b9085가 네이티브 Gemma 4 26B-A4B NVFP4(Spark에서 52 tok/s, KV용 82 GB 여유)와 d_kq=192/d_v=128 GQA 형상용 MiMo-V2.5 flash-attention 타일 추가.
2026-05-09
TensorRT-LLM v1.3.0rc14 — Qwen3.5 NVFP4 가중치 로딩 수정, Mamba 하이브리드 prefix 캐싱 활성화
TRT-LLM 1.3.0rc14(5/7)가 Qwen3.5 NVFP4 weight_scales 수정, Mamba 하이브리드 prefix 캐싱, NVFP4 weight-update, DFlash one-model spec-dec, Spark 명명 GEMM 성능 PR 추가.
2026-05-04
DGX Spark에서 Qwen3 MoE — NVFP4 vs FP8 벤치마크와 실제로 동작하는 설정
GB10에서 Qwen3.6-35B-A3B와 Qwen3.5-122B-A10B의 커뮤니티 검증 수치: NVFP4+MTP로 단일 사용자 55.9 tok/s, c=32에서 433 tok/s 달성. TRITON-only MoE 백엔드 문제와 MTP+prefix-cache 실패 모드 포함.
2026-05-03
DGX Spark 배포 노트: 커뮤니티가 2026 Q2에 실제로 마주친 문제들
NVIDIA Developer Forums에서 DGX Spark / GB10 관련해 반복적으로 등장한 여섯 가지 배포 함정(대부분 하드웨어가 아닌 소프트웨어), 그리고 MoE + NVFP4/MXFP4에 대한 커뮤니티 합의를 정리했습니다.
2026-05-02
GB10(SM121)에서 llama.cpp NVFP4와 MXFP4 빌드 가이드
DGX Spark GB10(SM121)용 llama.cpp NVFP4/MXFP4 완전한 빌드 플래그. PR #22196 머지 후 gpt-oss-120B MXFP4에서 pp2048=1,980 tok/s, tg32=35 tok/s 달성.
2026-05-01
DGX Spark에서 vLLM vs llama.cpp vs Ollama — 어떤 추론 스택을 써야 하나
GB10 추론 스택 결정 가이드: MoE+고동시성은 vLLM, MXFP4 프롬프트·단일 사용자는 llama.cpp, 제로 설정 개발은 Ollama. NVFP4 tok/s 비교 포함.
2026-04-30
LiteLLM + Claude Code on DGX Spark — LAN 서빙 설정과 프로토콜 변환
LiteLLM 프록시로 Claude Code API 호출을 DGX Spark의 Qwen3 모델로 라우팅. 설정, 모델 별칭 매핑, 클라우드 API 대비 레이턴시 트레이드오프 분석 포함.