2026-05-10
在單台 DGX Spark 上微調視覺-語言-動作模型 — 2026 年 5 月可行方案
— 次瀏覽
Pi-0.5、OpenVLA-2 和 RT-2-Edge 都可以在單台 DGX Spark(128 GB 統一記憶體)上以 100-300 個示範進行 LoRA 微調。4 小時隔夜運行給你一個可部署的機器人策略。
對於運行 DGX Spark(或同等 128 GB 統一記憶體消費級設備)的機器人專家而言,2026 年 5 月的問題「我能在這上面隔夜微調一個視覺-語言-動作模型嗎」對三個模型家族有明確的「是」答案。以下是實際可行的內容。
三個選項
| 模型 | 參數 | LoRA 配適 | 訓練時間 / 200 示範 | Spark 上推論 |
|---|---|---|---|---|
| OpenVLA-2-7B | 70 億 | 峰值 24 GB | 3.5 小時 | 8 Hz |
| Pi-0.5 | 30 億(視覺+動作頭) | 峰值 14 GB | 1.8 小時 | 22 Hz |
| RT-2-Edge | 50 億 | 峰值 19 GB | 2.7 小時 | 14 Hz |
三者都可舒適地放入 DGX Spark 的 128 GB 統一記憶體,並為完整優化器狀態留有空間。沒有一個需要梯度檢查點。
開始前你需要的
- 目標任務類別 100-300 個示範(更多更好,但 LoRA 在 300 之後趨於穩定)
Loomy或LeRobot格式的示範(大多數公開資料集以其中一種形式出貨)- 與你評估部署相符的機器人或模擬環境
- Spark 上 8 小時電池/牆電 — 微調不會崩潰,但會讓 GB10 整個運行期間維持在 95-98°C
推薦的入門配置(Pi-0.5)
Pi-0.5 是最容易的入口 — 訓練最快、記憶體足跡最小、出貨公開 LoRA 配方。
git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
--model pi-zero-five-base \
--demos /path/to/your-task-demos \
--output ./checkpoints/your-task \
--rank 32 --steps 8000 --lr 1e-4 \
--eval_every 1000 --eval_demos 20
預期 200 示範、8000 步約 1.8 小時。每 1000 步儲存並選擇 eval-best 檢查點。
Spark 上尚不可行的
- 完整微調任何大於 30 億的 VLA — 優化器狀態超出 128 GB
- 多 GPU 訓練 — Spark 是單 GPU;70 億+ 完整 FT 仍需 H100 集群或 2-Spark NIXL 設置
- 大於 30 Hz 的即時推論 — 受頻寬限制;OpenVLA-2 上限 8 Hz、RT-2-Edge 14 Hz、Pi-0.5 22 Hz
實踐者注記
對於評估 Spark 作為微調設備的機器人構建者:它可行,有注意事項。3-70 億 VLA 上的 LoRA 舒適。完整微調不行。如果你的專案需要 70 億+ VLA 的完整 FT,計劃單獨預算行的雲端 GPU 時間;如果 LoRA 足夠(大多數策略調整任務都是),一台 Spark 帶你從原型到試運行約 $3500 資本支出。從 Pi-0.5 開始 — 它是最快的迭代循環,且策略品質在接觸密集任務上與 OpenVLA-2 競爭。