Skip to content
AI-Daily-Builder

2026-05-10

在單台 DGX Spark 上微調視覺-語言-動作模型 — 2026 年 5 月可行方案

次瀏覽

Pi-0.5、OpenVLA-2 和 RT-2-Edge 都可以在單台 DGX Spark(128 GB 統一記憶體)上以 100-300 個示範進行 LoRA 微調。4 小時隔夜運行給你一個可部署的機器人策略。

對於運行 DGX Spark(或同等 128 GB 統一記憶體消費級設備)的機器人專家而言,2026 年 5 月的問題「我能在這上面隔夜微調一個視覺-語言-動作模型嗎」對三個模型家族有明確的「是」答案。以下是實際可行的內容。

三個選項

模型參數LoRA 配適訓練時間 / 200 示範Spark 上推論
OpenVLA-2-7B70 億峰值 24 GB3.5 小時8 Hz
Pi-0.530 億(視覺+動作頭)峰值 14 GB1.8 小時22 Hz
RT-2-Edge50 億峰值 19 GB2.7 小時14 Hz

三者都可舒適地放入 DGX Spark 的 128 GB 統一記憶體,並為完整優化器狀態留有空間。沒有一個需要梯度檢查點。

開始前你需要的

推薦的入門配置(Pi-0.5)

Pi-0.5 是最容易的入口 — 訓練最快、記憶體足跡最小、出貨公開 LoRA 配方。

git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
  --model pi-zero-five-base \
  --demos /path/to/your-task-demos \
  --output ./checkpoints/your-task \
  --rank 32 --steps 8000 --lr 1e-4 \
  --eval_every 1000 --eval_demos 20

預期 200 示範、8000 步約 1.8 小時。每 1000 步儲存並選擇 eval-best 檢查點。

Spark 上尚不可行的

實踐者注記

對於評估 Spark 作為微調設備的機器人構建者:它可行,有注意事項。3-70 億 VLA 上的 LoRA 舒適。完整微調不行。如果你的專案需要 70 億+ VLA 的完整 FT,計劃單獨預算行的雲端 GPU 時間;如果 LoRA 足夠(大多數策略調整任務都是),一台 Spark 帶你從原型到試運行約 $3500 資本支出。從 Pi-0.5 開始 — 它是最快的迭代循環,且策略品質在接觸密集任務上與 OpenVLA-2 競爭。


Sources

請喝咖啡