2026-05-10
単一 DGX Spark 上での視覚-言語-行動モデルのファインチューニング — 2026 年 5 月時点で機能するもの
— ビュー
Pi-0.5、OpenVLA-2、RT-2-Edge はすべて、単一 DGX Spark(128 GB 統一メモリ)上で 100〜300 デモで LoRA ファインチューン可能。4 時間の一晩実行でデプロイ可能なロボット・ポリシーが得られる。
DGX Spark(または同等の 128 GB 統一メモリ消費者向けリグ)を実行するロボティクス専門家にとって、2026 年 5 月の「この上で一晩で視覚-言語-行動モデルをファインチューンできるか」という質問は、3 つのモデル・ファミリーに対して明確な「はい」の答えを持つ。実際に機能するものは以下の通り。
3 つのオプション
| モデル | パラメータ | LoRA フィット | 訓練時間 / 200 デモ | Spark 上推論 |
|---|---|---|---|---|
| OpenVLA-2-7B | 70 億 | ピーク 24 GB | 3.5 時間 | 8 Hz |
| Pi-0.5 | 30 億(視覚+行動ヘッド) | ピーク 14 GB | 1.8 時間 | 22 Hz |
| RT-2-Edge | 50 億 | ピーク 19 GB | 2.7 時間 | 14 Hz |
3 つすべてが DGX Spark の 128 GB 統一メモリに快適に収まり、完全なオプティマイザ状態の余地がある。どれも勾配チェックポインティングを必要としない。
開始前に必要なもの
- ターゲット・タスククラス向け 100〜300 デモ(多いほどよいが、LoRA では 300 以降頭打ち)
LoomyまたはLeRobotフォーマットのデモ(ほとんどの公開データセットはこのいずれかで出荷)- 評価デプロイメントに合うロボットまたはシム環境
- Spark 上の 8 時間バッテリー/壁電 — ファインチューンはクラッシュしないが、GB10 を実行全期間 95〜98°C に保つ
推奨スターター設定(Pi-0.5)
Pi-0.5 は最も簡単なエントリポイント — 最速の訓練、最小のメモリ・フットプリント、公開 LoRA レシピを出荷。
git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
--model pi-zero-five-base \
--demos /path/to/your-task-demos \
--output ./checkpoints/your-task \
--rank 32 --steps 8000 --lr 1e-4 \
--eval_every 1000 --eval_demos 20
200 デモ、8000 ステップで約 1.8 時間を予想。1000 ステップごとに保存し、eval-best チェックポイントを選ぶ。
Spark 上でまだ機能しないもの
- 30 億超のあらゆる VLA のフルファインチューン — オプティマイザ状態が 128 GB を超える
- マルチ GPU 訓練 — Spark はシングル GPU;70 億+ フル FT には依然として H100 クラスタまたは 2-Spark NIXL セットアップが必要
- >30 Hz でのリアルタイム推論 — バンド幅制約;OpenVLA-2 は 8 Hz、RT-2-Edge は 14 Hz、Pi-0.5 は 22 Hz が上限
実務者のメモ
Spark をファインチューン・リグとして評価するロボティクス・ビルダー:機能する、注意事項あり。3〜70 億 VLA 上の LoRA は快適。フル・ファインチューンはそうでない。プロジェクトが 70 億+ VLA のフル FT を必要とするなら、別予算行でクラウド GPU 時間を計画;LoRA で十分(ほとんどのポリシー適応タスクはそう)なら、1 台の Spark で約 $3500 capex でプロトタイプからパイロットまで到達。Pi-0.5 から始める — 最速のイテレーション・ループであり、接触密集タスクで OpenVLA-2 と競合するポリシー品質。