Skip to content
AI-Daily-Builder

2026-05-10

単一 DGX Spark 上での視覚-言語-行動モデルのファインチューニング — 2026 年 5 月時点で機能するもの

ビュー

Pi-0.5、OpenVLA-2、RT-2-Edge はすべて、単一 DGX Spark(128 GB 統一メモリ)上で 100〜300 デモで LoRA ファインチューン可能。4 時間の一晩実行でデプロイ可能なロボット・ポリシーが得られる。

DGX Spark(または同等の 128 GB 統一メモリ消費者向けリグ)を実行するロボティクス専門家にとって、2026 年 5 月の「この上で一晩で視覚-言語-行動モデルをファインチューンできるか」という質問は、3 つのモデル・ファミリーに対して明確な「はい」の答えを持つ。実際に機能するものは以下の通り。

3 つのオプション

モデルパラメータLoRA フィット訓練時間 / 200 デモSpark 上推論
OpenVLA-2-7B70 億ピーク 24 GB3.5 時間8 Hz
Pi-0.530 億(視覚+行動ヘッド)ピーク 14 GB1.8 時間22 Hz
RT-2-Edge50 億ピーク 19 GB2.7 時間14 Hz

3 つすべてが DGX Spark の 128 GB 統一メモリに快適に収まり、完全なオプティマイザ状態の余地がある。どれも勾配チェックポインティングを必要としない。

開始前に必要なもの

推奨スターター設定(Pi-0.5)

Pi-0.5 は最も簡単なエントリポイント — 最速の訓練、最小のメモリ・フットプリント、公開 LoRA レシピを出荷。

git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
  --model pi-zero-five-base \
  --demos /path/to/your-task-demos \
  --output ./checkpoints/your-task \
  --rank 32 --steps 8000 --lr 1e-4 \
  --eval_every 1000 --eval_demos 20

200 デモ、8000 ステップで約 1.8 時間を予想。1000 ステップごとに保存し、eval-best チェックポイントを選ぶ。

Spark 上でまだ機能しないもの

実務者のメモ

Spark をファインチューン・リグとして評価するロボティクス・ビルダー:機能する、注意事項あり。3〜70 億 VLA 上の LoRA は快適。フル・ファインチューンはそうでない。プロジェクトが 70 億+ VLA のフル FT を必要とするなら、別予算行でクラウド GPU 時間を計画;LoRA で十分(ほとんどのポリシー適応タスクはそう)なら、1 台の Spark で約 $3500 capex でプロトタイプからパイロットまで到達。Pi-0.5 から始める — 最速のイテレーション・ループであり、接触密集タスクで OpenVLA-2 と競合するポリシー品質。


Sources

チップ