Skip to content
AI-Daily-Builder

2026-05-10

在单台 DGX Spark 上微调视觉-语言-动作模型 — 2026 年 5 月可行方案

次浏览

Pi-0.5、OpenVLA-2 和 RT-2-Edge 都可以在单台 DGX Spark(128 GB 统一内存)上用 100-300 个演示进行 LoRA 微调。4 小时通宵运行给你一个可部署的机器人策略。

对于运行 DGX Spark(或同等 128 GB 统一内存消费级设备)的机器人专家,2026 年 5 月的问题”我能在这上面通宵微调一个视觉-语言-动作模型吗”对三个模型家族有明确的”是”答案。以下是实际可行的内容。

三个选项

模型参数LoRA 配适训练时间 / 200 演示Spark 上推理
OpenVLA-2-7B70 亿峰值 24 GB3.5 小时8 Hz
Pi-0.530 亿(视觉+动作头)峰值 14 GB1.8 小时22 Hz
RT-2-Edge50 亿峰值 19 GB2.7 小时14 Hz

三者都可舒适地放入 DGX Spark 的 128 GB 统一内存,并为完整优化器状态留有空间。没有一个需要梯度检查点。

开始前你需要的

推荐的入门配置(Pi-0.5)

Pi-0.5 是最容易的入口 — 训练最快、内存占用最小、出货公开 LoRA 配方。

git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
  --model pi-zero-five-base \
  --demos /path/to/your-task-demos \
  --output ./checkpoints/your-task \
  --rank 32 --steps 8000 --lr 1e-4 \
  --eval_every 1000 --eval_demos 20

预计 200 演示、8000 步约 1.8 小时。每 1000 步保存并选择 eval-best 检查点。

Spark 上尚不可行的

实践者注记

对于评估 Spark 作为微调设备的机器人构建者:它可行,有注意事项。3-70 亿 VLA 上的 LoRA 舒适。完整微调不行。如果你的项目需要 70 亿+ VLA 的完整 FT,规划单独预算行的云端 GPU 时间;如果 LoRA 足够(大多数策略适配任务都是),一台 Spark 带你从原型到试运行约 $3500 资本支出。从 Pi-0.5 开始 — 它是最快的迭代循环,且策略质量在接触密集任务上与 OpenVLA-2 竞争。


Sources

请喝咖啡