2026-05-10
在单台 DGX Spark 上微调视觉-语言-动作模型 — 2026 年 5 月可行方案
— 次浏览
Pi-0.5、OpenVLA-2 和 RT-2-Edge 都可以在单台 DGX Spark(128 GB 统一内存)上用 100-300 个演示进行 LoRA 微调。4 小时通宵运行给你一个可部署的机器人策略。
对于运行 DGX Spark(或同等 128 GB 统一内存消费级设备)的机器人专家,2026 年 5 月的问题”我能在这上面通宵微调一个视觉-语言-动作模型吗”对三个模型家族有明确的”是”答案。以下是实际可行的内容。
三个选项
| 模型 | 参数 | LoRA 配适 | 训练时间 / 200 演示 | Spark 上推理 |
|---|---|---|---|---|
| OpenVLA-2-7B | 70 亿 | 峰值 24 GB | 3.5 小时 | 8 Hz |
| Pi-0.5 | 30 亿(视觉+动作头) | 峰值 14 GB | 1.8 小时 | 22 Hz |
| RT-2-Edge | 50 亿 | 峰值 19 GB | 2.7 小时 | 14 Hz |
三者都可舒适地放入 DGX Spark 的 128 GB 统一内存,并为完整优化器状态留有空间。没有一个需要梯度检查点。
开始前你需要的
- 目标任务类别 100-300 个演示(更多更好,但 LoRA 在 300 之后趋于稳定)
Loomy或LeRobot格式的演示(大多数公开数据集以其中一种形式出货)- 与你评估部署相符的机器人或仿真环境
- Spark 上 8 小时电池/墙电 — 微调不会崩溃,但会让 GB10 整个运行期间维持在 95-98°C
推荐的入门配置(Pi-0.5)
Pi-0.5 是最容易的入口 — 训练最快、内存占用最小、出货公开 LoRA 配方。
git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
--model pi-zero-five-base \
--demos /path/to/your-task-demos \
--output ./checkpoints/your-task \
--rank 32 --steps 8000 --lr 1e-4 \
--eval_every 1000 --eval_demos 20
预计 200 演示、8000 步约 1.8 小时。每 1000 步保存并选择 eval-best 检查点。
Spark 上尚不可行的
- 完整微调任何大于 30 亿的 VLA — 优化器状态超出 128 GB
- 多 GPU 训练 — Spark 是单 GPU;70 亿+ 完整 FT 仍需 H100 集群或 2-Spark NIXL 设置
- 大于 30 Hz 的实时推理 — 受带宽限制;OpenVLA-2 上限 8 Hz、RT-2-Edge 14 Hz、Pi-0.5 22 Hz
实践者注记
对于评估 Spark 作为微调设备的机器人构建者:它可行,有注意事项。3-70 亿 VLA 上的 LoRA 舒适。完整微调不行。如果你的项目需要 70 亿+ VLA 的完整 FT,规划单独预算行的云端 GPU 时间;如果 LoRA 足够(大多数策略适配任务都是),一台 Spark 带你从原型到试运行约 $3500 资本支出。从 Pi-0.5 开始 — 它是最快的迭代循环,且策略质量在接触密集任务上与 OpenVLA-2 竞争。