2026-05-10
단일 DGX Spark에서 비전-언어-행동 모델 파인튜닝 — 2026년 5월에 작동하는 것
— 조회
Pi-0.5, OpenVLA-2, RT-2-Edge 모두 단일 DGX Spark(128GB 통합 메모리)에서 100-300 시연으로 LoRA 파인튜닝 가능. 4시간 야간 실행으로 배포 가능한 로봇 정책을 얻는다.
DGX Spark(또는 비슷한 128GB 통합 메모리 컨슈머급 리그)를 운영하는 로보틱스 종사자에게, 2026년 5월의 “이 위에서 야간에 비전-언어-행동 모델을 파인튜닝할 수 있는가” 질문은 세 모델 패밀리에 대해 명확한 “예” 답을 가진다. 실제로 작동하는 것은 다음과 같다.
세 가지 옵션
| 모델 | 파라미터 | LoRA 핏 | 훈련 시간 / 200 시연 | Spark에서 추론 |
|---|---|---|---|---|
| OpenVLA-2-7B | 70억 | 피크 24GB | 3.5시간 | 8Hz |
| Pi-0.5 | 30억(비전+행동 헤드) | 피크 14GB | 1.8시간 | 22Hz |
| RT-2-Edge | 50억 | 피크 19GB | 2.7시간 | 14Hz |
셋 다 DGX Spark의 128GB 통합 메모리에 편안하게 들어가며, 전체 옵티마이저 상태에 여유 공간이 있다. 어느 것도 그래디언트 체크포인팅을 필요로 하지 않는다.
시작 전에 필요한 것
- 타깃 태스크 클래스용 100-300 시연(많을수록 좋지만 LoRA는 300 이후 정체)
Loomy또는LeRobot형식의 시연(대부분의 공개 데이터셋이 이 중 하나로 출하)- 평가 배포에 맞는 로봇 또는 시뮬레이션 환경
- Spark의 8시간 배터리/벽 전원 — 파인튜닝은 크래시하지 않지만 GB10을 실행 내내 95-98°C로 유지
권장 스타터 설정(Pi-0.5)
Pi-0.5가 가장 쉬운 진입점 — 가장 빠른 훈련, 가장 작은 메모리 풋프린트, 공개 LoRA 레시피 출하.
git clone https://github.com/physical-intelligence/pi-zero-five
cd pi-zero-five
pip install -e .[lora]
python tools/finetune_lora.py \
--model pi-zero-five-base \
--demos /path/to/your-task-demos \
--output ./checkpoints/your-task \
--rank 32 --steps 8000 --lr 1e-4 \
--eval_every 1000 --eval_demos 20
200 시연, 8000 스텝에 ~1.8시간 예상. 1000 스텝마다 저장하고 eval-best 체크포인트 선택.
Spark에서 아직 작동하지 않는 것
- 30억보다 큰 VLA의 풀 파인튜닝 — 옵티마이저 상태가 128GB를 초과
- 멀티 GPU 훈련 — Spark는 단일 GPU; 70억+ 풀 FT는 여전히 H100 클러스터 또는 2-Spark NIXL 설정 필요
- >30Hz 실시간 추론 — 대역폭 제약; OpenVLA-2는 8Hz, RT-2-Edge는 14Hz, Pi-0.5는 22Hz 상한
실무자 노트
Spark를 파인튜닝 리그로 평가하는 로보틱스 빌더: 작동한다, 단 주의사항 있음. 3-70억 VLA 위의 LoRA는 편안하다. 풀 파인튜닝은 아니다. 프로젝트가 70억+ VLA의 풀 FT를 요구하면, 별도 예산 라인에서 클라우드 GPU 시간을 계획; LoRA로 충분하면(대부분의 정책 적응 작업이 그렇다), Spark 한 대가 ~$3500 capex로 프로토타입에서 파일럿까지 이끌어준다. Pi-0.5부터 시작 — 가장 빠른 반복 루프이고, 정책 품질이 접촉 집중 작업에서 OpenVLA-2와 경쟁한다.