2026-05-08
촉각 증강 VLM 에이전트 — 로봇이 느낄 수 있을 때, 정책은 더 단순해진다
— 조회
2026년 5월 세 랩이 촉각 증강 VLM 정책 출시: GelSight Mini 핑거 + Llama-Vision 통합으로 접촉 집중 조작에서 태스크당 데이터 수요 약 60% 절감.
2026년 5월은 촉각 센싱이 연구 데모에서 로봇 조작 정책의 신뢰할 만한 상용 애드온으로 전환된 달이다. 같은 주에 세 가지 독립 통합이 출시: MIT GelSight Mini ↔ Llama-Vision, 스탠퍼드 LeapHand 엔드투엔드 촉각 정책, 버클리 DenseTact 2.0 공개 참조 구현.
왜 촉각이 정책 예산을 바꾸는가
촉각 없이는 접촉 집중 작업(페그인홀, 플러그 삽입, USB 연결, 천 접기)은 거대한 텔레오퍼레이션 데이터셋을 요구한다 — 보통 태스크 클래스당 5,000-15,000 시연 — 정책이 RGB-D만으로 접촉 상태를 추론해야 하기 때문. 촉각 피드백이 있으면 같은 태스크 클래스는 40-60% 더 적은 시연으로 훈련 — 접촉 대 비접촉 신호가 직접적이라서.
출시된 것
| 랩 | 하드웨어 | 소프트웨어 | 결과 |
|---|---|---|---|
| MIT CSAIL | GelSight Mini (핑거당 약 $300) | 촉각 토큰 어댑터 포함 Llama-Vision-405B | 플러그 삽입: 89% 성공, 240 시연 |
| 스탠퍼드 | LeapHand + 커스텀 촉각 어레이 | 촉각 보틀넥 포함 디퓨전 정책 | 천 접기: 78% 성공, 180 시연 |
| 버클리 RLL | DenseTact 2.0 (오픈소스, 핑거당 $80) | RLBench 파인튜닝 | 12개 태스크 스위트: 평균 71%, 태스크당 90 시연 |
버클리 DenseTact 2.0 결과가 빌더에게 가장 관련 있다 — 오픈 하드웨어 설계 파일, 참조 정책 코드, 핑거당 $80 BOM이 이를 학계 랩과 소규모 로보틱스 스타트업의 손이 닿는 범위에 둔다.
빌더 함의
오늘 조작 정책을 시작한다면 “촉각이 필요한가?” 질문은 6개월 전보다 더 명확한 답을 가진다. 잡동사니에서 픽 앤 플레이스는 RGB-D만으로도 여전히 작동. 접촉 동역학이 중요한 것(삽입, 변형 가능 객체, 힘 제어 조립)이라면, 촉각은 프로젝트 경제학을 바꿀 만큼 데이터 예산을 줄인다.
실무자 노트
로보틱스 빌더: 핑거당 $80-300을 촉각에 예산화, 촉각 토큰을 VLM 정책에 연결하기 위한 2주 통합을 현재 표준 촉각 토큰 어댑터 패턴 경유로 계획, 40-60% 더 적은 시연으로 첫 태스크 내에 그 투자를 회수. 하드웨어 비용은 더 이상 보틀넥이 아니다. 보틀넥은 소프트웨어 통합과 팀 내 전에 해본 사람.