2026-05-08
触覚拡張 VLM エージェント — ロボットが感じられると、ポリシーはシンプルになる
— ビュー
2026 年 5 月、3 つのラボが触覚拡張 VLM ポリシーを出荷:GelSight Mini フィンガー + Llama-Vision 統合により、接触密集操作のタスクあたりデータ需要を約 60% 削減。
2026 年 5 月は、触覚センシングが研究デモからロボット操作ポリシーの信頼できるコモディティ・アドオンに移行した月だった。同じ週に 3 つの独立した統合が出荷:MIT GelSight Mini ↔ Llama-Vision、スタンフォード LeapHand とエンドツーエンド触覚ポリシー、バークレー DenseTact 2.0 と公開参照実装。
なぜ触覚がポリシー予算を変えるか
触覚なしでは、接触密集タスク(ペグインホール、プラグ挿入、USB 接続、布折りたたみ)は巨大なテレオペレーション・データセットを必要とする — 通常タスククラスあたり 5,000〜15,000 デモ — ポリシーが RGB-D のみから接触状態を推論しなければならないため。触覚フィードバックがあれば、同じタスククラスは 40〜60% 少ないデモで訓練 — 接触対非接触信号が直接だから。
出荷されたもの
| ラボ | ハードウェア | ソフトウェア | 結果 |
|---|---|---|---|
| MIT CSAIL | GelSight Mini(フィンガー約 $300) | 触覚トークン・アダプタ付き Llama-Vision-405B | プラグ挿入:89% 成功、240 デモ |
| スタンフォード | LeapHand + カスタム触覚アレイ | 触覚ボトルネック付き拡散ポリシー | 布折りたたみ:78% 成功、180 デモ |
| バークレー RLL | DenseTact 2.0(オープンソース、フィンガー $80) | RLBench ファインチューン | 12 タスクスイート:平均 71%、タスクあたり 90 デモ |
バークレー DenseTact 2.0 の結果がビルダーにとって最も関連 — オープンハードウェア設計ファイル、参照ポリシーコード、フィンガーあたり $80 BOM が、これをアカデミック・ラボと小規模ロボティクス・スタートアップの手の届く範囲に置く。
ビルダーへの示唆
今日操作ポリシーを始めるなら、「触覚が必要か」という質問は 6 か月前より明確な答えを持つ。乱雑からのピックアンドプレースなら、RGB-D のみでまだ機能する。接触ダイナミクスが重要なもの(挿入、変形可能物体、力制御アセンブリ)なら、触覚はプロジェクト経済を変えるのに十分なほどデータ予算を削減する。
実務者のメモ
ロボティクス・ビルダー:触覚にフィンガーあたり $80〜300 を予算化し、触覚トークンを VLM ポリシーに接続するための 2 週間の統合を、現在標準的な触覚トークン・アダプタ・パターン経由で計画し、40〜60% 少ないデモで最初のタスク内でその投資を回収する。ハードウェア・コストはもはやボトルネックではない。ボトルネックはソフトウェア統合と、チーム内に以前にやったことがある人。