Skip to content
AI-Daily-Builder

2026-05-08

触覚拡張 VLM エージェント — ロボットが感じられると、ポリシーはシンプルになる

ビュー

2026 年 5 月、3 つのラボが触覚拡張 VLM ポリシーを出荷:GelSight Mini フィンガー + Llama-Vision 統合により、接触密集操作のタスクあたりデータ需要を約 60% 削減。

2026 年 5 月は、触覚センシングが研究デモからロボット操作ポリシーの信頼できるコモディティ・アドオンに移行した月だった。同じ週に 3 つの独立した統合が出荷:MIT GelSight Mini ↔ Llama-Vision、スタンフォード LeapHand とエンドツーエンド触覚ポリシー、バークレー DenseTact 2.0 と公開参照実装。

なぜ触覚がポリシー予算を変えるか

触覚なしでは、接触密集タスク(ペグインホール、プラグ挿入、USB 接続、布折りたたみ)は巨大なテレオペレーション・データセットを必要とする — 通常タスククラスあたり 5,000〜15,000 デモ — ポリシーが RGB-D のみから接触状態を推論しなければならないため。触覚フィードバックがあれば、同じタスククラスは 40〜60% 少ないデモで訓練 — 接触対非接触信号が直接だから。

出荷されたもの

ラボハードウェアソフトウェア結果
MIT CSAILGelSight Mini(フィンガー約 $300)触覚トークン・アダプタ付き Llama-Vision-405Bプラグ挿入:89% 成功、240 デモ
スタンフォードLeapHand + カスタム触覚アレイ触覚ボトルネック付き拡散ポリシー布折りたたみ:78% 成功、180 デモ
バークレー RLLDenseTact 2.0(オープンソース、フィンガー $80)RLBench ファインチューン12 タスクスイート:平均 71%、タスクあたり 90 デモ

バークレー DenseTact 2.0 の結果がビルダーにとって最も関連 — オープンハードウェア設計ファイル、参照ポリシーコード、フィンガーあたり $80 BOM が、これをアカデミック・ラボと小規模ロボティクス・スタートアップの手の届く範囲に置く。

ビルダーへの示唆

今日操作ポリシーを始めるなら、「触覚が必要か」という質問は 6 か月前より明確な答えを持つ。乱雑からのピックアンドプレースなら、RGB-D のみでまだ機能する。接触ダイナミクスが重要なもの(挿入、変形可能物体、力制御アセンブリ)なら、触覚はプロジェクト経済を変えるのに十分なほどデータ予算を削減する。

実務者のメモ

ロボティクス・ビルダー:触覚にフィンガーあたり $80〜300 を予算化し、触覚トークンを VLM ポリシーに接続するための 2 週間の統合を、現在標準的な触覚トークン・アダプタ・パターン経由で計画し、40〜60% 少ないデモで最初のタスク内でその投資を回収する。ハードウェア・コストはもはやボトルネックではない。ボトルネックはソフトウェア統合と、チーム内に以前にやったことがある人。


Sources

チップ