ロボット基盤モデルがシミュレーションでは高性能なのに、カメラの位置や照明が変わった途端に失敗する原因、実は「見た目のズル」だったかもしれません。
タイトル: Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models
URL:
📝 概要
訓練分布内でたまたま行動と相関しているだけの無関係な視覚手がかりに頼ってしまう「視覚-行動ショートカット」を断ち切る学習手法「Latent Interface Training(LIT)」を提案しています。
❗ 解決する課題
ロボット基盤モデルは分布内では強いのに、視覚的な分布シフト(カメラ視点・照明・センサノイズなど)が起きると性能が大きく落ち込む問題がありました。
⚙️ 方法論
まず画像を使わずポーズ目標だけで行動部分を事前学習し、次に100個の潜在トークンを介して視覚情報を必ず経由させ、ポーズ再構成損失で監督する2段階構成になっています。
🤖 ユースケース
π0.5・MolmoAct2・FAST-WAM・ImageWAMという4種類の異なるロボット基盤モデルすべてに適用でき、フレームワークを選ばない汎用的な手法です。
📊 実験結果
LIBERO-Plusの分布外評価で全モデルが3.87〜10.70ポイント改善。実世界のロボット操作でも照明変化時に+16.7ポイント、特定タスクでは+60ポイントという大きな改善を達成しています。
見た目に頼らず本質的な空間情報で判断させる発想が、実運用ロボットの信頼性向上に直結しそうです。
#
ロボティクス# #
VLA#