🤖 VLMを一切追加学習させずに、そのままロボットを動かせるとしたら。RoboDawnはこの問いに真正面から挑んだ研究です。
タイトル: Transferring the Intelligence of VLMs to Robotic Control (RoboDawn)
URL:
事前学習済みVLMに、人間にも直感的な移動・回転・グリッパーの意味的コマンドと、数回分のデモンストレーションを文脈として与えるだけでロボットアームを操作させる手法です。
注目ポイントは3つあります。
🎮 ゲームのような操作インターフェース
移動・回転・グリッパー開閉といった離散コマンドで制御します。すべてグリッパーの中心点を基準にした相対指示なので、VLMがWeb上ですでに持っている空間操作の知識をそのまま活かせます。
📚 デモ1つで劇的に伸びる
パラメータ更新は一切なし。コマンドの効果を示すプライマーとタスクデモを文脈に与えるだけで、RoboTwin 2.0での成功率がゼロショット53.2%からワンショット73.6%まで向上しました。
🏆 訓練済みロボット方策を上回る
タスク特化の学習なしで、専用データでフル学習されたπ0.5(46.0%)やLingBot-VLA(50.4%)をゼロショットの時点で凌駕。実機のFrankaロボットでも90%の成功率を記録しています。
ロボット専用データを集めるより、VLMが既に持つ知能を引き出すインターフェース設計こそが鍵になるのかもしれません。
#
ロボティクス# #
VLM#