ロボットは動き方を知っていても、何をすべきかの手がかりを必要とする。その「文脈」を扱う研究を100ページ超で整理したサーベイです。
タイトル: In-Context Learning for Robots: Methods and Applications
URL:
❓ ロボットの文脈内学習とは何ですか?
デプロイ時にニューラルパラメータを固定したまま、デモンストレーションや相互作用を使って既存の能力を方向づける適応のことです。大規模事前学習で動き自体は獲得できても、目の前のシーンでは複数の手順がどれも実行可能に見えたり、素材の反応が未知だったりします。この欠落は運動能力をいくら高めても埋まりません。
❓ ファインチューニングと何が違うのですか?
ファインチューニングは新しい証拠を重みに取り込みますが、文脈内学習は意思決定の瞬間に証拠を利用可能にします。論文は適応の所在を、供給された文脈・再帰的状態・外部メモリ・テスト時の重み更新・永続的な重み更新の5つに分け、前3者がパラメータ固定にあたると整理しています。
❓ 手法はどう分類されているのですか?
実行が消費する中間表現を軸に4ファミリーへ整理されます。
・文脈条件付き方策(証拠から行動を直接推論)
・幾何的デモンストレーション転移(参照軌道を位置合わせして実行)
・世界モデルベース制御(未来を予測して計画)
・スキル/エージェントベース実行(スキルやプログラムを選び別のエグゼキュータへ)
同じデモが4つのどれにもなり得る点が重要で、違いは証拠の取り方ではなく実行が必要とする中間表現にあります。
❓ 評価はどうすればよいのですか?
証拠を取り除く、記憶を消す、検索を止める、重みを戻すといった介入を実行条件を揃えて行い、改善の出どころを特定します。実際、未知の行動規約を自力で発見させる設定では20エピソード中1回しか成功せず、対応関係の推論も23.3%にとどまったと報告されています。
#
ロボティクス# #
InContextLearning#