登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 VLM
VLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
VLM を含む検索結果
VLM(画像を見て言葉で答える大規模言語モデル)に専門ツールを使わせて学ばせたあと、使い方ごと本体に染み込ませてツールを手放せるようにする学習手法SpatialCLIが発表された(https://arxiv[.]org/html/2607.27703v1)。 VLMは「机の上で一番遠いクマのぬいぐるみはどれか」のような課題全体の理解は得意だが、実際の距離を正確に測るのは苦手。SAM 3(輪郭を切り出す専門モデル)やDepth Anything 3(奥行きを推定する専門モデル)は精密だが、どのクマを見ればいいかという文脈判断ができない。しかもこうした専門ツールは呼び出すたびに時間がかかり、学習時点の計測では1回あたり平均2.916秒だったという。 SpatialCLIの名前は、位置特定・輪郭抽出・奥行き・姿勢推定という4つの専門ツールをVLMに呼び出させるCall、お手本の成功例と強化学習(GRPO)でツールの選び方を磨くLearn、ツールを使って解けた過程を文章に変換しツールなしでも同じ結論に辿り着けるよう学習し直すInternalizeという3段階に由来する。ツールを使う学習と使わない学習を同時に行うため、ツールの使い方を忘れずに専門能力だけをモデル本体に取り込める。 新設した516問のベンチマークSpatialCLI-Benchは、フロンティアモデルのGPT-5.6 Solでも正答率48.8%にとどまる難問揃い。Qwen3-VL-8B(80億パラメータ)にSpatialCLIを適用すると、ツールなしで35.3%から72.7%、ツールありでは91.3%まで伸びた。視点を変えながら空間関係を捉える力を測る別のベンチマークMindCubeでも29.3%から84.6%(ツールあり)に達し、同じ条件のGPT-5.6 Sol(72.1%)を上回っている。 ツールを使わせて学ばせてから、学んだことを染み込ませて手放させる。この順番が、身体を持つAIが現実世界の空間を扱えるようになる道筋の一つになりそうだ。
もっと見る
🤖 VLMを一切追加学習させずに、そのままロボットを動かせるとしたら。RoboDawnはこの問いに真正面から挑んだ研究です。 タイトル: Transferring the Intelligence of VLMs to Robotic Control (RoboDawn) URL: 事前学習済みVLMに、人間にも直感的な移動・回転・グリッパーの意味的コマンドと、数回分のデモンストレーションを文脈として与えるだけでロボットアームを操作させる手法です。 注目ポイントは3つあります。 🎮 ゲームのような操作インターフェース 移動・回転・グリッパー開閉といった離散コマンドで制御します。すべてグリッパーの中心点を基準にした相対指示なので、VLMがWeb上ですでに持っている空間操作の知識をそのまま活かせます。 📚 デモ1つで劇的に伸びる パラメータ更新は一切なし。コマンドの効果を示すプライマーとタスクデモを文脈に与えるだけで、RoboTwin 2.0での成功率がゼロショット53.2%からワンショット73.6%まで向上しました。 🏆 訓練済みロボット方策を上回る タスク特化の学習なしで、専用データでフル学習されたπ0.5(46.0%)やLingBot-VLA(50.4%)をゼロショットの時点で凌駕。実機のFrankaロボットでも90%の成功率を記録しています。 ロボット専用データを集めるより、VLMが既に持つ知能を引き出すインターフェース設計こそが鍵になるのかもしれません。 #ロボティクス# #VLM#
もっと見る
で再生できるけどうるさいよ