TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
参加 January 2018
392
フォロー中
2.6K
ファン
Itaru Tomita / 冨田到
@itarutomy
2026.07.29 23:05
Tencentのロボティクスチームが、ロボットに「言葉で考えて、絵で確かめながら動く」能力を持たせる基盤モデル「RxBrain」を発表した(https://arxiv[.]org/abs/2607.14187)。 例えば「メガネを畳んでケースにしまう」というタスクなら、RxBrainは「つるを畳む」「ケースに入れる」と言葉で手順を計画し、それぞれの手順を終えた後の映像がどう見えるはずかを画像として想像しながらタスクを進めていく。 背景には、ロボット向けAIが抱えていた分業の問題がある。視覚言語モデル(VLM、画像を見て言葉で答えを返すAI)は「次に何をすべきか」の説明は得意だが結果の見た目までは示さず、逆に世界モデル(world model、未来の映像を予測するAI)は先の状態を絵で示せてもなぜそうすべきかという理由づけは苦手だった。RxBrainは6.2Bパラメータの単一モデルの中で、この2つの機能をMixture-of-Transformers(データの種類ごとに専門の処理経路を用意しつつ注意機構だけは共有するアーキテクチャ)で統合している。 学習データは実ロボットの操作映像、ハンドヘルドグリッパーでの人の動作、一人称視点の日常動画などから自動構築した5万時間超・2150万セグメント。新設ベンチマークRxBrain-Benchの「言葉と画像を組み合わせた計画」タスクではスコア0.68を記録し、既存のエージェント型手法(BAGEL-7B-MoTが0.50、Qwen-Agentが0.43)を上回った。一方、単純な状況理解を問うタスクでは総合スコア72.7にとどまり、Qwen3.5-4B(78.1)には及ばない。先を見通した計画は得意でも、細かい状況認識はまだ既存モデルに一歩譲るというバランスが見える。 さらに、大規模な行動データでの事前学習なしに実ロボットへ応用した結果も興味深い。食卓の準備・メガネの折りたたみ収納・ゴミ捨ての3タスクで平均成功率87%を達成し、ロボット操作の代表的な基盤モデルπ0.5(82%)やπ0(68%)を上回った。 「言葉で考え、絵で確かめる」というアプローチで、ロボットの計画立案を人間の思考プロセスに近づけようとしている点が面白い。
もっと見る
0
0
0
3
1
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
TVer新着
@TVer_info
101K ファン
New York Post
@nypost
4.2M ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
First Squawk
@FirstSquawk
569.6K ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
空空道人
@Kongkongda5882
34.3K ファン
一劍浣春秋
@chee828
0 ファン