TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
Joined January 2018
392
Following
2.6K
Followers
Itaru Tomita / 冨田到
@itarutomy
2026.07.29 23:05
Tencentのロボティクスチームが、ロボットに「言葉で考えて、絵で確かめながら動く」能力を持たせる基盤モデル「RxBrain」を発表した(https://arxiv[.]org/abs/2607.14187)。 例えば「メガネを畳んでケースにしまう」というタスクなら、RxBrainは「つるを畳む」「ケースに入れる」と言葉で手順を計画し、それぞれの手順を終えた後の映像がどう見えるはずかを画像として想像しながらタスクを進めていく。 背景には、ロボット向けAIが抱えていた分業の問題がある。視覚言語モデル(VLM、画像を見て言葉で答えを返すAI)は「次に何をすべきか」の説明は得意だが結果の見た目までは示さず、逆に世界モデル(world model、未来の映像を予測するAI)は先の状態を絵で示せてもなぜそうすべきかという理由づけは苦手だった。RxBrainは6.2Bパラメータの単一モデルの中で、この2つの機能をMixture-of-Transformers(データの種類ごとに専門の処理経路を用意しつつ注意機構だけは共有するアーキテクチャ)で統合している。 学習データは実ロボットの操作映像、ハンドヘルドグリッパーでの人の動作、一人称視点の日常動画などから自動構築した5万時間超・2150万セグメント。新設ベンチマークRxBrain-Benchの「言葉と画像を組み合わせた計画」タスクではスコア0.68を記録し、既存のエージェント型手法(BAGEL-7B-MoTが0.50、Qwen-Agentが0.43)を上回った。一方、単純な状況理解を問うタスクでは総合スコア72.7にとどまり、Qwen3.5-4B(78.1)には及ばない。先を見通した計画は得意でも、細かい状況認識はまだ既存モデルに一歩譲るというバランスが見える。 さらに、大規模な行動データでの事前学習なしに実ロボットへ応用した結果も興味深い。食卓の準備・メガネの折りたたみ収納・ゴミ捨ての3タスクで平均成功率87%を達成し、ロボット操作の代表的な基盤モデルπ0.5(82%)やπ0(68%)を上回った。 「言葉で考え、絵で確かめる」というアプローチで、ロボットの計画立案を人間の思考プロセスに近づけようとしている点が面白い。
Show more
0
0
0
3
1
Forward to community
Most Popular Users
Tibo
@thsottiaux
785K Followers
Elon Musk
@elonmusk
241.7M Followers
Serenity
@aleabitoreddit
1.1M Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Sam Altman
@sama
6.3M Followers
OpenAI
@OpenAI
5.4M Followers
New York Post
@nypost
4.2M Followers
SpaceXAI
@SpaceXAI
2.1M Followers
Ansem 🐂🀄️
@blknoiz06
1.4M Followers
Wall St Engine
@wallstengine
199.3K Followers
zerohedge
@zerohedge
3.4M Followers
First Squawk
@FirstSquawk
569.6K Followers
Anthropic
@AnthropicAI
1.8M Followers
Robinhood
@RobinhoodApp
1.4M Followers
The Kobeissi Letter
@KobeissiLetter
2.7M Followers