登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 TencentDB
TencentDB コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
TencentDB を含む検索結果
Tencentのロボティクスチームが、ロボットに「言葉で考えて、絵で確かめながら動く」能力を持たせる基盤モデル「RxBrain」を発表した(https://arxiv[.]org/abs/2607.14187)。 例えば「メガネを畳んでケースにしまう」というタスクなら、RxBrainは「つるを畳む」「ケースに入れる」と言葉で手順を計画し、それぞれの手順を終えた後の映像がどう見えるはずかを画像として想像しながらタスクを進めていく。 背景には、ロボット向けAIが抱えていた分業の問題がある。視覚言語モデル(VLM、画像を見て言葉で答えを返すAI)は「次に何をすべきか」の説明は得意だが結果の見た目までは示さず、逆に世界モデル(world model、未来の映像を予測するAI)は先の状態を絵で示せてもなぜそうすべきかという理由づけは苦手だった。RxBrainは6.2Bパラメータの単一モデルの中で、この2つの機能をMixture-of-Transformers(データの種類ごとに専門の処理経路を用意しつつ注意機構だけは共有するアーキテクチャ)で統合している。 学習データは実ロボットの操作映像、ハンドヘルドグリッパーでの人の動作、一人称視点の日常動画などから自動構築した5万時間超・2150万セグメント。新設ベンチマークRxBrain-Benchの「言葉と画像を組み合わせた計画」タスクではスコア0.68を記録し、既存のエージェント型手法(BAGEL-7B-MoTが0.50、Qwen-Agentが0.43)を上回った。一方、単純な状況理解を問うタスクでは総合スコア72.7にとどまり、Qwen3.5-4B(78.1)には及ばない。先を見通した計画は得意でも、細かい状況認識はまだ既存モデルに一歩譲るというバランスが見える。 さらに、大規模な行動データでの事前学習なしに実ロボットへ応用した結果も興味深い。食卓の準備・メガネの折りたたみ収納・ゴミ捨ての3タスクで平均成功率87%を達成し、ロボット操作の代表的な基盤モデルπ0.5(82%)やπ0(68%)を上回った。 「言葉で考え、絵で確かめる」というアプローチで、ロボットの計画立案を人間の思考プロセスに近づけようとしている点が面白い。
もっと見る
「Tencent Music Entertainment Awards 2023」、Aimer初となるマカオでのライブでした! Thank you TMEA! 謝謝 澳門! #TMEA# #Aimer# by staff
マカオにて開催の 「Tencent Music Entertainment Awards 2023」、この後Aimerが出演! マカオでの初ライブをお届けします! 敬請期待! #TMEA# #Aimer# by staff
もっと見る
2023年7月8日・9日にマカオにて開催される 「Tencent Music Entertainment Awards 2023」に Aimerの出演が決定しました! Aimerは8日に出演します。 ▼詳細はこちら(海外サイト) #TMEA# #Aimer# by staff
もっと見る
全部MiniMax H3で作ったコンテスト用ショートアニメ「口裂け女」 不老の観察者とともに、その伝説が始まる瞬間を見届けましょう。 #MioraDesign# #MioraBuddy# #TencentAI# #MiniMaxH3# #MiniMax#
もっと見る
🦢 TL;DR: 「聞く・話す・割り込む」のタイミングはトップクラス、でもタスク遂行はまだ発展途上。Tencentが音声・映像・エージェントを1つに統合したomni対話モデルを発表しました。 タイトル: Omni Interaction Agent Technical Report(Gander) URL: 📌 ポイント 🧠 「小脳(対話制御)」と「大脳(Claude/Codexで実行)」の二層構造 🎙 音声・映像をチャンク単位でストリーミング処理、外部VAD不要 ✅ ターンテイキング精度100%でGPT-Realtimeの96%を上回る ⚠️ タスク完遂率(Pass@1)は0.400とGPT-Realtimeの0.600に劣る 🔀 音声認識を介さずテキストを直接渡すとPass@1が0.520に改善 🌐 音声×映像の統合でDaily-Omniが単一モダリティ比+19.13pt向上 📦 モデル重み・学習コード・評価ハーネスを公開予定 対話のテンポの良さと、タスクをやり切る正確さは今のところ別物という現実的な結果が興味深いです。 #マルチモーダルAI# #音声対話AI#
もっと見る