登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 MLLMs
MLLMs コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
MLLMs を含む検索結果
アノテーションをRLの訓練シグナルとして使ったとき、なぜか優秀な行動に負の勾配がかかる —— OraRLはその仕組みを解明し、解決しました。 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs ❓ アノテーションをrolloutとして使うと何が起きる? 💡 「Advantage Inversion(有利性の反転)」が起きます。GRPOの標準正規化では、グループ内rolloutの有利性を平均と分散で計算します。ここに高報酬のoracle rolloutを追加するとグループ平均が上昇し、ポリシー平均を超えているはずの良い行動が負の有利性を受ける逆転現象が発生します。92,024件の計測で、Naive oracle mixingでは42.5%のグループで反転が起きていました。 ❓ OraRLはどう解決する? 💡 5つのコンポーネントで有利性推定を分離します。まずoracle-freeなon-policyベースラインを構築し(分散正規化なしで定義上inversion不可)、oracle-policy gapから方向性ゲインを計算してポリシー平均超えrolloutを増幅します。oracle自体の有利性は最強のon-policyシグナルでスケール調整し、ポリシー全体を支配しないよう設計。符号均衡Pruning(正・負を等分保持)により反転率を最終0.3%まで圧縮し、1.48倍の速度向上も実現しています。 ❓ どれくらい強い? 💡 Video-ORA-9BはVSI-Benchで73.1を達成し、GPT-5(55.0)とGemini-3-Pro(55.1)を18ポイント以上上回りました。ReasonVOSセグメンテーションはバックボーン比+42.2、VideoHolmesは+15.2と大幅改善。訓練コストはSFTの2.2倍で済み、GRPO+CoT(4.9倍)の半分以下です。 ❓ 推論の効率は? 💡 CoTが不要なためP90推論レイテンシは25.15秒で、CoT付きバックボーンの62.67秒と比べて大幅に短縮。データ効率でもOraRLは100kプロンプトで+5.2pt、GRPOの+2.8ptを上回ります。 #VideoMLLM# #ReinforcementLearning#
もっと見る
道案内AIが路地の角を曲がれても、都市を横断できるとは限りません。その差を実スケールの香港で測りました。 UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 🏙️ 概要 MLLMは短距離タスクや視覚認識で高い性能を示してきましたが、「局所での強さが広域行動に転化するか」は未検証でした。UrbanGroundは、香港の地理空間データ(OSM・衛星地図)からUnity上に構築した実スケール3D都市シミュレーションで、MLLMの空間エージェント能力を体系的に評価します。810件の人手検証済みタスクを5段階の評価ラダーに配置しています。 🔍 解決する課題 既存の空間推論ベンチマークはほとんどが小規模・合成環境・短距離タスクに留まっており、都市スケールの複合的な空間推論を問うものがありませんでした。天候変動・道路閉鎖・歩行者群衆といった動的変化への対応も問われていませんでした。 ⚙️ 方法論 フレームワークは3層構成(地理空間層・シミュレーション層・エージェント層)で、エージェントは一人称視点映像とインタラクティブマップを入力として受け取ります。評価は5段階ラダーで段階的に複雑化します。 ・Level 1: 視覚認識・方向判断・能動的探索 ・Level 2: 短距離/長距離/指示付きナビゲーション ・Level 3: 説明文からの暗黙的目的地推論 ・Level 4: スケジューリング・経路最適化 ・Level 5: 道路閉鎖・歩行者への動的適応 📊 実験結果 視覚認識は77〜93%と比較的高い一方、方向判断は23〜58%と弱く、短距離ナビゲーション成功率〜70%が長距離ではほぼゼロに崩壊します。天候・照明変化でQA精度が5〜20ポイント低下し、歩行者との衝突率は全モデルで75%超でした。GPT-5.5とKimi-K3が最も強力でしたが、長距離・動的環境での失敗パターンはどのモデルも同様です。 核心的知見は「局所能力は広域探索に合成されない」こと。エージェントは目に見える範囲は適切に動けても、それを超えた空間状態の維持や無効ルートの計画修正ができないことが実証されました。 #MLLMs# #EmbodiedAI#
もっと見る
@rn_mllus というか、話してて思いましたが白ワンピースどこかできてた気がするなと思ったら公式でありました!! コラボカフェの衣装でした🥹既に正解が出されていました……!
もっと見る
ボドゲのプロ中のプロがわしの大好きな愛娘の フィロとソフィーを紹介してくれたああああああああ なんというありがたさ 本当に嬉しいいいいい
もっと見る
ファンクラブBlog更新🆙🍑⭐︎ 『うーか飯⭐︎自炊達人への道』 ↪︎ コメントは今度ファンクラブ内でのラジオ動画で読むよ〜♪コメント待ってます☺️ ほんっまにおいしかったこれだけ載せちゃお🍑 お母さんが送ってくれた桃で作りました🥰感謝
もっと見る
⚠︎cos 赤身かるび🥩  ︎︎ ︎︎ ︎︎🤍🥩おにくの国のお姫様🏰🤍 #karunyart# #いい肉の日#
『倫理的野心を持て あなたの才能を浪費せず、変化を起こすための10章』ルトガー・ブレグマン 野中香方子 | 単行本 - 文藝春秋 @hon_web  #老害 ##世代交代 ##才能の無駄遣い# #加速主義 # どうせAI失業・人件費ゼロ社会で、常識崩壊・インフラ刷新するし
もっと見る
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
もっと見る
コスプレ/cosplay ウマ娘 れいんチャンさんの方であげていただいたものの対のお写真です🫶 こちらもめっちゃ美脚に撮っていただきました🥹✨ サイレンススズカ:@rn_mllus マンハッタンカフェ:@matya120maro 📸:@tenpula 🏠:@studio_claris
もっと見る
コスプレ/cosplay ウマ娘 背中合わせで上から座りポーズを撮っていただきました🙌 スズカさんのお耳が押されてへにゃってなってるのめちゃくちゃ可愛くないですか?🥰 サイレンススズカ:@rn_mllus マンハッタンカフェ:@matya120maro 📸:@tenpula 🏠:@studio_claris
もっと見る