登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 GRPO
GRPO コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
GRPO を含む検索結果
名古屋場所 十一日目 立浪部屋 上戸さん #立浪部屋#
【くらぶカルデア FGOラジオステーション】 本日も放送をお聴き頂きありがとうございました! アーカイブはこちら! ⇒ 明日の『Fate/Grand Order presents くらぶカルデア ライト版』も是非お聴きください! #くらぶカルデア# #FGOラジオ# #FGO#
もっと見る
アノテーションをRLの訓練シグナルとして使ったとき、なぜか優秀な行動に負の勾配がかかる —— OraRLはその仕組みを解明し、解決しました。 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs ❓ アノテーションをrolloutとして使うと何が起きる? 💡 「Advantage Inversion(有利性の反転)」が起きます。GRPOの標準正規化では、グループ内rolloutの有利性を平均と分散で計算します。ここに高報酬のoracle rolloutを追加するとグループ平均が上昇し、ポリシー平均を超えているはずの良い行動が負の有利性を受ける逆転現象が発生します。92,024件の計測で、Naive oracle mixingでは42.5%のグループで反転が起きていました。 ❓ OraRLはどう解決する? 💡 5つのコンポーネントで有利性推定を分離します。まずoracle-freeなon-policyベースラインを構築し(分散正規化なしで定義上inversion不可)、oracle-policy gapから方向性ゲインを計算してポリシー平均超えrolloutを増幅します。oracle自体の有利性は最強のon-policyシグナルでスケール調整し、ポリシー全体を支配しないよう設計。符号均衡Pruning(正・負を等分保持)により反転率を最終0.3%まで圧縮し、1.48倍の速度向上も実現しています。 ❓ どれくらい強い? 💡 Video-ORA-9BはVSI-Benchで73.1を達成し、GPT-5(55.0)とGemini-3-Pro(55.1)を18ポイント以上上回りました。ReasonVOSセグメンテーションはバックボーン比+42.2、VideoHolmesは+15.2と大幅改善。訓練コストはSFTの2.2倍で済み、GRPO+CoT(4.9倍)の半分以下です。 ❓ 推論の効率は? 💡 CoTが不要なためP90推論レイテンシは25.15秒で、CoT付きバックボーンの62.67秒と比べて大幅に短縮。データ効率でもOraRLは100kプロンプトで+5.2pt、GRPOの+2.8ptを上回ります。 #VideoMLLM# #ReinforcementLearning#
もっと見る
TL;DR: 「あなたが使うモデルは、事前学習されたモデルではない」。基盤モデルを役立つ行動方針に変えるポストトレーニングを、模倣→比較→探索→検証→転移→予期の6段階で一望できる87枚の講義デッキです。 タイトル: Post-Training LLMs(Kawin Ethayarajh, AI and Economics Summer Institute 2026) URL: ポイント 📝 SFT: デモを見せて模倣。計画やツール利用を含む軌跡全体を教えられるが、本質は模倣 ⚖️ オフライン選好最適化: 勝ち負けの比較で学ぶ。DPOは報酬モデルを省略、KTOは結果単位で学びSFT不要 🎲 オンラインRL: 現方策が探索。REINFORCE/PPO/GRPO、報酬はほぼ系列単位 ✅ RLVR: 報酬モデルをチェッカーに置換。二値の合否で十分、RLHFより予測可能にスケール 🧪 環境: RLはタスク+データ+インターフェース+テストのサンドボックス。ボトルネックは例から環境へ 🔁 On-Policy蒸留: 生徒の軌跡を教師が採点。RLの方策を7〜10倍少ないステップで複製 🌐 World Adaptation: 環境がエージェントに適応し返す。機械可読性を高める「メカ・ナッジ」 経済学の視点も織り込んだ、実務者に効く体系的な地図です。 #LLM# #PostTraining#
もっと見る
VLM(画像を見て言葉で答える大規模言語モデル)に専門ツールを使わせて学ばせたあと、使い方ごと本体に染み込ませてツールを手放せるようにする学習手法SpatialCLIが発表された(https://arxiv[.]org/html/2607.27703v1)。 VLMは「机の上で一番遠いクマのぬいぐるみはどれか」のような課題全体の理解は得意だが、実際の距離を正確に測るのは苦手。SAM 3(輪郭を切り出す専門モデル)やDepth Anything 3(奥行きを推定する専門モデル)は精密だが、どのクマを見ればいいかという文脈判断ができない。しかもこうした専門ツールは呼び出すたびに時間がかかり、学習時点の計測では1回あたり平均2.916秒だったという。 SpatialCLIの名前は、位置特定・輪郭抽出・奥行き・姿勢推定という4つの専門ツールをVLMに呼び出させるCall、お手本の成功例と強化学習(GRPO)でツールの選び方を磨くLearn、ツールを使って解けた過程を文章に変換しツールなしでも同じ結論に辿り着けるよう学習し直すInternalizeという3段階に由来する。ツールを使う学習と使わない学習を同時に行うため、ツールの使い方を忘れずに専門能力だけをモデル本体に取り込める。 新設した516問のベンチマークSpatialCLI-Benchは、フロンティアモデルのGPT-5.6 Solでも正答率48.8%にとどまる難問揃い。Qwen3-VL-8B(80億パラメータ)にSpatialCLIを適用すると、ツールなしで35.3%から72.7%、ツールありでは91.3%まで伸びた。視点を変えながら空間関係を捉える力を測る別のベンチマークMindCubeでも29.3%から84.6%(ツールあり)に達し、同じ条件のGPT-5.6 Sol(72.1%)を上回っている。 ツールを使わせて学ばせてから、学んだことを染み込ませて手放させる。この順番が、身体を持つAIが現実世界の空間を扱えるようになる道筋の一つになりそうだ。
もっと見る
MindLabとFudan大学が「LongStraw」という手法を発表した(https://arxiv[.]org/pdf/2607.14952)。GPUの台数を増やさずに、210万トークンを超える長い文脈で強化学習の事後学習(RL post-training、学習済みモデルをさらに強化学習で仕上げる工程)を回せるようにする実行方式。 背景にはギャップがある。推論(学習済みモデルを動かして応答を作る段階)のcontext長は100万トークン級に近づいているのに、事後学習は256Kトークン以下にとどまりがち。AIエージェントは観察結果やツールの出力、それまでの判断を溜め込みながら動くため、この差が特に効いてくる。 原因はGRPO(複数の応答をグループ内で相対比較して学習する強化学習の手法)特有の事情。同じ長いプロンプトに対して複数の応答をスコアリングし逆伝播する必要があるため、プロンプト分と応答分の計算グラフを同時にGPUメモリへ抱え込んでしまう。LongStrawは共有プロンプトを最初に1回だけ勾配計算なしで評価し、あとで必要になる状態だけを残す。そのうえで短い応答を1本ずつ勾配ありで組み立てては逆伝播後すぐ解放し、次の応答に進む。プロンプトと全応答を同時に抱えなくてよくなる代わりに、再生の分だけ処理時間は増える。 これを構造の異なる2つのモデルに実装している。再帰的に状態を更新する層(GDN)と通常のattention層を組み合わせたQwen3.6-27Bでは、8台のH20 GPUだけで約210万トークンの文脈をグループサイズ2および8で処理でき、グループサイズを2から8へ4倍にしてもピークメモリはわずか0.21GB(0.213%)しか増えない。別のストレステストでは約446万トークン(4,456,448)まで到達した。KV情報を圧縮して保持するMLAと、限られた候補だけに注意を絞る疎attention(DSA)を組み合わせ、専門家混合(MoE)も使うGLM-5.2でも、32台のH20 GPUで約210万トークンの文脈を全78層にわたって処理できることを確認している。 面白いのは「動いた」ことと「正しく学習できる」ことをはっきり切り分けて報告している点。プロンプト側の勾配はあえて切り離している。Qwenは複数GPU間で、注意機構の鍵と値にあたるK/Vに由来する勾配の同期が、追加学習パラメータ(LoRA)については完了していない。GLMも疎attentionの候補選択が各GPU内で閉じたままになっている。論文自身が、これは実行できたことの証拠であって正しい分散学習の証明ではないとはっきり書いていて、GPUを増やすスケールアウトの路線とは逆に、決まった台数でどこまで粘れるかを検証しつつ限界も隠さず書いている姿勢に好感が持てる。
もっと見る
TL;DR 質問を待たず、毎秒「黙る/話す/委譲する」を自分で決める8BのビジョンファーストVLM。監視・実況・翻訳など“タイミングが命”のタスクで、DoubaoやGeminiに人手評価で勝ち越しました👀 タイトル: JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence URL: ポイント 🟢 毎秒3値判断:(見守り)/(発話)/(背景処理へ委譲)をモデル内部で決める 🎞️ AdaCodecで予測符号化:シーン変化時だけフルViTトークン、間は約16トークンに圧縮し無限ストリームを処理 ⏱️ 時間認識:経過時間マーカー(例 <4.0 seconds>)と1Hzサンプリングで秒単位に応答を紐付け 🧠 記憶階層:短期100秒→中期500秒→長期7,500秒、vLLMプレフィックスキャッシュで2時間超もサブ秒 📊 学習:沈黙を第一級カテゴリ化、重み付きFT+GRPO(誤報や遅延を罰則化)、400万超の時刻整列クリップ 🏆 6シナリオ58ケースの人手評価で総合勝率 Doubao比77.6%/Gemini比87.9%、アラートは満点 ✨ 未学習の創発能力:画面変化のユーザー誘導やスライドからの即興プレゼンも観測 「いつ話すか」を外部トリガーでなくモデルの中に持たせる設計が、常時稼働の見守りプロダクトに効きそうだと感じます。 #マルチモーダル# #リアルタイムAI#
もっと見る
🎼 テキスト・画像・音声・動画が入り混じる難タスクを、専門サブエージェントに分解して並列で解く——巨大単体モデルより「適材適所のチーム」が勝つことを示した研究です。 タイトル: Orchestra-o1: Omnimodal Agent Orchestration URL: 💡 概要 Orchestra-o1は、複数モダリティが同時に絡むタスクを、高レベルのオーケストレーションと低レベルのツール実行に分離して解く階層型エージェント枠組みです。モダリティに応じてサブエージェントを専門化し、並列実行で効率を高めます。 ⚠️ 解決する課題 既存のオーケストレーションは扱えるモダリティが限られ、テキスト・画像・音声・動画が共存して相互作用するシナリオに汎化できませんでした。 🛠 方法論と提案手法 ・バックエンドを「スキルベクトル+コスト/レイテンシ」で表し、コスト考慮で選択 ・知覚系(画像/音声/動画解析)と行動系(検索/閲覧/コード実行)のツールを割り当て ・サブゴールの潜在依存グラフを作り独立タスクを並列実行 ・学習はDA-GRPO:最終回答でなくステップ単位を評価し、decision quality(0.6)を重視した多次元ルーブリック報酬で意思決定を整合 📊 実験結果(独自ベンチOmniGAIA) ・Orchestra-o1-GPT-5が72.8%で、2位のGemini-3-Proを10.3ポイント上回り最高 ・オープンソースのOrchestra-o1-8B(Qwen3-8Bベース)は30.0%でOSS最高 ・精度72.8%をコスト341.6で達成し、低精度な比較手法より安く高精度 ・難易度別はEasy80.3%/Medium75.0%/Hard56.4% #AIエージェント# #マルチモーダル#
もっと見る
特定のタスクでは、強化学習でファインチューニングしたSLMが、最新のLLMを上回っているよという内容。メモメモ。 ・Ramp社のデータによると、AI投資の上位企業は3年間で収益が2倍以上に成長 ・一方、AI支出がゼロの企業はわずか15%の成長にとどまっている ・成功している企業の共通点は、AIの知能を自社で所有していること ・その成功の定石となっているのが、オープンモデルと強化学習の組み合わせ ・最新モデルで作ったデータを用い、自社の業務プロセスを模した環境で学習させる ・BridgewaterやHarveyなども、この手法で最新モデルを上回る成果を出した ・筆者らはeコマースのカタログ審査タスクを用いて、この手法を実際に検証した ・約500ドルと数日のGPU稼働で、9BのオープンモデルをGRPOで強化学習 ・結果として、9Bのモデル(Qwen3.5)がGPT-5.5などの最新モデルのスコアを上回った ・品質だけでなく、推論コストの面でも圧倒的な差が生まれている ・最新モデルのAPIは1,000件の処理に34ドルのコストがかかる ・しかし、自社モデルなら同じ処理がわずか0.50ドルで済む ・大手eコマースの処理量で換算すると、年間5億ドルのコストが700万ドルになる計算 ・汎用モデルは毎回ゼロから背景を推論するため、プロンプトの指示には限界がある ・自社モデルなら、タスク固有の知識を重みとしてモデル内部に保持できる ・正誤の検証が可能で、かつ高頻度で実行されるタスクはファインチューニングが最適 ・ただ、まれにしか発生しないタスクは最新モデルのAPIを借りる方が適している
もっと見る
マサチューセッツ大学アマースト校とAdobe Researchの研究チームが、AIエージェントに検索ツールの使い分け方を強化学習で学ばせる手法「GRASP」を発表した(https://arxiv[.]org/html/2607.10463v1)。 LLM(大規模言語モデル)が自分で検索クエリを作り、結果を読み、必要なら再検索する「エージェント型RAG(検索拡張生成)」は、正しい文書を取得できてもハルシネーション(事実と異なる内容の生成)を起こすことがある。論文が挙げる例が象徴的で、「アルバム『Unapologetic』の歌手のボーカルが入ったエミネムのアルバムは?」という質問に、既存手法のSearch-R1(強化学習で検索を学習した先行手法)は検索結果に存在しない歌手名「Kelly Clarkson」を作り出して誤答してしまう。実際は「Unapologetic」はリアーナのアルバムで、リアーナが客演したエミネムの曲「The Monster」の収録アルバム「The Marshall Mathers LP 2」が正解になる。 GRASPはエージェントに意味検索・キーワード検索・段落読み込みという3つのツールを持たせ、GRPO(同じ質問への複数の試行結果を相対比較しながら方策を更新する強化学習の手法)でいつどれを使うかを学習させる。ベースモデルはパラメータ数3Bと比較的小型なQwen2.5-3B-Instruct。報酬は回答の正確さを土台に、正しい文書を読んでいるかを測る項目に最も重い比重0.7を置き、意味検索とキーワード検索の両方が正解文書を拾えているかと手数の効率にはそれぞれ軽めの0.15を配分している。 学習にはHotpotQAだけを使い、2WikiMultiHopQAとMuSiQueには追加学習なしで適用しているが、3つのベンチマーク全体で検索再現率・QA正解率(EM、生成した回答が正解文と完全一致した割合)ともに総合的に最も高い性能を示した。比較対象のIRCoTはGPT-5-miniに思考過程を生成させる手法で検索再現率は高いが、方策学習を伴わないためかQA正解率は伸び悩んでいる。HotpotQAでのGRASPのEMは0.53で、同じくRLで学習したSearch-R1(GRPO版)の0.45を上回った。 アブレーション実験(学習データを絞った専用の実験設定)では、段落読み込みツールを外すとEMが0.510から0.388まで落ちる。粗い粒度の検索結果だけでは、次にどこを検索すべきかの手がかりが薄まってしまうことを示している。 学習後のエージェントは、意味検索で広く探索し、有望な段落を読み込んで裏付けを取り、固有名詞が分かればキーワード検索で絞り込むという、人間の「拾い読み→精読→ピンポイント検索」に似た挙動を自発的に獲得していた。学習済みモデルは1問あたり平均8回程度のツール呼び出しに収束しており、闇雲な検索ではなく効率的な情報収集を学んでいる。
もっと見る