登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 RL-based
RL-based コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
RL-based を含む検索結果
@hayashirazan_RL @suimogumogu 了解!背景の人物を烈海王に変えて編集したよ。どうかな?
アノテーションをRLの訓練シグナルとして使ったとき、なぜか優秀な行動に負の勾配がかかる —— OraRLはその仕組みを解明し、解決しました。 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs ❓ アノテーションをrolloutとして使うと何が起きる? 💡 「Advantage Inversion(有利性の反転)」が起きます。GRPOの標準正規化では、グループ内rolloutの有利性を平均と分散で計算します。ここに高報酬のoracle rolloutを追加するとグループ平均が上昇し、ポリシー平均を超えているはずの良い行動が負の有利性を受ける逆転現象が発生します。92,024件の計測で、Naive oracle mixingでは42.5%のグループで反転が起きていました。 ❓ OraRLはどう解決する? 💡 5つのコンポーネントで有利性推定を分離します。まずoracle-freeなon-policyベースラインを構築し(分散正規化なしで定義上inversion不可)、oracle-policy gapから方向性ゲインを計算してポリシー平均超えrolloutを増幅します。oracle自体の有利性は最強のon-policyシグナルでスケール調整し、ポリシー全体を支配しないよう設計。符号均衡Pruning(正・負を等分保持)により反転率を最終0.3%まで圧縮し、1.48倍の速度向上も実現しています。 ❓ どれくらい強い? 💡 Video-ORA-9BはVSI-Benchで73.1を達成し、GPT-5(55.0)とGemini-3-Pro(55.1)を18ポイント以上上回りました。ReasonVOSセグメンテーションはバックボーン比+42.2、VideoHolmesは+15.2と大幅改善。訓練コストはSFTの2.2倍で済み、GRPO+CoT(4.9倍)の半分以下です。 ❓ 推論の効率は? 💡 CoTが不要なためP90推論レイテンシは25.15秒で、CoT付きバックボーンの62.67秒と比べて大幅に短縮。データ効率でもOraRLは100kプロンプトで+5.2pt、GRPOの+2.8ptを上回ります。 #VideoMLLM# #ReinforcementLearning#
もっと見る
両面RLやっぱりあったのか、、これはA面🥲
🔎 検索エージェントのRL学習が途中で伸びなくなる、その隠れた原因を突き止めた論文です。 タイトル: Harness-G: A Graph-Structured Harness for Search Agents URL: ❓ なぜ学習が崩壊するの? 💡 「検索等価性崩壊」が原因です。文字列は違うのに同じ証拠しか引かないクエリばかりになり、同じ証拠→同じ回答→同じ報酬でグループ内のアドバンテージが消え、学習信号が枯れてしまいます。 ❓ Harness-Gはどう解決するの? 💡 クエリを自由記述させるのをやめ、コーパスから作った段落-文-エンティティのグラフ上で「メニュー選択」に変えます。ポリシーは文字列でなく行動IDを選ぶだけ。有限・検証可能・先読み可能なので、検索結果の多様性が保たれます。 ❓ 信用割当(SNC)とは? 💡 凍結した回答器で「その行動が正解確率をどれだけ上げるか」を先読みし、他の候補との差で評価します(フロンティア相対)。さらに「先に橋渡しエンティティを見つける」ような後で効く一手を来歴を辿って後方伝播(イネーブルメント)。追加ロールアウト不要です。 ❓ 効果は? 💡 6つのQAでGraph-R1を1.5Bで+10.74、3Bで+3.98上回り両スケール最高。マルチホップで特に強く、グラフ構築はAPIコスト$0です。 #検索エージェント# #強化学習#
もっと見る
すごいな システムプロンプト側の工夫とハーネスに特化させるRLだけで6倍以上の費用対効果が生まれるのか...
QTC! ハムフェア会場から、すべてのイベントRL局(JA1RL~JR0RL、JR6RL)の記念運用が行われます。→【ハムフェア2026】<145/435MHz帯に出られる無線機を持ってハムフェアに参加しよう>緊急告知! JARL創立100周年記念イベント局・JA1RL~JA0RLとJR6RLの記念運用が決定
もっと見る
TL;DR: Issueやコミット履歴を使わず「ソースコードそのもの」だけから、コーディングエージェント用のRL訓練タスクを5,545件も自動生成するパイプラインが登場しました。しかも量より質を優先した設計です。 タイトル: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself URL: ポイント 🏗️ 3,185リポジトリ・23言語・15ドメインから5,545タスクを自動構築 🧪 リファレンス実装を実行して期待値を記録する「実行に基づくテスト」で検証器を自動生成 🛡️ リーク検査・解答一致確認・難易度フィルタの3段構えで環境の質を保証 📈 DeepSWEで+11.7pt、ProgramBenchで+17.0pt、Terminal-Benchで+8.5ptと大幅改善 🔍 フィルタ済み5kタスクがフィルタなし8kタスクを一貫して上回り「質が量に勝る」ことを実証 🧠 訓練後は探索・自己検証の頻度が増加し、外部ベンチマークにもその挙動が転移 開発履歴がなくても、コードさえあればRL訓練環境を作れるという発想がシンプルで実用的だと感じました。 #CodingAgent# #強化学習#
もっと見る
MindLabとFudan大学が「LongStraw」という手法を発表した(https://arxiv[.]org/pdf/2607.14952)。GPUの台数を増やさずに、210万トークンを超える長い文脈で強化学習の事後学習(RL post-training、学習済みモデルをさらに強化学習で仕上げる工程)を回せるようにする実行方式。 背景にはギャップがある。推論(学習済みモデルを動かして応答を作る段階)のcontext長は100万トークン級に近づいているのに、事後学習は256Kトークン以下にとどまりがち。AIエージェントは観察結果やツールの出力、それまでの判断を溜め込みながら動くため、この差が特に効いてくる。 原因はGRPO(複数の応答をグループ内で相対比較して学習する強化学習の手法)特有の事情。同じ長いプロンプトに対して複数の応答をスコアリングし逆伝播する必要があるため、プロンプト分と応答分の計算グラフを同時にGPUメモリへ抱え込んでしまう。LongStrawは共有プロンプトを最初に1回だけ勾配計算なしで評価し、あとで必要になる状態だけを残す。そのうえで短い応答を1本ずつ勾配ありで組み立てては逆伝播後すぐ解放し、次の応答に進む。プロンプトと全応答を同時に抱えなくてよくなる代わりに、再生の分だけ処理時間は増える。 これを構造の異なる2つのモデルに実装している。再帰的に状態を更新する層(GDN)と通常のattention層を組み合わせたQwen3.6-27Bでは、8台のH20 GPUだけで約210万トークンの文脈をグループサイズ2および8で処理でき、グループサイズを2から8へ4倍にしてもピークメモリはわずか0.21GB(0.213%)しか増えない。別のストレステストでは約446万トークン(4,456,448)まで到達した。KV情報を圧縮して保持するMLAと、限られた候補だけに注意を絞る疎attention(DSA)を組み合わせ、専門家混合(MoE)も使うGLM-5.2でも、32台のH20 GPUで約210万トークンの文脈を全78層にわたって処理できることを確認している。 面白いのは「動いた」ことと「正しく学習できる」ことをはっきり切り分けて報告している点。プロンプト側の勾配はあえて切り離している。Qwenは複数GPU間で、注意機構の鍵と値にあたるK/Vに由来する勾配の同期が、追加学習パラメータ(LoRA)については完了していない。GLMも疎attentionの候補選択が各GPU内で閉じたままになっている。論文自身が、これは実行できたことの証拠であって正しい分散学習の証明ではないとはっきり書いていて、GPUを増やすスケールアウトの路線とは逆に、決まった台数でどこまで粘れるかを検証しつつ限界も隠さず書いている姿勢に好感が持てる。
もっと見る
【NIKKE紹介】 ミント(Mint) ✔️制作会社:テトラライン ✔️所属部隊:T.T. STAR ✔️使用武器:RL コイリースター 気弱そうに見えて、誰よりも芯が強い。 歌とダンスだけじゃ、アイドルとしての夢は掴めないことを理解している。 夢へ向かって努力を重ねながらも、本音を胸に隠したまま、今日もステージに立ち続ける。 ◆高画質版 #NIKKE# #ニケ#
もっと見る