登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ReinforcementLearning
ReinforcementLearning コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ReinforcementLearning を含む検索結果
🎬 蒸留された自己回帰の動画モデルは速い一方で、人間の好みからズレがちです。再蒸留も逆プロセスの展開も使わず、「順プロセス」で強化学習アラインメントを行うAstrolabeが、その難題に答えます。 タイトル: Astrolabe: Steering Forward-Process Reinforcement Learning URL: 📝 概要 Astrolabeは、蒸留された自己回帰(AR)動画モデルを人間の視覚的な好みに整合させる強化学習フレームワークです。最大の特徴は、従来の逆プロセス最適化ではなく、順プロセス(forward-process)でRLを行う点にあります。全53ページ・37図の大規模な研究です。 ❓ 解決する課題 蒸留AR動画モデルは効率的なストリーミング生成に向く一方、人間の好みと乖離しやすいという弱点があります。さらに既存のRLは、こうしたアーキテクチャに自然には合いません。一般に、高コストな再蒸留か、ソルバー結合の逆プロセス最適化のいずれかを必要とし、どちらも重くスケールしにくいものでした。 💡 方法論と提案手法 3つの工夫から成ります。 ・負例認識の微調整:推論の終端で正例と負例を対比させ、逆プロセスを展開せずに、暗黙的なポリシー改善の方向を確立します ・ストリーミング学習:ローリングKVキャッシュでシーケンスを段階的に生成し、RL更新は局所的なクリップウィンドウにのみ適用、長距離の一貫性は先行コンテキストへの条件付けで維持します ・複数報酬の目的関数:不確実性を考慮した選択的正則化と動的な参照更新を統合し、報酬ハッキング(見かけのスコアだけ上げる崩壊)を緩和します 🎯 ユースケース リアルタイム・ストリーミングな動画生成で、効率的な蒸留モデルを速さを保ったまま好みへ整合させたい場面に向きます。複数の蒸留AR動画モデルに適用でき、推論の軽さを犠牲にせずに品質を底上げできます。 📊 意義と結果 ・再蒸留や逆プロセス展開という重い経路を避けることで、計算効率のボトルネックに対処します ・順プロセスでの負例認識・ストリーミング更新・報酬ハッキング対策を組み合わせ、堅牢でスケーラブルなアラインメント解を提供します ・複数の蒸留ARモデルにわたって有効性が示され、詳細な定量評価とアブレーションを含みます #VideoGeneration# #ReinforcementLearning#
もっと見る
『The Little Book of Reinforcement Learning』という強化学習の入門書リポジトリ。 リポジトリ内で書籍のPDFデータ本体が公開されている。モンテカルロ法からPPOまで、実際に動かせるコードが用意されている。
もっと見る
🎯 LLMの強化学習で当たり前に使われてきたPPOの「固定クリッピング」、実は探索の多様性を密かに潰していたかもしれません。その弱点を理論的に解消する新手法が登場しました。 タイトル: BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning URL: 🔍 概要 BandPOは、PPOの比率クリッピングを「Band」という統一オペレータに置き換える手法です。f-ダイバージェンスで定義された信頼領域を、確率を考慮した動的なクリッピング区間へと射影することで、行動の確率に応じて境界が適応的に変化します。 ❓ 解決する課題 PPOの固定クリッピング境界には構造的な弱点がありました。 ・低確率の行動(トークン)の上方向への更新幅を過度に制約してしまう ・本来は高いアドバンテージを持つ「テール戦略」が押し潰される ・探索が痩せ細り、方策が早期に決定論化するエントロピー崩壊を招く 一律の固定境界が、探索と活用のバランスを崩していたのです。 💡 方法論と提案手法 BandPOは、信頼領域からクリッピング区間への写像を凸最適化問題として定式化し、大域的に最適な解が得られることを保証します。 ・特定のダイバージェンスでは閉形式解を導出し、計算上も扱いやすい ・低確率かつ高アドバンテージな行動には制約を緩め、適切に更新できるようにする PPOの比率クリッピングとTRPO系の信頼領域という2つの系譜を、確率を考慮した境界で橋渡ししている点が新しいところです。 🎯 ユースケース RLHFやRLVRといったLLMの強化学習全般で、学習の安定性を保ちつつ探索の多様性を維持したい場面に有効です。エントロピー崩壊に悩まされてきた既存のPPOパイプラインの置き換え先として実用的です。 📊 実験結果 多様なモデルとデータセットにわたり、標準的なクリッピングおよびClip-Higherを一貫して上回る性能を示しました。さらに、エントロピー崩壊を頑健に緩和し、学習を通じて方策の多様性を維持できることが確認されています。コードはOpenMOSS/BandPOで公開されています。 #強化学習# #LLM#
もっと見る
Sakana AI CEOの David Ha(@hardmaru)が、Tim Romero 氏のポッドキャスト Disrupting Japan Podcast に出演しました。 日本におけるAIの未来は、米国や中国とは少し違った形を取り得るのか。Sakana AIの内側から何が見えているのか。そうしたテーマで、長めの対談を行っています。 Davidは、Sakana AI の事業展開戦略、メガバンクとの取り組みがPoCから本番運用へと進みつつある現状、巨大なフロンティアモデル一つに依存するよりも複数のモデルを束ねるオーケストレーションのほうが長期的には合理的であるという見方、そして実務における「AI主権」とはスタック全体を自前で所有することではなく、グローバルなサプライチェーンの中で、AIを国内で開発・適応・運用していく能力を確保することだと、Davidは語りました。 対話のなかでは、当社の研究成果やプロダクトにも多く触れました。Sakana Fuguは、強化学習で訓練したオーケストレーションモデルで、複数ステップのタスクを多様なLLMに振り分けます。Namazuは、日本の知識や価値観を反映するようにポストトレーニングを施した、オープンウェイトモデルのシリーズです。東京のRSI Labは、The AI Scientistから続く取り組みとして、再帰的自己改善とAIによる科学的発見を専門に扱う研究組織です。共同創業者のLlion Jonesは、Transformerそのものを超えるアーキテクチャの探求という、より長期的な目標を追い続けています。 最後に「日本について一つだけ変えられるとしたら」と問われたDavidの答えは、「希望(hope)」でした。 「皆が集団として希望を感じていることが必要だと思います。その希望こそが、物事を動かしていく。日本に希望をもたらすのは何でしょうか。お金でしょうか。減税でしょうか。社会保障の充実でしょうか。おそらく、そのどれでもないはずです。もし魔法の杖を一本持てるとしたら、日本の人々が未来をもっと楽観的に捉えられるようにしたい。希望によって変化が起こり、その変化がさらなる希望をもたらすのではないでしょうか。」 ⸻⸻⸻⸻⸻⸻ Our CEO David Ha joined Tim Romero on Disrupting Japan Podcast for a long conversation on how the future of AI may take a different shape in Japan than in the U.S. or China, and on what that looks like from inside Sakana AI. David walks through Sakana AI’s go-to-market strategy, how Japanese megabanks have moved real AI workflows from proof-of-concept into production, why orchestration across many models is likely to win out over a single massive frontier model, and what sovereign AI actually means in practice: not owning the entire stack, but having the capability to develop, adapt, and run AI domestically as part of a global supply chain. The conversation also covers the research directions behind the company. Sakana Fugu is our orchestration model, trained with reinforcement learning to route multi-step tasks across a variety of underlying LLMs. Namazu is our line of post-trained open-weight models tuned to reflect Japanese knowledge and values. The RSI Lab in Tokyo is dedicated to recursive self-improvement and AI-driven scientific discovery, continuing the work that began with The AI Scientist. And our co-founder Llion Jones keeps pushing on a longer-horizon goal of moving beyond the Transformer architecture itself. Asked at the end what one thing he would change about Japan, David’s answer was “hope.” “To really move the needle in terms of innovation, like the era in Japan when you have companies like Sony or Panasonic come out, there are a few factors. One is that the nation needs to have a collective sense of hope. A nation needs to feel hopeful. It could be poor. Everyone can be dirt poor, but they have hope. And that hope leads to things being done. So, what creates hope in Japan? Is it more money? Is it less taxes? Or is it more benefits? Probably not. I think it’s stories and narratives. If I have a magic wand, if the population in Japan is more optimistic about the future of this country, suddenly they’re persuaded, to be more optimistic. People should be optimistic. With optimism comes change. And change leads to more optimism.” Listen to the full episode: 🎏
もっと見る
IROS2026はJournal Transferを加えて、以下の5件を発表します。#IROS2026# 1. A. Mustafa, R. Hanai, I. G. Ramirez-Alpizar, F. Marc Arden Erich, R. Nakajo, Y. Domae, and T. Ogata: ForceMapping: learning visual-force features from vision for soft objects manipulation 2. A. Mustafa, R. Hanai, I. G. Ramirez-Alpizar, F. Marc Arden Erich, R. Nakajo, Y. Domae, and T. Ogata: Non-Prehensile Throwing: A Reinforcement Learning Perspective 3. S. Fujita, H. Ichiwara, S. Sugano, and T. Ogata: Energy-Score Stabilized Attentive Mixture-Density Policy: A Lightweight Approach to Multimodal Robot Motion 4. X. Cai, H. Ichiwara, H. Hiruma, M. Yoshikawa, H. Ito, and T. Ogata: Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances 5. T. Tsukakoshi, T. Miyake, T. Ogata, Y. Wang, T. Akaishi, and S. Sugano: Close-Fitting Dressing Assistance Based on State Estimation of Feet and Garments with Semantic-based Visual Attention
もっと見る