註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
270 正在關注    316 粉絲
TL;DR: 「あなたが使うモデルは、事前学習されたモデルではない」。基盤モデルを役立つ行動方針に変えるポストトレーニングを、模倣→比較→探索→検証→転移→予期の6段階で一望できる87枚の講義デッキです。 タイトル: Post-Training LLMs(Kawin Ethayarajh, AI and Economics Summer Institute 2026) URL: ポイント 📝 SFT: デモを見せて模倣。計画やツール利用を含む軌跡全体を教えられるが、本質は模倣 ⚖️ オフライン選好最適化: 勝ち負けの比較で学ぶ。DPOは報酬モデルを省略、KTOは結果単位で学びSFT不要 🎲 オンラインRL: 現方策が探索。REINFORCE/PPO/GRPO、報酬はほぼ系列単位 ✅ RLVR: 報酬モデルをチェッカーに置換。二値の合否で十分、RLHFより予測可能にスケール 🧪 環境: RLはタスク+データ+インターフェース+テストのサンドボックス。ボトルネックは例から環境へ 🔁 On-Policy蒸留: 生徒の軌跡を教師が採点。RLの方策を7〜10倍少ないステップで複製 🌐 World Adaptation: 環境がエージェントに適応し返す。機械可読性を高める「メカ・ナッジ」 経済学の視点も織り込んだ、実務者に効く体系的な地図です。 #LLM# #PostTraining#
顯示更多