TL;DR: 「あなたが使うモデルは、事前学習されたモデルではない」。基盤モデルを役立つ行動方針に変えるポストトレーニングを、模倣→比較→探索→検証→転移→予期の6段階で一望できる87枚の講義デッキです。
タイトル: Post-Training LLMs(Kawin Ethayarajh, AI and Economics Summer Institute 2026)
URL:
ポイント
📝 SFT: デモを見せて模倣。計画やツール利用を含む軌跡全体を教えられるが、本質は模倣
⚖️ オフライン選好最適化: 勝ち負けの比較で学ぶ。DPOは報酬モデルを省略、KTOは結果単位で学びSFT不要
🎲 オンラインRL: 現方策が探索。REINFORCE/PPO/GRPO、報酬はほぼ系列単位
✅ RLVR: 報酬モデルをチェッカーに置換。二値の合否で十分、RLHFより予測可能にスケール
🧪 環境: RLはタスク+データ+インターフェース+テストのサンドボックス。ボトルネックは例から環境へ
🔁 On-Policy蒸留: 生徒の軌跡を教師が採点。RLの方策を7〜10倍少ないステップで複製
🌐 World Adaptation: 環境がエージェントに適応し返す。機械可読性を高める「メカ・ナッジ」
経済学の視点も織り込んだ、実務者に効く体系的な地図です。
#
LLM# #
PostTraining#