登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
281 フォロー中    421 ファン
ポストトレーニングは本当に新しい能力を生んでいるのでしょうか。それとも、もともとあった能力を研ぎ澄ましているだけなのでしょうか。 タイトル: Sharpening Tax in Post-Training URL: ❓ 何が意外な発見だったのですか? 軽量なハーネスを与えただけの事前学習済みベースモデルが、エージェントタスクをこなせてしまうことです。単発精度では遥かに劣りますが、試行回数を増やすと解の網羅性でポストトレーニング済みモデルを追い越します。gemma-4-31BのWebShopでは、ベースがpass@128で85%超に達したのに対し、RL版は56%でした。 💡 なぜそんなことが起きるのですか? ポストトレーニングがタスクを「常に解ける」と「決して解けない」の二極へ寄せてしまうからです。同じ設定で、追加試行が失敗を成功に変えうる中間層は87.6%から30.0%へ激減し、常に失敗する側は12.4%から44.0%へ増えました。試行を重ねても伸びしろが残っていないわけです。 ❓ Sharpening Taxとは何ですか? ベースモデルと比べてテスト時スケーラビリティがどれだけ失われたかを、1つの数値で表す診断指標です。42の組み合わせのうち36で正の値となり、モデルが大きいほど税は重くなります。しかも8回の試行から推定した値で、32回時点の税をスピアマン相関0.85という精度で予測できます。 💡 避けることはできるのですか? 完全には無理ですが、軽減はできます。提案手法PTGSは、プロンプトごとの難易度をベイズ推定し、難しいものは温度を上げて探索を促し、簡単なものは下げて一貫性を強めます。RLの損失には手を加えず追加計算も不要で、PPOとGRPOの両方で精度と網羅性を同時に改善しました。 #強化学習# #LLM#
もっと見る