ポストトレーニングは本当に新しい能力を生んでいるのでしょうか。それとも、もともとあった能力を研ぎ澄ましているだけなのでしょうか。
タイトル: Sharpening Tax in Post-Training
URL:
❓ 何が意外な発見だったのですか?
軽量なハーネスを与えただけの事前学習済みベースモデルが、エージェントタスクをこなせてしまうことです。単発精度では遥かに劣りますが、試行回数を増やすと解の網羅性でポストトレーニング済みモデルを追い越します。gemma-4-31BのWebShopでは、ベースがpass
@128で85%超に達したのに対し、RL版は56%でした。
💡 なぜそんなことが起きるのですか?
ポストトレーニングがタスクを「常に解ける」と「決して解けない」の二極へ寄せてしまうからです。同じ設定で、追加試行が失敗を成功に変えうる中間層は87.6%から30.0%へ激減し、常に失敗する側は12.4%から44.0%へ増えました。試行を重ねても伸びしろが残っていないわけです。
❓ Sharpening Taxとは何ですか?
ベースモデルと比べてテスト時スケーラビリティがどれだけ失われたかを、1つの数値で表す診断指標です。42の組み合わせのうち36で正の値となり、モデルが大きいほど税は重くなります。しかも8回の試行から推定した値で、32回時点の税をスピアマン相関0.85という精度で予測できます。
💡 避けることはできるのですか?
完全には無理ですが、軽減はできます。提案手法PTGSは、プロンプトごとの難易度をベイズ推定し、難しいものは温度を上げて探索を促し、簡単なものは下げて一貫性を強めます。RLの損失には手を加えず追加計算も不要で、PPOとGRPOの両方で精度と網羅性を同時に改善しました。
#
強化学習# #
LLM#