🔎 検索エージェントのRL学習が途中で伸びなくなる、その隠れた原因を突き止めた論文です。
タイトル: Harness-G: A Graph-Structured Harness for Search Agents
URL:
❓ なぜ学習が崩壊するの?
💡 「検索等価性崩壊」が原因です。文字列は違うのに同じ証拠しか引かないクエリばかりになり、同じ証拠→同じ回答→同じ報酬でグループ内のアドバンテージが消え、学習信号が枯れてしまいます。
❓ Harness-Gはどう解決するの?
💡 クエリを自由記述させるのをやめ、コーパスから作った段落-文-エンティティのグラフ上で「メニュー選択」に変えます。ポリシーは文字列でなく行動IDを選ぶだけ。有限・検証可能・先読み可能なので、検索結果の多様性が保たれます。
❓ 信用割当(SNC)とは?
💡 凍結した回答器で「その行動が正解確率をどれだけ上げるか」を先読みし、他の候補との差で評価します(フロンティア相対)。さらに「先に橋渡しエンティティを見つける」ような後で効く一手を来歴を辿って後方伝播(イネーブルメント)。追加ロールアウト不要です。
❓ 効果は?
💡 6つのQAでGraph-R1を1.5Bで+10.74、3Bで+3.98上回り両スケール最高。マルチホップで特に強く、グラフ構築はAPIコスト$0です。
#
検索エージェント# #
強化学習#