TL;DR エージェント評価の判定器をLLMからJevという専用モデルに変えるだけで、精度100%・コスト80分の1以下という結果が出たそうです。
タイトル: Jev-as-a-Judge for Agent Evals
URL:
ポイント
⚖️ コードベース評価は決定論的すぎ、LLM-as-a-Judgeは非決定論的すぎるという板挟みへの解決策として提案されています
🎯 500回繰り返した判定でJevの一致率は100%、比較対象のClaudeは80.0%にとどまりました
📉 品質スコアの分散もJevが最小で、他の判定器は最大913倍もばらつきが大きかったそうです
💰 5リクエストの評価コストはJevが0.34ドル、Claudeは28.17ドルと桁違いの差がありました
⚡ 平均応答時間はわずか0.44秒で、判定の高速性も際立っています
🔍 コードベース評価とLLM-as-a-Judgeに続く「第3の評価形態」として位置づけられています
低コストで判定を繰り返し実行できるようになると、エージェント開発のフィードバックループそのものが変わりそうです。
#
AIエージェント評価# #
LangChain#