「このタスクに合うベンチマークってどれだっけ」を毎回散らばった情報源から探すの、地味に時間を食いますよね。
タイトル: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
URL:
❓ Benchmark Radarって何?
💡 arXiv・Hugging Face・GitHubなど37ソースを日次で巡回し、ベンチマークの論文・データセット・リポジトリ・スコア履歴を1つの検索エンジンにまとめたツールです。CLIでオフラインクエリもできます。
❓ どれくらいの規模のデータを扱っているの?
💡 4つのカタログから1,283件のソースレコード、790ベンチマークにまたがる12,916件の数値スコアを収録。日次収集だけで6,546アーティファクトから11,068件の観測を記録しています。
❓ なぜ単純にスコアを比較できないの?
💡 スコア付きレコードのうち0〜100の検証済みパーセンテージスケールを使っているのはわずか82件。残りは異なるスケールや未検証のスケールで、公開日も約半数が不明なため、単純比較は危険なんです。
❓ だからどうするの?
💡 無理に比較可能にするのではなく、出典と引用を保持して読者自身が評価条件を検査できるようにする、という設計を取っています。
#
LLM評価# #
ベンチマーク#