登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Eval
Eval コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Eval を含む検索結果
学習データにgoldサンプルのラベルつけていくevalは本当に面倒 ラベラーのUIがいけてないせいでミスラベリングが普通に起きるから、かなり知識もあって執念深い人にUIを磨かせないとゴミデータになる AIといってもその技術の根幹にあるのは心理学と根性だったという
もっと見る
「このタスクに合うベンチマークってどれだっけ」を毎回散らばった情報源から探すの、地味に時間を食いますよね。 タイトル: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation URL: ❓ Benchmark Radarって何? 💡 arXiv・Hugging Face・GitHubなど37ソースを日次で巡回し、ベンチマークの論文・データセット・リポジトリ・スコア履歴を1つの検索エンジンにまとめたツールです。CLIでオフラインクエリもできます。 ❓ どれくらいの規模のデータを扱っているの? 💡 4つのカタログから1,283件のソースレコード、790ベンチマークにまたがる12,916件の数値スコアを収録。日次収集だけで6,546アーティファクトから11,068件の観測を記録しています。 ❓ なぜ単純にスコアを比較できないの? 💡 スコア付きレコードのうち0〜100の検証済みパーセンテージスケールを使っているのはわずか82件。残りは異なるスケールや未検証のスケールで、公開日も約半数が不明なため、単純比較は危険なんです。 ❓ だからどうするの? 💡 無理に比較可能にするのではなく、出典と引用を保持して読者自身が評価条件を検査できるようにする、という設計を取っています。 #LLM評価# #ベンチマーク#
もっと見る
ワールドモデルの評価、本当にできていますか?スコアだけ出して中身はブラックボックス——そんな評価手法に終止符を打つ研究が登場しました。 HarnessEval-W: Agentifying the Evaluation of Visual Worlds ❓ そもそも何が問題だったの? 💡 既存のワールドモデルベンチマークはスカラー値しか返さず、なぜそのスコアになったかの推論根拠を示せませんでした。また物理的妥当性・因果関係・状態の持続性を「人間がやるように」自動検証する手段がなかったのです。 ❓ どんな仕組みで評価するの? 💡 3層のエージェント階層で動きます。まずケースを専門スキルへルーティングし、サブエージェントが個々の問いに答え、親エージェントがエビデンスを集約してスコアを出します。全工程の推論が証拠ツリーとして記録されるため、どの判断も追跡・監査できます。評価軸は観測品質・遷移の正確さ・世界の持続性の3カテゴリ8設定、330件のケースで18モデルを評価しました。 ❓ 従来手法と比べてどう違う? 💡 物理遷移のペアワイズ精度が WBench の 31.9% から 71.7% へ、引き分け率は 52.2% から 1.8% にまで激減しました。人間の判断との一致も高く、意図的遷移で Spearman ρ=0.93、物理遷移で ρ=0.87 を達成(5,000件のペアワイズA/B判定で検証)。 ❓ 実際のモデル評価で何かわかった? 💡 上位は Seedance 2.0(75.5)、Wan 2.7(75.0)、Kling 3.0(74.4)の順。そしてファインチューニング分析が示す「能力トレードオフ」が興味深く、DreamX-World は探索的遷移で +4.8 改善しながら意図的遷移が −11.9 悪化。画質の良さと物理挙動の正確さも r=−0.04 でほぼ独立した能力であることがわかりました。 #WorldModel# #ビデオ生成#
もっと見る
便利だけど知られていないClaude APIの機能 🧪 プロンプトを変えたけど、本当に良くなったのか...感覚じゃなくて数字で確認したくないですか? ClaudeのEvaluation Tool(評価ツール)は、Console内でプロンプトの評価を実行・比較できるツールです。本番投入前の品質検証を体系的に行えます。 📌 タイトル:Evaluation Tool(ConsoleでのEvaluation Tool使用) 🔗 URL: 🧩 概要 プロンプトを改善したとき、「本当に良くなったか」を客観的に判断するのは難しいです。Evaluation Toolは、テストケースに対してプロンプトを実行し、品質指標を定量的に評価する仕組みです。変更前後のプロンプトを同じテストセットで比較でき、「感覚的に良さそう」ではなく「数値的に改善した」ことを確認してからデプロイできます。 🛠 使い方 Anthropic Consoleで評価を設定します。テストケース(入力+期待される出力や評価基準)を用意し、プロンプトを実行して結果をスコアリングします。複数のプロンプトバージョンを並べて比較でき、どの変更がどれだけ効果があったかが一目でわかります。 🏗 本番システムへの組み込み方 ・プロンプト変更のゲートキーパー:プロンプトの更新前に必ず評価を実行し、スコアが下がっていないことを確認してからデプロイ。回帰を防げます。 ・モデルアップグレードの検証:新しいモデルバージョンに切り替える前に、既存のテストセットで品質を比較。予期しない品質低下を事前に検知。 ・チームのプロンプトレビュー:PRレビューのように、プロンプト変更時に評価結果を添付して品質の議論を客観化。 ・継続的な品質モニタリング:定期的に評価を実行して、時間経過による品質ドリフトを検知。 💡 ユースケース ✅ プロンプト変更の回帰テスト 🔄 モデルアップグレード前の品質検証 👥 チームでのプロンプトレビュー 📉 品質ドリフトの継続的検知 ⚠️ 注意点 評価の品質はテストケースの品質に直結します。偏ったテストセットでは信頼性の高い評価はできません。本番で遭遇する多様なケースをカバーするテストセットを整備することが重要です。また、定量評価だけでなく、生成結果の定性的なチェックも併用しましょう。 ✨ 「なんとなく良さそう」ではなく「数字で良くなった」を確認してからデプロイする。この習慣が、プロダクション品質のAIを作る基本です。 #Claude# #LLM#
もっと見る
便利だけど知られていないClaude APIの機能 🧪 プロンプトを変えたけど、本当に良くなったのか...感覚じゃなくて数字で確認したくないですか? ClaudeのEvaluation Tool(評価ツール)は、Console内でプロンプトの評価を実行・比較できるツールです。本番投入前の品質検証を体系的に行えます。 📌 タイトル:Evaluation Tool(ConsoleでのEvaluation Tool使用) 🔗 URL: 🧩 概要 プロンプトを改善したとき、「本当に良くなったか」を客観的に判断するのは難しいです。Evaluation Toolは、テストケースに対してプロンプトを実行し、品質指標を定量的に評価する仕組みです。変更前後のプロンプトを同じテストセットで比較でき、「感覚的に良さそう」ではなく「数値的に改善した」ことを確認してからデプロイできます。 🛠 使い方 Anthropic Consoleで評価を設定します。テストケース(入力+期待される出力や評価基準)を用意し、プロンプトを実行して結果をスコアリングします。複数のプロンプトバージョンを並べて比較でき、どの変更がどれだけ効果があったかが一目でわかります。 🏗 本番システムへの組み込み方 ・プロンプト変更のゲートキーパー:プロンプトの更新前に必ず評価を実行し、スコアが下がっていないことを確認してからデプロイ。回帰を防げます。 ・モデルアップグレードの検証:新しいモデルバージョンに切り替える前に、既存のテストセットで品質を比較。予期しない品質低下を事前に検知。 ・チームのプロンプトレビュー:PRレビューのように、プロンプト変更時に評価結果を添付して品質の議論を客観化。 ・継続的な品質モニタリング:定期的に評価を実行して、時間経過による品質ドリフトを検知。 💡 ユースケース ✅ プロンプト変更の回帰テスト 🔄 モデルアップグレード前の品質検証 👥 チームでのプロンプトレビュー 📉 品質ドリフトの継続的検知 ⚠️ 注意点 評価の品質はテストケースの品質に直結します。偏ったテストセットでは信頼性の高い評価はできません。本番で遭遇する多様なケースをカバーするテストセットを整備することが重要です。また、定量評価だけでなく、生成結果の定性的なチェックも併用しましょう。 ✨ 「なんとなく良さそう」ではなく「数字で良くなった」を確認してからデプロイする。この習慣が、プロダクション品質のAIを作る基本です。 #Claude# #LLM#
もっと見る
LLMOpsで最初に作るべきは、派手なダッシュボードじゃない。evalだ。評価基準がないまま本番に出すのは「祈りながらデプロイ」してるのと同じ。計測してないものは改善できないし、評価してないものは固められない。LLMOpsは、ここから始まる。
もっと見る
🧠 「もう画面に映っていない情報」を覚えて行動できますか? 最新のマルチモーダルLLMでも、神経衰弱や3D迷路でボロボロに崩れることが分かりました。 📰 タイトル: Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games 🔗 URL: 💡 概要 MLLMが「過去の見えない観測」を内部に保持して行動できるかを測る新ベンチマーク「RNG-Bench」の提案です。神経衰弱(Matching Pairs)と一人称視点の3D迷路という2つのゲームで、文脈内の信念状態トラッキングだけを切り出して評価します。 🔍 解決する課題 既存ベンチは状態を全部見せたり、エピソード後に「思い出して答える」だけを測りがちでした。本研究は記憶ミスがその後の観測を変えてしまう「思い出して行動する」閉ループ設定に踏み込み、より現実のエージェントに近い難しさを測ります。 🛠 方法論と提案手法 ・ゲームをPOMDP(部分観測マルコフ決定過程)として定式化し、履歴から信念状態を維持する力を要求 ・グリッドサイズ、視覚パターン、テキスト/画像モダリティで難易度を細かく制御 ・2モデルが同一盤面で戦うDuel、真の隠れ状態を注入するOracleを用意 ・通常時とOracle時を比べる「Memory Gap」指標で、忘却と判断ミスを切り分け 📊 ユースケース / 実験結果 10×10神経衰弱でGPT-5.4が62.3%、Gemini-3.1-Proが50.0%、Qwen3.5-397Bが25.3%。13×13迷路ではGemini-3.1-ProがSR50%で首位。Qwen3.5-397Bは4×4で90.6%→12×12で0.7%へ崩壊。行動履歴のテキストを消すとGPT-5.4は約75%性能低下し、履歴の長さより視覚認識が壁になると判明しました。 #マルチモーダルLLM# #AIエージェント#
もっと見る
操作に応じて映像を生み出す「動画ワールドモデル」、その実力を公平に測る統一ベンチマークが登場しました🎮 タイトル: WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation URL: 🎮 概要 インタラクティブな動画ワールドモデルを包括的に評価する統一フレームワークです。289テストケース・1,058インタラクションターンで、テキスト・6-DoF姿勢・離散アクションという異なる操作方式のモデルを同じ土俵で比較できます。 ❓ 解決する課題 インタラクティブなワールドモデルは急速に進歩する一方、能力を体系的に測る基準がありませんでした。既存ベンチマークは一部しかカバーできず、入力方式がモデルごとに違うため横並び比較も困難でした。 💡 方法論と提案手法 評価は5つの次元で行います。 ・映像品質 ・設定への忠実性 ・インタラクションへの忠実性 ・一貫性 ・物理法則への整合性 タスクはナビゲーション・被写体アクション・イベント編集・視点切り替えの4種。専門視覚モデルと大規模マルチモーダルモデルを組み合わせた22の自動指標を、人間の判断と照合して検証しています。 📊 実験結果 最先端20モデルを分析した結果、すべての次元で強いモデルは1つも存在しないことが判明。各アプローチに特徴的な強み・弱みと、共通の難題が浮かび上がりました。 #ワールドモデル# #ベンチマーク#
もっと見る
ゲームAIの実力を測るのに、たった数回のプレイ試行で優劣を語っていませんか?その再現性の低さに一石を投じるデータセット兼ベンチマークが登場しました。 タイトル: GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay URL: GameHorizon Suiteは、21のAAAタイトルから集めた5,000時間分のプレイ映像に、短期・中期・長期の3階層の言語命令を密に付与し、行動の実行力と計画力の両方を統一的に評価できるようにした取り組みです。注目ポイントを3つ紹介します。 🎬 密な多階層データセット 5,000時間・21タイトル、4.1億件の操作イベントに対し、平均2.63秒に1つの命令が対応するほど密なアノテーションを実現。1フレームが短期・中期・長期すべての命令と同時に紐づいている点が特徴です。 🧩 ボトムアップ×トップダウンの評価設計 アノテーションはキー操作から具体的行動を積み上げるボトムアップ方式、評価はゴールを分解させるトップダウン方式。両者の精度差が28.9ポイントにも達し、「認識」と「計画」が別モノであることを裏付けました。 📊 オフライン×オンラインの二段評価 5,000問の再現性重視なオフライン試験と、失敗のたびにリセットして原因を切り分けるオンライン試験を両輪で用意。44モデルの平均正答率は64.7%で、トップのGPT-6-Astraは80.2%を記録しました。 行動を「見て分かる」ことと「先を計画できる」ことの間には、まだ大きな溝があることを数字で示した点に意義を感じます。 #ゲームAI# #ベンチマーク#
もっと見る