登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Benchmark
Benchmark コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Benchmark を含む検索結果
「このタスクに合うベンチマークってどれだっけ」を毎回散らばった情報源から探すの、地味に時間を食いますよね。 タイトル: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation URL: ❓ Benchmark Radarって何? 💡 arXiv・Hugging Face・GitHubなど37ソースを日次で巡回し、ベンチマークの論文・データセット・リポジトリ・スコア履歴を1つの検索エンジンにまとめたツールです。CLIでオフラインクエリもできます。 ❓ どれくらいの規模のデータを扱っているの? 💡 4つのカタログから1,283件のソースレコード、790ベンチマークにまたがる12,916件の数値スコアを収録。日次収集だけで6,546アーティファクトから11,068件の観測を記録しています。 ❓ なぜ単純にスコアを比較できないの? 💡 スコア付きレコードのうち0〜100の検証済みパーセンテージスケールを使っているのはわずか82件。残りは異なるスケールや未検証のスケールで、公開日も約半数が不明なため、単純比較は危険なんです。 ❓ だからどうするの? 💡 無理に比較可能にするのではなく、出典と引用を保持して読者自身が評価条件を検査できるようにする、という設計を取っています。 #LLM評価# #ベンチマーク#
もっと見る
🎬 「見た目はリアルでも、タスクを達成できているか?」——ビデオ生成の評価がついに結果志向へ進化します。 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 💡 概要 参照画像から「料理を作る」「植物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再現には長けていますが「最終状態をきちんと達成できているか」の評価が欠けていました。SemComp-Bench は6ドメイン・1,273件のデータセットと、VLM(Doubao-Seed-1.8)を用いた二軸評価フレームワークを導入し、この盲点を埋めます。 ⚠️ 解決する課題 既存ベンチマークは外観の一致性や中間手順を重視し、「タスクの結果達成」と「参照画像との意味論的整合性の維持」を同時に評価する基準がありませんでした。 🔬 評価フレームワーク:2つの独立した次元 ・OA(Outcome Achievement)スコア: 結果実現・意味論的グラウンディング・エンティティ一貫性・視覚的連続性の4基準をすべて通過することが必要 ・GR(Generation Reliability)スコア: 物理的整合性・視覚明瞭度・アーティファクト欠如など5基準の平均 📊 実験結果(詳細指示での成績) ・OA最高: HunyuanVideo-1.5-720P が37.8%(最高でも4割未満) ・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%(4位) ・T2V(テキストのみ)のOAはわずか0.6〜5.0%: 視覚的参照が不可欠 ・最大のボトルネック: Within-Scene Spatiotemporal Coherence(0.328〜0.739) → OAとGRは独立した能力であり、「綺麗に生成できる」ことと「タスクを達成できる」ことは別問題です。 #動画生成# #ベンチマーク#
もっと見る
エージェントのLLMコール、本当に全部フロンティアモデルが必要ですか?NVIDIAのSwitchyardで実測してみたら、驚きの結果が出ました。 タイトル: Switchyard Agent Routing Benchmark URL: TL;DR 145件のマルチステップエージェントタスク(1タスク平均6.3コール)を検証。93%のLLMコールは小型モデルで処理でき、74%のコスト削減を達成。精度の低下はわずか6ポイントでした。 ポイント 🎯 フロンティアモデルは7%のコールのみ 全LLMコールのうち、Claude Opus 4.8が必要だったのはたった7%。残り93%はNemotron 3.5 Lightningで処理可能でした。 💰 コストは74%削減 タスクあたりコストが$0.092(Opus単体)→ $0.026(ルーティング)→ $0.006(Lightning単体)に。精度80%を確保しながら大幅な削減を実現。 📊 コスト内訳の意外な事実 フロンティアモデルはコール件数わずか7%なのに、総支出の68.4%を占有。加えてジャッジモデル自体のコストが21.2%を消費する点に注意が必要です。 🔢 ルーティングが割に合うかの公式 「最小オフロード率 = ジャッジコスト ÷ (高額モデルコスト - 安価モデルコスト)」で判断できます。モデル間の価格差が小さいと導入メリットが薄れます。 ⚡ 2つのデプロイ方式 NVIDIAのSwitchyardをプロキシサーバーとして独立起動するか、LangChainのDeep Agentsミドルウェアとして組み込むかを選択できます。 タスクが比較的簡単だった(難しいタスクならルーティング効果はさらに大きい可能性あり)という留意点はあるものの、1タスク複数コールのエージェントには非常に実践的な知見です。 #AIエージェント# #LLMコスト#
もっと見る
操作に応じて映像を生み出す「動画ワールドモデル」、その実力を公平に測る統一ベンチマークが登場しました🎮 タイトル: WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation URL: 🎮 概要 インタラクティブな動画ワールドモデルを包括的に評価する統一フレームワークです。289テストケース・1,058インタラクションターンで、テキスト・6-DoF姿勢・離散アクションという異なる操作方式のモデルを同じ土俵で比較できます。 ❓ 解決する課題 インタラクティブなワールドモデルは急速に進歩する一方、能力を体系的に測る基準がありませんでした。既存ベンチマークは一部しかカバーできず、入力方式がモデルごとに違うため横並び比較も困難でした。 💡 方法論と提案手法 評価は5つの次元で行います。 ・映像品質 ・設定への忠実性 ・インタラクションへの忠実性 ・一貫性 ・物理法則への整合性 タスクはナビゲーション・被写体アクション・イベント編集・視点切り替えの4種。専門視覚モデルと大規模マルチモーダルモデルを組み合わせた22の自動指標を、人間の判断と照合して検証しています。 📊 実験結果 最先端20モデルを分析した結果、すべての次元で強いモデルは1つも存在しないことが判明。各アプローチに特徴的な強み・弱みと、共通の難題が浮かび上がりました。 #ワールドモデル# #ベンチマーク#
もっと見る
TL;DR: 実カルテは公開できずラベルも不完全という臨床AIベンチマークの根本問題を、完全合成データで解決した研究です。フロンティアモデルでもトップ医師の性能には届きませんでした。 タイトル: Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark URL: ポイント 🏥 医学教育教材から1,268人・5,602受診分の完全合成カルテを構築し、個人情報ゼロで公開可能に 🔗 診断・所見・時間関係をICD-10-CM/SNOMED CT/LOINCへ決定的に紐づけ、ラベルは知識グラフから機械的に導出 👨‍⚕️ 医師によるリアリズム検証で、実カルテとの識別精度はほぼチャンスレベルの53% 📊 10モデルを5タスクで評価。患者診断の最高スコアはKimi 2.5-thinkingの重症度加重F1 0.732で医師平均と同水準 ⚠️ トップ医師(0.89)には未到達。要約タスクではどのモデルも所見の約半分を見落とし 🔁 生成モデルを変えても性能変化は0.05以下、臨床状態そのものを測るベンチマークであることを確認 臨床LLMの実力を偽りなく測れる基盤が整った意義は大きいと感じます。 #医療AI# #LLMベンチマーク#
もっと見る
【新着】マルチモーダルAI「Jev-Omni」が1モデルで4モダリティに対応 動画版のJevはアツい。早速試してみます。 他のOSSは大抵どれか欠けるが、これは全部乗せで推論100ms未満。 ・text/image/audio/videoを1モデルで処理 ・Typed-benchmarksでJevと同水準(開発者主張) ・8×H200で3万件学習、データミックス重視 ・1台のH100で推論100ms未満 ↓詳細
もっと見る