登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ベンチマーク
ベンチマーク コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ベンチマーク を含む検索結果
ベンチマークきてたー!!! 非常に快適!たのしみすぎてる😊✨ #モンハンワイルズ# #MHWilds#
「このタスクに合うベンチマークってどれだっけ」を毎回散らばった情報源から探すの、地味に時間を食いますよね。 タイトル: Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation URL: ❓ Benchmark Radarって何? 💡 arXiv・Hugging Face・GitHubなど37ソースを日次で巡回し、ベンチマークの論文・データセット・リポジトリ・スコア履歴を1つの検索エンジンにまとめたツールです。CLIでオフラインクエリもできます。 ❓ どれくらいの規模のデータを扱っているの? 💡 4つのカタログから1,283件のソースレコード、790ベンチマークにまたがる12,916件の数値スコアを収録。日次収集だけで6,546アーティファクトから11,068件の観測を記録しています。 ❓ なぜ単純にスコアを比較できないの? 💡 スコア付きレコードのうち0〜100の検証済みパーセンテージスケールを使っているのはわずか82件。残りは異なるスケールや未検証のスケールで、公開日も約半数が不明なため、単純比較は危険なんです。 ❓ だからどうするの? 💡 無理に比較可能にするのではなく、出典と引用を保持して読者自身が評価条件を検査できるようにする、という設計を取っています。 #LLM評価# #ベンチマーク#
もっと見る
エージェントのベンチマーク、どうやって作ればいいのか?LangChainが実践ノウハウを公開しました。 タイトル: How We Build Agent Environments & Tasks URL: ❓ エージェントの「タスク」って何で構成されているの? 💡 タスクは「インプット・環境・テストスクリプト」の3要素で成り立ちます。環境はエージェントの実行場所を提供し、ルーブリックが採点基準を定義します。複数の関連タスクにまたがる共有知識は「ワールドスペック」としてまとめ、APIスキーマ・データ生成方法・トレース解析スクリプトなどを一元管理します。 ❓ 大量のタスクを効率よく作るにはどうすればいい? 💡 LangChainは2段階パイプラインを採用しています。最初に「スペック生成」フェーズでコーディングエージェントがリポジトリをスキャン・トレースを分析しワールドスペックを自動生成します。次に「Spec2Task」フェーズでそのスペックから実行可能なタスクに変換します。最初のタスク作成時のスペックをベースに、後続のサイクルで反復的に品質を高めていく設計です。 ❓ タスク作成で特に注意すべき落とし穴は? 💡 3点が重要です。 ・実際のエージェントを動かさないと環境の欠陥が見えない(ペーパーテストでは不十分) ・モデルティア間(例: gpt-5.6-Luna vs Sol)で難易度を均等に校正する必要がある ・自由記述にはLLMベースの生成、表形式データにはSQLスクリプトという使い分けを徹底する ❓ ベンチマークは作ったら完成ですか? 💡 いいえ。本番データを使った継続的改善が核心です。コスト分析・プロンプト簡略化の検証・ツール設定テストに本番トレースを活用し、ベンチマーク自体の品質を運用しながら高め続けます。 評価環境の構築を「一度やれば終わり」でなく継続的なエンジニアリングとして捉える姿勢が実践的です。 #AIエージェント# #LLM評価#
もっと見る
HDI格付けベンチマーク「問合せ窓口格付け(メール窓口)」で、最高評価である三つ星を獲得しました🏆 ✨ 今回いただいた評価を励みに、これからもお客様の声に真摯に耳を傾け、安心してご利用いただけるサービスの提供と、より良いサポート品質の向上に努めてまいります。
もっと見る
GPT6-Astra来た!ベンチマーク取りあえずやってるが コスパいいぞ。Recurrent DepthとContinuous Latent Spaceが実装されてるという噂が本当であれば、リフトされそうな数値計画系、店舗モニタ系あたりからデモケースつくって掘ってみる
もっと見る
Opus5、新世代のベンチマーク番長じゃない?Geminiを超えた。 Opus4.8ほどクラッシュしないという意味で改善はしたけど、Fableのベンチマークを超えているのは首をかしげざるを得ない。
もっと見る
要件が後から追加される実践的なベンチマークでのAIコーディングについて。こっちのが実践的かも。 ・従来のAIコーディング評価は、最初からすべての要件が提示されることが多い ・一方、 SlopCodeBench は段階的に要件が追加されるのが特徴 ・実際の開発のように、コードを時間をかけて進化させる能力が問われる ・著者が最新の Opus 5 などをこのベンチマークで実際に検証した ・結果、Opus 5 のパス率は24%にとどまった ・前世代の Opus 4.8 や Sonnet 5 の6%よりは高い ・ただ、どのモデルも課題が進むにつれてバグが確実に蓄積していく ・また、Opus 5 は Opus 4.8 の約5倍もの関数を生成した ・生成コードの約半分をテストが占めている ・しかし、その圧倒的な記述量がパス率の大幅な向上には直結していない ・1つずつ課題を解決していく現実の開発において、今のAIに完全自動運転を任せるのは非常に困難 ・人間によるステアリングがまだまだ必要そう
もっと見る
AI画像編集能力判定のための「ミルクシーフードベンチマーク」.これはgpt-image-2.
ロールプレイAI(キャラになりきって会話するAI)のベンチマークは、実はどのモデルにも同じ「借り物の会話履歴」の続きを書かせて採点しているだけだったという論文(https://arxiv[.]org/abs/2607.27816)。 渡す会話履歴の質を上げただけで同じモデルの採点が平均0.21点(5点満点)上がり、劣化させると0.13点下がることが実験でわかっている。モデル自身の実力ではなく、渡された「お膳立て」の質を測ってしまっているわけだ。 もう一つの問題は採点基準(ルーブリック)が全員共通なこと。じっくり関係を深める会話が好きな人もいれば、テンポよく展開してほしい人もいるので、一律の基準では「その人にとっての満足度」は測れない。 そこでPALATEという新しいベンチマークは、5人の実ユーザーの本物の会話ログ(1人あたり約1,000ターン)でLoRA(モデルの一部だけ軽く追加学習する手法)を作り、「その人らしく話すAI」を再現する。このAIがロールプレイAI候補と自由に会話して、その場で評価用の会話を作るので、借り物の履歴に頼らず公平になる。採点基準もその人の過去の満足度データから個人専用に自動生成していて、論文の図には「そっけない態度の中に見える思いやり(Hard shell, soft care)」のような、人によって全然違う評価軸が並ぶ。 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Proなど16モデルで検証したところ、全ユーザーに勝つモデルは1つもなかった。ユーザーごとに一番相性がいいモデルが違い(Qwen3-Max、DeepSeek V4 Pro、Claude Opus 4.8、Claude Sonnet 4.6がそれぞれ別のユーザーで1位)、総合1位はGPT-5.4だったが、これは一言一言の受け答えの質(Generic評価)で強いのが理由で、会話が長く続いたときの一貫性(Session評価)ではClaude Sonnet 4.6が最も高いスコアだった。一言一言の上手さと、長い会話が破綻しないことは別の能力だという指摘で、ロールプレイAIの「強さ」は1本のランキングだけでは測れないという結果になっている。
もっと見る
muse-spark-1.2-contributor、ベンチマークがかなり良くて値段がDeepSeekだったからModel APIで試そうとしたんだけど、どうやら米国限定だったっぽい... でもVercel AI Gatewayで使えることを発見し狂喜乱舞中です
もっと見る