登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ベンチマーク
ベンチマーク コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ベンチマーク を含む検索結果
ベンチマークきてたー!!! 非常に快適!たのしみすぎてる😊✨ #モンハンワイルズ# #MHWilds#
HDI格付けベンチマーク「問合せ窓口格付け(メール窓口)」で、最高評価である三つ星を獲得しました🏆 ✨ 今回いただいた評価を励みに、これからもお客様の声に真摯に耳を傾け、安心してご利用いただけるサービスの提供と、より良いサポート品質の向上に努めてまいります。
もっと見る
Opus5、新世代のベンチマーク番長じゃない?Geminiを超えた。 Opus4.8ほどクラッシュしないという意味で改善はしたけど、Fableのベンチマークを超えているのは首をかしげざるを得ない。
もっと見る
要件が後から追加される実践的なベンチマークでのAIコーディングについて。こっちのが実践的かも。 ・従来のAIコーディング評価は、最初からすべての要件が提示されることが多い ・一方、 SlopCodeBench は段階的に要件が追加されるのが特徴 ・実際の開発のように、コードを時間をかけて進化させる能力が問われる ・著者が最新の Opus 5 などをこのベンチマークで実際に検証した ・結果、Opus 5 のパス率は24%にとどまった ・前世代の Opus 4.8 や Sonnet 5 の6%よりは高い ・ただ、どのモデルも課題が進むにつれてバグが確実に蓄積していく ・また、Opus 5 は Opus 4.8 の約5倍もの関数を生成した ・生成コードの約半分をテストが占めている ・しかし、その圧倒的な記述量がパス率の大幅な向上には直結していない ・1つずつ課題を解決していく現実の開発において、今のAIに完全自動運転を任せるのは非常に困難 ・人間によるステアリングがまだまだ必要そう
もっと見る
AI画像編集能力判定のための「ミルクシーフードベンチマーク」.これはgpt-image-2.
ロールプレイAI(キャラになりきって会話するAI)のベンチマークは、実はどのモデルにも同じ「借り物の会話履歴」の続きを書かせて採点しているだけだったという論文(https://arxiv[.]org/abs/2607.27816)。 渡す会話履歴の質を上げただけで同じモデルの採点が平均0.21点(5点満点)上がり、劣化させると0.13点下がることが実験でわかっている。モデル自身の実力ではなく、渡された「お膳立て」の質を測ってしまっているわけだ。 もう一つの問題は採点基準(ルーブリック)が全員共通なこと。じっくり関係を深める会話が好きな人もいれば、テンポよく展開してほしい人もいるので、一律の基準では「その人にとっての満足度」は測れない。 そこでPALATEという新しいベンチマークは、5人の実ユーザーの本物の会話ログ(1人あたり約1,000ターン)でLoRA(モデルの一部だけ軽く追加学習する手法)を作り、「その人らしく話すAI」を再現する。このAIがロールプレイAI候補と自由に会話して、その場で評価用の会話を作るので、借り物の履歴に頼らず公平になる。採点基準もその人の過去の満足度データから個人専用に自動生成していて、論文の図には「そっけない態度の中に見える思いやり(Hard shell, soft care)」のような、人によって全然違う評価軸が並ぶ。 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Proなど16モデルで検証したところ、全ユーザーに勝つモデルは1つもなかった。ユーザーごとに一番相性がいいモデルが違い(Qwen3-Max、DeepSeek V4 Pro、Claude Opus 4.8、Claude Sonnet 4.6がそれぞれ別のユーザーで1位)、総合1位はGPT-5.4だったが、これは一言一言の受け答えの質(Generic評価)で強いのが理由で、会話が長く続いたときの一貫性(Session評価)ではClaude Sonnet 4.6が最も高いスコアだった。一言一言の上手さと、長い会話が破綻しないことは別の能力だという指摘で、ロールプレイAIの「強さ」は1本のランキングだけでは測れないという結果になっている。
もっと見る
muse-spark-1.2-contributor、ベンチマークがかなり良くて値段がDeepSeekだったからModel APIで試そうとしたんだけど、どうやら米国限定だったっぽい... でもVercel AI Gatewayで使えることを発見し狂喜乱舞中です
もっと見る
しごおわ!今更ながらワイルズのベンチマークやってるけどモンスターポリゴンになっても快適にプレイできますってホントかなwwwやるとしたらPS5かな…
もっと見る
TL;DR: あらゆるクエリと予算に最適な単一LLMは存在しない。乱立するLLMルーティング研究を「5つの部品」で統一定式化し、16以上のルーターと専用ベンチマークをまとめたオープンソース基盤が登場しました。 タイトル: LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers URL: ポイント 🧩 ルーターを Context Encoder / Model Encoder / Scoring / Decision Rule / Learning Signal の5コンポーネントに分解して統一 📊 評価基盤 xRouteBench は Generic・Memory・Vision・TimeSeries・Personalized の5トラック計4,767クエリ 🛠️ 全18候補モデルへ全クエリを投げて作る密なクエリ-モデル行列で、訓練と評価を同時に供給 🚀 学習型ルーターは最強の固定モデル(常に最大を選択)を相対14.6%上回る ⚖️ 万能なルーターは無し。RouterDCは精度首位でもコスト重視だと10位に転落 🔁 マルチターンはコストの割に効果が不安定(Router-R1は22.3%) 👤 ユーザー条件付けは有効だが、実フィードバックとシミュレーションで最良設計が入れ替わる 「最良のルーターはタスクと予算で変わる」を実証し、公平比較の土台を用意した一本です。 #LLM# #ModelRouting#
もっと見る
TL;DR: Gemini 3.6 Flashからわずか3週間でアップデート。コーディング・エージェント系ベンチマーク全項目で大幅改善しながら、導入期間中は半額で使えます。 Introducing Gemini 3.7 Flash ポイント: 🚀 DeepSWE v1.1: 65.3%(前世代49.0%から+16.3pt) 🖥 FrontierCode 1.1: 43.6%(前世代34.4%から+9.2pt) 🌐 WebDev Arena Eloスコア: 1588(前世代1538から+50) 📄 GDP.pdf文書理解: 34.0%(前世代22.0%から+12.0pt) 🤖 AutomationBench: 30.4%(前世代17.0%から+13.4pt、約1.8倍) 💰 導入価格: 入力$0.75・出力$3.75(1Mトークンあたり)で3.6 Flashの半額 🌍 提供先: Gemini API、AI Studio、Android Studio、Gemini Enterprise、Gemini Spark(160カ国以上) 🛡 安全機能: CBRN・サイバーセキュリティ悪用防止のフロンティアセーフガードも更新 特にエージェント・コーディング向けに尖らせた設計で、Box、Databricks、Harvey、LangChainなど実務ユーザーから「大幅に良くなった」と評価されています。3週間に1回のペースでこのクオリティのアップデートが来るとは、Flashシリーズの進化が止まりません。 #Gemini# #LLM#
もっと見る