登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Benchmark
Benchmark コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Benchmark を含む検索結果
操作に応じて映像を生み出す「動画ワールドモデル」、その実力を公平に測る統一ベンチマークが登場しました🎮 タイトル: WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation URL: 🎮 概要 インタラクティブな動画ワールドモデルを包括的に評価する統一フレームワークです。289テストケース・1,058インタラクションターンで、テキスト・6-DoF姿勢・離散アクションという異なる操作方式のモデルを同じ土俵で比較できます。 ❓ 解決する課題 インタラクティブなワールドモデルは急速に進歩する一方、能力を体系的に測る基準がありませんでした。既存ベンチマークは一部しかカバーできず、入力方式がモデルごとに違うため横並び比較も困難でした。 💡 方法論と提案手法 評価は5つの次元で行います。 ・映像品質 ・設定への忠実性 ・インタラクションへの忠実性 ・一貫性 ・物理法則への整合性 タスクはナビゲーション・被写体アクション・イベント編集・視点切り替えの4種。専門視覚モデルと大規模マルチモーダルモデルを組み合わせた22の自動指標を、人間の判断と照合して検証しています。 📊 実験結果 最先端20モデルを分析した結果、すべての次元で強いモデルは1つも存在しないことが判明。各アプローチに特徴的な強み・弱みと、共通の難題が浮かび上がりました。 #ワールドモデル# #ベンチマーク#
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
AI時代のエンジニアリング組織論 ■ 開発工程のボトルネックはコーディングから製品設計とコードレビューへ移行する リーガルAIのLegoraは、創業18ヶ月でARR1億ドルを突破し評価額56億ドルに達した最速のB2B企業である。CTOのヤコブ・ラウリツェンは、AIツールにより従来のボトルネックだったコーディングのコストは劇的に低下したと語る。現在、開発の真の制限要因は、顧客ニーズを製品設計へ落とし込む作業と、生成されたコードのレビュー工程へ移行している。そのため、同社はPMが顧客との対話に集中できる時間を守り、エンジニアをシステム設計に特化させている。 ■ トークンの消費量競争は開発組織を歪ませる無意味な評価指標である 多くのエンタープライズ企業が陥る失敗が、開発者評価にAIトークン消費量を持ち込むことである。トークン消費を可視化するリーダーボードを作ると、エンジニアは評価のためだけに無意味にトークンを浪費し始める。ラウリツェンはこの「トークンマクシング」を愚策と一蹴し、AI使用量そのものを報酬評価にしてはならないと警告する。組織が評価すべきは開発効率と実際のアウトプットの質であり、デモ等を通じて効率化の工夫を共有し合う環境こそが不可欠である。 ■ 開発者体験に特化した専門チームの設置が組織全体の生産性を最大化する 同社は、わずか80名のエンジニアでAccelやBenchmark、NVIDIA等から8億ドル以上を調達した。現在、Legoraのコードの50%以上はCursorやClaudeなどのAIツールにより生成されている。この開発速度を維持するため、同社は3名の開発者体験(DevEx)専門チームを早期から設置した。彼らは、エンジニア1人あたり最大10個の自律コーディングエージェントを回し、独自のCIレビューボットを開発して全員の開発を支援している。結果としてエンジニア全員が約20%効率化し、新人の即戦力化も劇的に加速した。 ■ 複雑度の低い社内ツールは購入するよりバイブコーディングで自社開発する AI開発において、同社は社内ツールの導入基準として、機能の広さと複雑度の深さという2つの軸を設けている。既存製品を購入するよりも、複雑度が低く自社専用のカスタマイズが必要なシステムは、バイブコーディングで自作する方が安価になった。特に人事管理やオンボーディングシステム、データ移行アプリなどは、AIを使って自立的かつ高速に自社開発することが推奨される。汎用ツールに頼る手間を省き、社内のAIイネーブルメントチームが直接プロトタイプを開発して課題を瞬時に解決している。 ■ 組織を急成長させるためにはエゴのない優秀な人材の密度を高める Legoraが競合を圧倒して超高速成長できた最大の要因は、優秀なAプレイヤークラスのエンジニア密度を極限まで高めたことだ。特に5〜8人規模のスタートアップチームを丸ごと買収するアクハイヤー戦略は、高いチーム開発力を一瞬で取り込む上で効果的だった。この統合を成功させたのは、役職やタイトルへの執着を一切排除する「ローエゴ(低自己愛)」の徹底した採用基準である。ラウリツェンは、最も優れた成果を出せる者が役割を担う機動的な文化を築き、エゴの排除が企業の成長速度を決めると実証している。
もっと見る