註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
270 正在關注    313 粉絲
ワールドモデルの評価、本当にできていますか?スコアだけ出して中身はブラックボックス——そんな評価手法に終止符を打つ研究が登場しました。 HarnessEval-W: Agentifying the Evaluation of Visual Worlds ❓ そもそも何が問題だったの? 💡 既存のワールドモデルベンチマークはスカラー値しか返さず、なぜそのスコアになったかの推論根拠を示せませんでした。また物理的妥当性・因果関係・状態の持続性を「人間がやるように」自動検証する手段がなかったのです。 ❓ どんな仕組みで評価するの? 💡 3層のエージェント階層で動きます。まずケースを専門スキルへルーティングし、サブエージェントが個々の問いに答え、親エージェントがエビデンスを集約してスコアを出します。全工程の推論が証拠ツリーとして記録されるため、どの判断も追跡・監査できます。評価軸は観測品質・遷移の正確さ・世界の持続性の3カテゴリ8設定、330件のケースで18モデルを評価しました。 ❓ 従来手法と比べてどう違う? 💡 物理遷移のペアワイズ精度が WBench の 31.9% から 71.7% へ、引き分け率は 52.2% から 1.8% にまで激減しました。人間の判断との一致も高く、意図的遷移で Spearman ρ=0.93、物理遷移で ρ=0.87 を達成(5,000件のペアワイズA/B判定で検証)。 ❓ 実際のモデル評価で何かわかった? 💡 上位は Seedance 2.0(75.5)、Wan 2.7(75.0)、Kling 3.0(74.4)の順。そしてファインチューニング分析が示す「能力トレードオフ」が興味深く、DreamX-World は探索的遷移で +4.8 改善しながら意図的遷移が −11.9 悪化。画質の良さと物理挙動の正確さも r=−0.04 でほぼ独立した能力であることがわかりました。 #WorldModel# #ビデオ生成#
顯示更多