TL;DR 視覚生成そのものを推論の媒体として扱う「ネイティブ視覚推論」を、大規模データと検証可能な報酬で訓練・評価できるスイートが登場しました。VLM審判の評価は同一動画で最大92.8%もスコアが揺れることが示されています。
タイトル: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
URL:
ポイント
📊 300タスク・125万訓練インスタンス・約347万画像/130万動画の大規模データセット
🎯 HSV色分割やOCRなど古典的CVで属性抽出する決定論的スコアラー、人間一致度0.60以上でGPT-5.5やGemini-3.1-Proを上回る
🌀 予測ノイズと新規ノイズの係数和を保存するCoefficients-Preserving Sampling(CPS)でRL探索を安定化
🚀 外部ベンチマークV-ReasonBenchで10.21→38.22(+28.01pt)と大幅な転移性能を確認
🔬 反事実診断で入力画像削除時に-90%とスコアが激減、視覚軌跡が言語より推論の本質と判明
✅ 検証可能な報酬によるRLがVLM報酬RLよりインドメインで+7.9%改善
視覚推論の「言語頼み」を脱却し、視覚そのものを訓練・検証可能にする基盤という点が印象的です。
#
視覚推論# #
マルチモーダルAI#