TL;DR コードを書いて画像や動画を生成するAIは、コードの実行が成功しても見た目の要求を満たしているかは別問題です。この「プログラムと視覚のギャップ」を測る評価手法が提案されました。
タイトル: MaLiang-Harness: A Programmable Path to Image and Video Generation
URL:
ポイント
🖼️ 状態を保持しながら生成物を検査・修正するステートフルなフレームワーク
🔧 コードの変更と映像の結果を対応づける追跡可能な生成プロセスを導入
🎨 Canvas・SVG・Three.jsなど複数バックエンドを共通プロトコルで統一
📊 画像生成50タスクでGPT-6-Astraが成功率100%・品質基準クリア96.0%
🎬 動画生成13タスクでもGPT-6-Astraが成功率100%・品質基準クリア76.9%
⚠️ DeepSeek系は画像で12〜40%、動画では0%と大きく苦戦
🔍 汎用能力スコアが同じ2モデルでも描画品質の合格率は44%対88%と激しく食い違う
汎用ベンチマークのスコアだけではモデルの実力を測れない、という指摘が特に刺さります。
#
マルチモーダルAI# #
画像生成#