🎨 「見る」と「創る」を同じモデルの中で育て合わせる、統合視覚AIの新作が登場しました。
タイトル: SenseNova-U1.5: Towards Native Unified Visual Intelligence
URL:
🧩 概要
OpenSenseNovaが開発した8B規模のMixture-of-Transformersモデルで、外部の視覚エンコーダやVAEを一切使わず、生のピクセルを直接扱いながら画像理解・推論・生成・編集を1つのモデルでこなします。
⚙️ 解決する課題
従来の統合モデルは理解系と生成系で別々の潜在空間を経由することが多く、整合性のロスが生じがちでした。理解と生成を共有表現の上で本当に一体化させることを目指しています。
🛠 方法論と提案手法
視覚トークンを2次元特徴フィールドに投影し、隣接する32×32領域間で情報をやり取りしながら再構成する空間デコーダを採用。さらに美的品質・OCR・編集・インフォグラフィックの4専門家をRLで個別に鍛えた後、On-Policy Distillationで1つのモデルへ統合します。
📊 実験結果
GenEval総合0.92、画像編集ベンチマークImgEditで4.59(前作U1は3.90)、ビジネス文書生成BizGenEvalでは前作51.4%から72.2%へ大幅向上と、理解・生成・編集の全方位で前作や競合を上回りました。
#
統合マルチモーダルAI# #
画像生成#