TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
가입 January 2018
392
팔로잉 중
2.6K
팬
Itaru Tomita / 冨田到
@itarutomy
2026.07.29 15:53
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
더 보기
0
0
0
2
0
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.1M 팬
Reuters
@Reuters
26.3M 팬
Hello! Project Link
@UpFrontLink
15.5K 팬
First Squawk
@FirstSquawk
556.1K 팬
一劍浣春秋
@chee828
0 팬
オリコンニュース
@oricon
1.9M 팬
銀璃 Silverluri🪶
@Silverluri
0 팬
Pop Base
@PopBase
6.4M 팬
JO KWON
@2AMkwon
976.9K 팬
モデルプレス
@modelpress
1.8M 팬
「승리의 여신: 니케」 x 「P3R」, 「P4G」, 「P5R」 콜라보 진행 중
@NIKKE_kr
79.5K 팬
MLB
@MLB
13.6M 팬
Nari✨나리땽
@nariddyang
277.4K 팬
야살 / Yasal
@Yasal_170
917.6K 팬
Hearts2Hearts
@Hearts2Hearts
462.5K 팬