TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
加入 January 2018
392
正在关注
2.6K
粉丝
Itaru Tomita / 冨田到
@itarutomy
2026.07.28 23:08
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
显示更多
0
0
0
2
0
转发到社区
热门用户
New York Post
@nypost
4.1M 粉丝
狱。
@Wx1nIII24
121.3K 粉丝
狗D和小桃(主页完整)
@Wx1n111124
52.1K 粉丝
小Annie🦋
@Yooheajede
45.6K 粉丝
李李Momo💋
@Lili33O49
23.7K 粉丝
李李moMo
@LiLi_33094_
8.5K 粉丝
Reuters
@Reuters
26.3M 粉丝
一劍浣春秋
@chee828
0 粉丝
Gxtimer 原创
@GxtimerTv
172.6K 粉丝
Hello! Project Link
@UpFrontLink
15.5K 粉丝
sunny
@77sunnyx
1.2M 粉丝
Sexy Yuki
@SxeYuki
0 粉丝
🍑桃子水水
@Taozishuishui
128.6K 粉丝
凉仔
@LZYWT02
158.1K 粉丝
是你的KK
@KKLOVQ
0 粉丝