TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
加入集合
Saining Xie
@sainingxie
cofounder & chief science officer at
@amilabs
| faculty
@nyu_courant
| prev:
@googledeepmind
@meta
(fair)
@ucsandiego
| ynwa
1.6K
正在關注
40.2K
粉絲
Saining Xie 已轉發
西乔 XiQiao
@recatm
2026.05.21 13:39
谢赛宁团队+ Adobe research +ANU 的 RAEv2 出啦, 搞视觉重建/扩散模型/原生多模态/语义对齐/图像生成/世界模型的同学们值得关注: RAE 是非常重要的一个研究,改进了重建和引导生成,同时保留了Representation space的全局语义。这使得它能够取代VAE为理解和生成提供一个更优雅的 unified tokenization 方案。 RAEv2 的 3个研究发现: 1. 不只取 Pretrained vision encoders 最后一层,而是把最后 K 层特征相加作为潜在表征。RAE 输出是最后 KK 个编码器层的总和。原始 RAE 在 K=1K=1 处恢复。这个方法同时提高生成和理解,不增加额外推理成本,明显提升图像重建质量。 2. RAE 和 REPA 表现出可以互补的工作机制。 RAE 更擅长提供全局语义,例如图像里有什么; REPA 更擅长保留空间结构,例如物体在什么位置、局部关系如何。 RAEv2 的实验显示,在 27 个编码器上,两者结合通常优于单独使用。这种互补性使得同一预训练表征既可用作encoder(RAE),也可用作target for intermediate diffusion features(REPA) 3. REPA 能实现self-guidance。 REPA 在 RAE 框架中相当于一个更弱的 x 预测器。通过将输出头也重新表述为 x 预测,REPA 头本身可以用于内部引导。,不需要额外训练弱模型 AutoGuidance,也不增加推理时的前向计算 CFG。
顯示更多
0
0
12
75
19
轉發到社區
載入中...
熱門用戶
是你的KK
@KKLOVQ
209.5K 粉絲
一劍浣春秋
@chee828
230.5K 粉絲
布拉尔
@ToBulaer
999.3K 粉絲
小牛
@Xiaoniu6161
186.2K 粉絲
素人星探(全网同名)
@OLDBEAUTYxb
28.8K 粉絲
吴说区块链
@wublockchain12
179.2K 粉絲
AB Kuai.Dong
@_FORAB
138.1K 粉絲
New York Post
@nypost
4.1M 粉絲
Trader米哥 🚀
@tradermige
144.2K 粉絲
乐老爺 #JAV
@HappyLok1157
165.6K 粉絲
David Tsai/蔡慎坤
@cskun1989
462.6K 粉絲
彭博商業周刊 / 中文版
@BloombergBWCN
41.4K 粉絲
兔の露出日记
@tuzai0v0
33.1K 粉絲
ToBuerma
@ToBuerma
832.8K 粉絲
銀璃 Silverluri🪶
@Silverluri
139.1K 粉絲