가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

西乔 XiQiao
@recatm
ML Applied Research & Senior Advisor, Video/Image/world model. a Mother、Founder、Cartoonist & Digital Artist. book «Illustrated History of Programming».
가입 January 2009
3.7K 팔로잉 중    121.2K
主要论证 T2V backbone 是否具备像 GPT-3 推平 所有NLP 任务的这么一个定位价值。Vision Banana 同题研究(我说我怎么好像之前看过这篇咧,还以为带娃又把脑子搞坏了) 如果厂商对视频模型有更高的格局和预期(比如 world model 或 robotics 或自驾),性价比更高的做法是 在预训练阶段就把感知任务作为混合训练目标。以规避 post-training 加新模态时的结构排异问题。(论文消融显示联合训练严重损害 3D 关键点估计) 论文里还提到了从通用到任务专用模型在3个泛化上的涌现,很有价值。 还验证了改造的成本真的挺低。这意味着视频理解、编辑辅助、V2V渲染、动捕等能力可以从现有权重里低成本改造获取。 而且有初步的scaling law迹象,不过wan 2.1 真的是上一代模型了。但是也没什么办法了,视频开源连中国厂商也不玩了。
더 보기
Can video generation models do for vision what LLMs did for language? Introducing GenCeption from @GoogleDeepMind: one feed-forward video model for various vision tasks — SOTA, data-efficient, and emerging behaviors (ECCV 2026) 🌐 (1/8)
더 보기