註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

西乔 XiQiao
@recatm
ML Applied Research & Senior Advisor, Video/Image/world model. a Mother、Founder、Cartoonist & Digital Artist. book «Illustrated History of Programming».
3.7K 正在關注    121.2K 粉絲
小崽每两三天换一个毛绒玩具作为她的安抚伴侣,上周是红猩猩和乌贼,这周是水獭,今天换成了沙皮狗。
本来我这条推发了是为了薅那个说5.6好就给发100刀的羊毛。结果我真诚地写这么长,没有薅到。我朋友写了一句话"Dario用完5.6要气死了" 都能薅到。 我心好痛。 你知道,没薅到的100刀羊毛比我丢了200刀都心疼。还有那些还没用完就被到期清空的credit啊额度啊更让我心疼。
顯示更多
我做了两个场景的详细比较,分别使用 5.6 Sol High 和 Fable 5 high: 一是专业领域的,帮我参考相关论文分析 transfusion-like 架构相关的一些idea和解读。二是做历史动力学课题相关的一串比较有挑战性的沙盘推演,比较考验知识的广度和要求发散性思维的推理能力。都做了多步设问,设问中提供了不同的提 示方法以查看效果。 我的体验: Fable 的发散性强,擅长旁征博引擅长,能快速连接多个理论领域,擅长发现很多有叙事价值(有传播性)的点,擅长提出极端情景用于边缘测试, 但相比 5.6Sol, Fable 的缺陷就是 干活不可靠。结论先行,叙事先于证据。为了服务其预定假设,fable 会容易做理论外推,假设/定义漂移,归因错误,还会混淆多个论据,断章取义,里面哪个局部观点或数据有用就挑出来用哪个。 所以用于对严谨性有要求的任务时,fable 的漏洞还是挺多的,5.6则过于就事论事,创造力和发散性不够。有时候过于严谨而拘泥于框架。 目前我找到的最好的用法就是将 Fable 5 其用于创建假设,构造机制解释、完善和扩展实验设想,关联多个领域。然后让5.6 去批判性分析 fable 的结果,检查反例、成立条件等,分析完再接着问5.6,质量提高立竿见影。 另外 fable 很擅长吵架和辩论的,你要是想在网上跟人对轰,可以找它帮忙。断章取义、偷换概念、按需缩放前提 这些都颇有一手。
顯示更多
我跟我家属现在掐着 reset 卡过期的时间点(精确到分钟)用 codex, 这才是正在的 deadline 驱动😂
user system prompt 里约束一下,还是可以让GPT 变得非常舒适的。
fable最让我困扰的问题是makeup 术语和概念(也就是造黑话,比如 人口斜率听证会、国家斯多葛、代答悖论、新荒诞主义、地位量化宽松、循环主义,回答里密密麻麻的都给我看呕了)。我现在主要限制这方面,还在 user system prompt 里加了很多 data / truth grounding 的要求。 比如限制黑话又不影响发散: 当我让你解读某论述,或推演某设定/想法,你需要在做解读或推演的同时并发散性连接多个相关理论领域(每个论点不少于300字的摘要、作者(信息)、出处、年份) 做设定、沙盘推演或理论分析时:(1) 只使用真实存在的理论与术语,每一个都附原作者与著作/论文的英文名,确保可查证;(2) 禁止发明新术语、学派名、机制名并与真实理论混排;(3) 如推演确实需要一个没有现成名称的概念,必须:用 [ ] 标注该词 + 明确声明"此为生造概念,非现成学术术语" + 给出完整定义 + 注明它所依据的真实理论来源。
顯示更多
0
21
52
1
轉發到社區
我做了两个场景的详细比较,分别使用 5.6 Sol High 和 Fable 5 high: 一是专业领域的,帮我参考相关论文分析 transfusion-like 架构相关的一些idea和解读。二是做历史动力学课题相关的一串比较有挑战性的沙盘推演,比较考验知识的广度和要求发散性思维的推理能力。都做了多步设问,设问中提供了不同的提 示方法以查看效果。 我的体验: Fable 的发散性强,擅长旁征博引擅长,能快速连接多个理论领域,擅长发现很多有叙事价值(有传播性)的点,擅长提出极端情景用于边缘测试, 但相比 5.6Sol, Fable 的缺陷就是 干活不可靠。结论先行,叙事先于证据。为了服务其预定假设,fable 会容易做理论外推,假设/定义漂移,归因错误,还会混淆多个论据,断章取义,里面哪个局部观点或数据有用就挑出来用哪个。 所以用于对严谨性有要求的任务时,fable 的漏洞还是挺多的,5.6则过于就事论事,创造力和发散性不够。有时候过于严谨而拘泥于框架。 目前我找到的最好的用法就是将 Fable 5 其用于创建假设,构造机制解释、完善和扩展实验设想,关联多个领域。然后让5.6 去批判性分析 fable 的结果,检查反例、成立条件等,分析完再接着问5.6,质量提高立竿见影。 另外 fable 很擅长吵架和辩论的,你要是想在网上跟人对轰,可以找它帮忙。断章取义、偷换概念、按需缩放前提 这些都颇有一手。
顯示更多
小崽子周末的续航现在稳定在15个小时,需要两个人轮班才能陪她。可以连续蹦跶5个小时不停下来。坐车上也不睡。我今天躺了一天才缓过来。晚上才有能力看论文。既然 fable 5 额度还有这么多,我拿来重新解读几篇 fusion 相关的研究吧。 今天让它跟 5.6 对比解读了一下 精英阶层和最受压迫群体的反抗动力研究和心理模型。其实在我看来两个模型智能和知识差不多,但 fable 的答案组织得更好一些,但也更武断一些。 一个感觉就是 fable 觉得它比我聪明很多,所以可以替我做决定“我需要看什么,不需要看什么”。 还会跳过一些论证和推理直接给结论或归因。有时候还有点先下结论再给我找解释的意思。
顯示更多
我怎么觉得偏向短期收益是过拟合的表现
底层人民的AI化诠释🥲
主要论证 T2V backbone 是否具备像 GPT-3 推平 所有NLP 任务的这么一个定位价值。Vision Banana 同题研究(我说我怎么好像之前看过这篇咧,还以为带娃又把脑子搞坏了) 如果厂商对视频模型有更高的格局和预期(比如 world model 或 robotics 或自驾),性价比更高的做法是 在预训练阶段就把感知任务作为混合训练目标。以规避 post-training 加新模态时的结构排异问题。(论文消融显示联合训练严重损害 3D 关键点估计) 论文里还提到了从通用到任务专用模型在3个泛化上的涌现,很有价值。 还验证了改造的成本真的挺低。这意味着视频理解、编辑辅助、V2V渲染、动捕等能力可以从现有权重里低成本改造获取。 而且有初步的scaling law迹象,不过wan 2.1 真的是上一代模型了。但是也没什么办法了,视频开源连中国厂商也不玩了。
顯示更多
Can video generation models do for vision what LLMs did for language? Introducing GenCeption from @GoogleDeepMind: one feed-forward video model for various vision tasks — SOTA, data-efficient, and emerging behaviors (ECCV 2026) 🌐 (1/8)
顯示更多
@hxiao 智谱自己做2G,2B的,预期和标准是很不一样的。而且国内的用工成本和工作时长。给国内做2B真是很不合算很难。
看我语音输入法的词表配置就知道我是干啥的了🐒 @shandianshuo 还是非常丝滑的
太真实了,现在已经变成了yes工程师🤣
0
36
111
12
轉發到社區
想想以后全互联网到处都是这种文本,还是杀了我吧
再说一遍不要随便用国产模型😅 群友今天差点被某国产模型给害死了 直接要删掉他库里的16年650万条金融数据
0
191
231
13
轉發到社區
一看这标题我就知道。。。
0
29
44
3
轉發到社區
塔勒布说:要获得彻底的自由,你不仅需要避免成为奴隶(slave),还需要避免成为奴隶主(master)。 细想一下,很像权力梯子的两端,越靠上风越大,且双手要死死抓紧梯子,否则就会跌落,真正的自由摆脱这种权力的游戏,拥有随时Say No的权力,过一种不仰人鼻息、也无需对他人指手画脚的、自给自足的生活。
顯示更多
0
2
58
13
轉發到社區
库克:终于有人懂我的勾股定理了
0
157
1.9K
54
轉發到社區
王老师这篇我非常赞同。在任何模态上,评估都是被动的,反应式的(这是个bootstrape 问题)。无法指引或预测下一代能力升级"质变/涌现"的可能方向或障碍。甚至对当前模型能力的评估维度也是非常局限的。许多关键问题上是失效的。对模型在应用侧的实用性和有效性的评估也是不够的,训练和应用对不齐。 coding 和 agentic 跑得快也是因为评估好做,影响上下游的一切。 我最近两年的工作核心是做视频/图像/vwm 模型的评估,这个更难,更依赖人。测试框架也需要非常频繁地更新,追着参数量和需求端跑。
顯示更多
I’ve left Google DeepMind after an amazing chapter. I’m incredibly grateful for the people I worked with, the things we built, and the lessons I learned from taking frontier AI research into production. DeepMind shaped how I think about research, product, evaluation, and what it takes to build AI systems at real scale. As I wrap up this chapter, I wrote down something I’ve been thinking about a lot: evals. We’re good at evaluating the models we have. We’re much worse at evaluating the models we’re about to build — especially if they cross into a new capability regime. We will have self-evolving models, but before that, we need self-evolving evaluations.
顯示更多
又一位港片黄金时代老戏骨去世…… 5月30日,罗家英发文悼念,师兄刘洵离世,享年87岁。 刘洵老先生在徐克等导演的近百部电影中塑造了众多令人过目不忘的配角,无论是《笑傲江湖》中阴鸷的古今福、《黄飞鸿》系列中儒侠兼备的黄麒英,还是《新龙门客栈》中邪气十足的贾廷,正邪忠奸皆能驾驭,文武戏份挥洒自如,堪称“千面”。
顯示更多
0
165
496
61
轉發到社區