模型的各项评分非常高,位于国产模型第一梯队,而且团队非常年轻,研发成员里大约2/3都是在校的本科生、硕士生和博士生,来自复旦、人大、中科院软件所、中科院自动化所、北大、上交大、哈工大、华东师范等高校,未来大有可为。
顯示更多
【模型放缓?你可能理解错了】
现阶段的算力、电力和数据中心,已经接不住下一轮能力跃迁。训练一个更强的模型,当然还能堆钱、堆卡、堆人;但真正困难的是:训练完以后,谁来为几十亿人的日常调用买单?你以为 20 美元订阅就能无限拥抱 AGI?现实是,复杂一点的任务,两句话可能就把你一个月的高阶额度烧掉;即使是 200 美元档,也未必扛得住一天高强度使用。
所以,接下来行业表面上看起来模型会“放缓”,但不是没有新模型,而是更少公开、更多内测;不是不继续训练,而是把突破留在实验室、企业客户和封闭产品里。
每年某一天,他们会突然放出一个 Demo。
然后所有人盯着屏幕沉默几秒,跑来X发帖子:
“看完这个 Demo,我直接瘫坐在椅子上,仿佛看到核弹爆炸,久久不能平静。”
顯示更多
模型厂商呼吁踩刹车这事,历史上发生过类似情况,当年的香烟电视广告。
模型能力是指数级别上涨的,astra的能力只在山脚下
模型能力快速提升,会让传统的工业能力大众化(贬值)速度越来越快
工业革命让农业从gdp占比超过50%的第一产业变成不到5%用了100年
ai革命可能会让工业这个第二产业经历同样的过程,只是可能时间是10年
顯示更多
模型厂商进入了红皇后效应的博弈局面:「落后即死」。
大家觉得太快有点晕车,想踩一脚刹车也不行,这个局面不允许。
只有拼命奔跑,才能继续活在牌桌上。
顯示更多
“模型夸夸宝”指每天沐浴在模型表扬中的人,导致ta对世界认知出现偏差
模型公司产值和算力支持比
根据Anthropic的情况
暂时需求盘子还在扩大
算力租赁(光纤、pcb、CPU)
pcb
ccl
电子布/铜箔/树脂/探针
模型 Coding 能力的竞争,应该要结束了。
说实话,本来我对 GLM 5.3 没有抱太高的预期,毕竟这段时间,其他几个开源模型都已经把参数追到了 1T 之上.....而 GLM 5.3 仍然只有 700 多 B。差距很大。
但我今天我拿到体验资格,测试了六个多小时。坦诚的跟大家说,纯体感,我觉得 GLM-5.3 应该又继续回到了开源模型 SOTA 老大哥的位置了。
注意,只是我的体感。
我看智谱在博客里还是很低调,挺好的,国模也越来越有自信。不一定非得炸炸呼呼。
就像当年明月说的那样,张牙舞爪的人,往往是脆弱的。因为真正强大的人,是自信的,自信就会温和,温和就会坚定。
我不知道大家怎么看这些事,现在的几个头部模型,包括 GPT-5.6 和 Opus 5 在内,我已经很难再通过具体任务去分出孰强孰弱了。
只有在某个模型明显掉链子的时候,我才会一下子感觉出来差距。否则在大多数任务里,基本很难靠一两个 Case 立分高下。
我还是再说下 GLM 5.3 的基本情况,以免很多同学不知道:
1)整体模型架构没变。
2)总参数没变。
3)所有的优化全部来自后训练。
我真的预期 GLM 5.3 会把参数提升到 1T,没想到,居然没变。所以确实也如大家所说,智谱是后训练之王。
换个角度,如果智谱是要到 GLM 6 的时候才会把参数做到 1T 开外,那未来还是有很大的想象空间。
上午跟朋友讨论 LLM,我说我预判到了明年,Coding 这场模型战争可能真的快打完了。
因为就像我刚才所说,发展到现在,大部分任务中,几个头部的开源模型和闭源模型,大家已经是有来有回了。没有谁是碾压式的领先。
包括 Fable 5,如果用多了,我真感觉没那么玄乎,它最强的地方我觉得还是前端,给一个模糊的提示词,Fable 经常能自己发挥,做出审美和完成度都非常高的页面。后端方面,和 GLM 5.3、GLM 5.6 有明显差别吗?没有。根本没有。
所以,我感觉按照现在这个追赶速度,再往后跑个一年,Coding 这事上,几个头部模型的差距还能有多大? 或者最最头部的模型,还能强到哪里?我现在是打个问号的。
顯示更多
模型已经学会两项技能,能不能把它们直接组合成一项新能力?
Google 团队这篇 SkillSmith,尝试让 LLM 同时读取任务说明和已有的 prefix weights,再为新任务生成一组新的参数技能。
比如模型已经学过翻译和法律文本分析,面对另一种语言的法律任务时,SkillSmith 会理解两项技能之间的关系,再合成更适合当前任务的新权重。
过去,经验可以写进 Prompt 和记忆,也可以通过微调存进参数。SkillSmith 把两种形式连接起来,让模型根据文字指令重新组合已有的参数技能。
消融实验中,同时使用文本和权重的效果明显优于只使用其中一种。
这篇工作重点是,它让模型权重也变成了一种可以读取、理解和组合的经验。
以后 Agent 积累技能,可能既会记录「学到了什么」,也会保存「已经学会怎么做」。
📎 arxiv:
顯示更多