五年前,我对理想人生的理解完全错了。
刚看了 X 上一篇文章,很有启发,关于人生意义的。它大致的逻辑是:
如果一个人真的把幸福、舒服、愉悦当成人生最高目标,他最后得到的生活,可能并没有想象中那么美好。
是的,假期快结束了,我们可能会怀念海浪、森林和轻松的午后,觉得要是一辈子都能这样生活,该多好。
我知道,很多人对理想人生的设想差不多就是这样,努力赚钱,然后退休,剩下的日子就乐哉轻松地活着。参加音乐节,旅行、晒太阳,发呆,最终进入一种没有压力、没有痛苦的状态。
嗯,我五年前也是这么想的。
好像人这一辈子都在做一道优化题,痛苦越来越少,快乐越来越多,最后就算成功。
叔本华很不认同这种想法。他觉得即便最后财务自由,过上了没有任何压力的生活,人也未必会幸福和开心。
因为人最大的两个敌人,一个是痛苦,一个是无聊。
人当然会想办法逃离痛苦。但麻烦在于,等痛苦真的消失之后,大脑并不会就此安静下来。它还在不停运转,还想寻找新的目标和刺激。
于是一个过于舒服的人,很快就会无聊。
无聊之后,人又开始主动制造事情。赌博、喝酒、参加聚会、旅行、谈婚外情、和别人争吵,都可能成为填补无聊的方法。
所以,叔本华觉得,海滩、瀑布、度假胜地这种典型的幸福场景,待几天当然很好,长期生活在那里很可能变成一座无聊陷阱。
他觉得人活着还是应该有点事情干。收藏邮票、研究昆虫、学语言、读书、写笔记、研究地理都可以。重点不在于事情有多伟大,而在于人的精神需要持续被某种对象占据。
或者如美国精神神经免疫学教授 Steve Cole 说,人生的终极幸福感来自于自我实现。
幸福感包括实现幸福感和享乐幸福感两个维度。享乐幸福感是比较低级的幸福感,是因为满足物质需要和身体愉悦如美食和性而带来的幸福感觉。
自我实现幸福感属于深层和高档的幸福感,例如慈善行为、知识追求和社会交往等方面因素获得的幸福感。
我记得之前美国有教授做过研究,这两类不同的幸福感带来的基因表达模式有明显区别,意义取向或目的取向的人(自我实现幸福感)有更健康的基因表达模式,而有享乐幸福感追求的人基因表达模式和负面情绪导致的基因表达模式更接近。
因为如果一个人追求低级的享乐,所有的幸福依赖于自身条件。
一旦这些人遭遇不幸,他们受到的应激更为剧烈。如果一个人可把关注的问题超越于个人,例如社会、政治和艺术,那么日常的应激将明显减弱。幸福可以缓冲不确定性给我们造成的感觉,甚至可以提高我们的健康。
他这段话,我一直记在备忘录,记了三年。
真的,我现在感觉享乐也是一门学问,并不是有了钱,有了闲,就真的能一直开开心心一辈子。不会的。人总会在一个困境里,这是我活到现在理解到的人生模式。
我对自己的要求是:无论什么境遇下,都让自己处于创造的状态里,创造一篇对别人有用的文章,创造一个对别人有用的产品,创造一个对别人有用的观点。主动地去创造,创造才可能获得机会。
我有孩子,作为父亲,我希望给她的影响是,要有一个偏创造输出型的爱好。旅行、阅读、看演唱会、看电影,这些爱好当然很好,但它们都偏享乐型。享乐型的爱好可以娱乐自己,让自己开心,但遗憾的是,它们很难形成作品,并对别人产生帮助或者影响。
人活一辈子,应该能找到一件或者几件有利有趣有意义的事儿,一直做。
因为做一件对别人有帮助,有意义的事情非常重要,这能给我们带来难以言说的成就感。并且我也相信,人生的终极幸福感一定是来自于自我实现。而自我实现的途径必定是通过创造。做一个产品,开一家公司,运营一个抖音号,写一篇文章,拍一组照片,这都是创造。
创造能够源源不断地给人以滋养。
显示更多
朱啸虎对腾讯 AI 的真实评价。
朱啸虎昨天的新访谈,有几个观点我还是比较认可。总结下:
第一,模型 API 这门生意,很难长期维持高毛利。
Anthropic 现在能做到 60% 左右的毛利,核心还是模型智能能力比较强,尤其 Coding 这类场景,过去一段时间确实有明显优势。
但这个优势已经开始越过临界点了。当其他模型逐渐追上,价格可能只有你的十分之一,怎么可能一直维持这么高的溢价?
哪怕 Anthropic 的模型未来几年还能保持领先,但如果智能能力只强 10%,价格却高 50%,用户真的会一直买单吗?
智能最终会越来越像电和水。模型 API 这一层,长期可能就是 10% 到 20% 的毛利。这是比较合理的。
一旦能力逐渐趋同,价格战很难避免,大家也会越来越有动力切换到更便宜的模型。Anthropic 现在着急上市,也可能和这个窗口期有关。
第二,AI 办公的市场肯定比 AI Coding 大很多。
AI Coding 最先跑出来,很重要的一个原因是工程师本身就对 AI 的接受程度就比较高。而且 Coding 是一个特别适合 AI 的场景,任务相对明确,结果也比较容易验证。
但 AI Coding 只是办公的一部分。真正更大的市场,还是整个的白领市场,也就是现在大家都在拼的 AI 办公。
再进一步,AI 办公本质就是通用 Agent。之前的 Coding 只是一个垂直场景,办公是整个白领市场。就像当年微软的 Office 一样,你会发现只要有电脑的地方,就会有 Office。
第三,AI 办公产品的竞争力是 Model + Harness + Product + Context。
今年前半年,行业聊 Harness 比较多。但 100%可以预测到,随着 Harness 这一层趋同,最终的竞争肯定会转移到 Context。
因为 AI 办公的杀手级应用场景是工作,诸如分析数据,写 PPT 和分析报告等等,这类任务的交付结果,直接取决于 AI 到底掌握了多少企业的工作上下文。
就像一个新员工一样,你想让它把工作干好,又不让它了解背景,那即便他再聪明也无济于事。
Context 肯定会成为这一轮 AI 办公竞争中非常重要的壁垒。
基于这三个判断,朱啸虎也聊到了腾讯的 AI 发展。相对还是比较客观。
当然,我也不否认朱啸虎有他的局限性,大家主要看看他的思考逻辑,是不是对我们理解一家公司和趋势有启发。
腾讯在这一轮 AI 浪潮里,目前看还是非常典型的后发制人。
最开始混元模型,说实话,在业界都没什么存在感。但现在做到 Hy4 preview,已经逐步的挤进国内第一梯队了。
到了这一轮 AI 办公,WorkBuddy 反而跑出来了,而且已经成为国内第一梯队的办公 Agent 应用。
朱啸虎说金沙江也购买了 WorkBuddy 的企业账号。
为什么?
一方面当然是 WorkBuddy 本身的产品体验不错。另一个很重要的原因是金沙江本来就在用企业微信。
企业微信里已经沉淀了公司的组织关系、历史沟通,再加上腾讯会议、腾讯文档,本身就在同一个体系里。对于 WorkBuddy 来说,这些都是现成的 Context。
如果换成一个独立的 AI 办公产品,就要重新连接知识库、文档、会议,甚至重新处理组织关系和权限。
朱啸虎还有一个判断我也很认可。现在模型能力当然还重要,因为大家还处在交替领先的阶段。但只要模型之间的差距继续缩小,技术优势就很难成为长期壁垒。
到了那个时候,竞争又会回到传统互联网的几个指标上。比如谁掌握了入口、谁有获客优势、谁能拿到用户的历史数据。这些恰恰是腾讯这样的公司最有优势的地方。
如果把去年的 ChatBot、AI Coding,再到今年的 AI 办公放在一起对比,会发现 AI 应用的竞争焦点确实一直在往上层迁移。
最开始的 ChatBot 拼的是模型能力,那时候谁的模型能力强,谁的产品体验就更好。但到了后来的 AI Coding,大家发现,光模型强还不够,Harness 也很重要。因为在长程任务里,模型怎么调用工具,怎么处理错误,会直接影响最终的结果。
现在到了 AI 办公,又开始发现,Model 和 Harness 上面,还有 Context。
所以我一直觉得,AI 办公这种通用级 Agent,最后大概率还是大厂或者超级明星创业公司的生意。因为做到这一步,已经很难靠一个单点能力赢了,后面牵扯的东西会越来越多。
显示更多
看了一期吴恩达的播客,非常精彩。而且这次他的观点很激进,说每个人都应该成为 Builder,借助 AI,往生产端走。
别只拿 AI 问问题,而是要开始真正动手创造,做网站、做 App、做小工具,把自己的想法直接变成产品。
包括他们公司说现在面试候选人,会直接问候选人到底 Build 过什么。
如果候选人之前拿 AI 做过一个网站、App、Skill,或者任何解决自己实际问题的小工具,这种经历都会非常有说服力。
因为这考验的已经不只是会不会用 AI。
现在会用 ChatGPT 问问题,或者 Codex 做个 PPT、数据分析,门槛已经很低了。更进一步的能力是你能不能发现一个问题,把它抽象出来,再借助 AI 把解决方案真的 Build 出来。
这里面其实同时考验了一个人对 AI 的使用能力、抽象能力和创造力。
我最近跟很多朋友聊天,也发现大家招聘时越来越喜欢问一个问题,你的作品是什么?你到底拿 AI Build 过什么?
我觉得所有人确实都应该认真想想这个问题。
以前 Coding 基本还是程序员的专业能力。一个市场人员、招聘人员或者财务人员碰到一个软件需求,正常的处理方式都是提需求,然后找工程师。
但现在这个门槛已经降得非常低了。
一个人拿着 Codex、ChatGPT 这些工具,只要问题足够明确,做一个自己工作里用的小工具,已经没有以前那么难了。
这个变化有点像 Excel 出现之后。
以前很多数据处理工作可能需要程序员参与,后来财务、市场自己打开 Excel 就可以分析数据了。AI Coding 也在发生类似的事情,它正在把过去属于软件工程师的一部分能力,逐渐变成知识工作者的基本能力。
吴恩达说他们团队成员已经在给自己不断的造工具了。
有个运营同事,为了写文章,自己做了一个 Mac 桌面 App。准备写一个选题时,这个 App 会自动爬取网页,寻找相关资料,把相关文章整理出来。然后他可以直接和整个资料库聊天,了解自己正在写的内容和已有资料之间有什么关系。
你看,这已经完全超出了会不会用 ChatGPT。
还有他们的财务团队以前每周要花几个小时打开各种文件、复制数字、检查数据。后来团队自己开始开发自动化程序,可以定期打开文件、读取数据、检查一致性,有异常再提醒相关的人处理。
这背后的逻辑其实非常简单。
以前开发软件太贵了,所以工程师必须集中在专门的工程部门。每个业务部门内部当然都有一堆问题,也都有很多想做的小工具,但一个需求如果只能帮三五个人节省一点时间,根本排不上工程师的开发计划。
现在 Build 的成本降下来之后,这些过去不值得开发的东西突然都可以开发了。
而且最了解这个问题的人,本来就在业务部门。
做招聘的人最知道招聘哪里麻烦,做市场的人最知道自己每天有哪些重复工作,做财务的人也最清楚哪些数据天天需要人工核对。
现在他们第一次有能力自己把这些问题做成工具。
所以我觉得未来每个人在某种程度上都可以成为一个工程师。你不需要成为一个专业程序员,但应该逐渐具备用软件解决自己业务问题的能力。
吴恩达说他们最近还分析了很多的招聘数据,发现越来越多职位描述中开始强调一个词:High Agency,高主动性。
简单说,就是一个人发现问题以后,会自己想办法往前推进,而不是等老板把每一步都拆好,再告诉他接下来干什么。
按部就班的工作,价值感只会越来越低。
有了 AI 的帮助,一个 High Agency 很强的人,确实可以比过去创造更多东西,也可以自己解决更多问题。
优秀的员工会越来越像一个负责自己领域的小创业者。他知道自己的目标是什么,然后自己发现问题,做出判断,缺工具就 Build 工具,最后解决问题。
所以我现在越来越觉得,大家讨论 AI 会不会替代工作,有时候把问题想得太简单了。
吴恩达讲了一个我很认同的框架。
一份工作里面,可能已经有 30% 到 40% 的任务可以交给 AI,但剩下的 60% 到 70% 依然需要人来完成。所以绝大多数职业不会突然消失,真正发生变化的是一个岗位内部的工作内容会重新分配。
最后更现实的结果,还是人和人之间的竞争。
一个人可以把那 30% 到 40% 交给 AI,然后把自己的能力范围继续往外扩。另一个人还按照以前的方法工作,只负责自己原来那一小块,那公司最后更愿意留下谁,其实很好理解。
我一个朋友之前的公司里,Android 和 iOS 加起来有三个人。后来公司觉得人员有些冗余,最后留下一个人,几个端都可以负责。
你说这是不是 AI 导致的?当然和 AI 有关系。
但落实到职场里,它最后呈现出来的还是人与人之间能力范围的差距。一个人借助 AI 可以覆盖过去几个人的工作,另外一个人的工作方式没有变化,公司自然会重新计算这笔账。
我今天还在群里跟大家聊,以前总有人说前端已死,但好像最近已经没人讨论这个问题了。群里有朋友开玩笑说,死人当然不会说话。
我还真去翻了一些前端工程师的简历,发现一个很明显的变化,很多人已经不再把自己局限在纯前端了,而是突出全栈的能力。
吴恩达在播客里也提到了这个现象。过去前端、后端的分工很细,但有了 AI 以后,越来越多开发者开始变成全栈工程师。因为 AI 把跨领域学习和执行的成本降低了,一个人能够覆盖的工作范围自然会扩大。
而且这件事肯定不只发生在程序员身上。
以前一个做营销的人,可能只负责投放。现在借助 AI,他能不能从选题、研究、内容生产,一直做到投放和后面的数据分析?
一个人在组织里的能力半径会越来越大。
想起之前纳瓦尔说的一句话:成为一名创造者,你将不必担心工作、职业和 AI。
是的,什么时候都尽力去创造,去解决问题。别给自己留所谓的垃圾时间。
显示更多
硅谷 AI 精英,最近尤其眼红乌兰察布。
最近我看高盛、彭博、Wired 在讨论中国 AI 的时候,居然都提到了乌兰察布。他们说这座内蒙古的小城,正在成为中国 AI 基础设施版图里的算力重镇。
因为 AI 的竞争,归根到底就是能源的竞争。你看马斯克今年一直在提太空数据中心,其中一个很重要的原因,就是未来 AI 需要的电实在太多了,到了太空以后可以直接利用大量太阳能。
OpenAI 也一样,Sam Altman 直接说他们公司的本质是把电力转化成有用的智能。
那为什么是乌兰察布呢?
因为乌兰察布同时满足了几个条件:1)天气冷。2)电便宜。3)绿电多。4)离北京近。
我对乌兰察布很熟悉,这几年暑假总会去他们那的黄花沟转一圈。所以必须得好好写写。
这么讲吧,乌兰察布这地儿一年到头基本就俩季节,一个是冬天,一个是夏天。而且冬天极其漫长。我查了下数据,年均温度只有 4.3°C。
记得有年 9 月中旬去乌兰察布的草原玩,晚上给我冻的瑟瑟发抖。问了下朋友,他说乌兰察布一般过完十一没多久就开始准备供暖了,一直持续到第二年四月中旬,差不多有半年时间都在供暖。天气真正热起来,也就七月和八月俩月。
乌兰察布海拔大概是 1400 米,然后又刚好处在西伯利亚冷空气南下的一条通道上,北边的冷空气经过蒙古高原一路下来,所以这里不光冷,风也特别大。
冷、风又大,对于生活在乌兰察布的老百姓可能不算舒服,但对于数据中心来说,这反而全是优势。天气冷,一年大部分时间都可以利用自然冷源,降低散热成本。风大,又意味着这里有非常好的风电条件。
同样一股冷风,一边帮数据中心散热,一边还能发电。哈哈哈哈哈哈哈。
而且这里的电还便宜。
内蒙古本来就是能源大省,风电、光伏很多,煤电也非常充足。像乌兰察布,2025 年风电和光伏的发电量加起来,已经快占到全市发电量的一半。这几年风电、光伏还在继续增加。
到了 AI 数据中心这个规模,电价到底有多重要?平时我们生活中会觉得,一度电贵几分钱、便宜几分钱,好像没多少钱。但到了 GW 级数据中心,完全不是这么回事。
我给大家粗算一笔账。
假设一个园区平均负荷是 1GW,平均负荷率按照 90% 计算,一年大概消耗 78.84 亿度电。
2026 年 8 月,蒙西电网代理购电价格大约是 0.3234 元一度,冀北大约是 0.3857 元一度,两边只差了 6 分多钱。
但就是这 6 分多钱。78.84 亿度电算下来,一年就是大概 4.91 亿元。也就是说到了 GW 这个量级,一度电便宜几分钱,一年就是几个亿......
而且刚才说了,乌兰察布还有一个很大的优势,就是绿电特别多。
绿电简单理解,就是风电、光伏这些可再生能源发出来的电。为什么这件事对 AI 数据中心越来越重要?还是刚才那笔账,一个 1GW 的园区,一年接近 80 亿度电。如果这些电大量依靠煤电,背后的碳排放会非常夸张。
现在全球的大公司都在关注碳排放,Google、微软这些公司建设数据中心的时候,也会非常在意电力里面有多少来自风电、光伏这些清洁能源。
甚至可以预测,以后大家讨论一个模型的成本,除了 Token 的成本外,可能还会开始关注这个 Token 背后的能源消耗和碳排放。
写到这里,可能有人会追问,那宁夏中卫、新疆这些地方,电也很便宜啊。那里的风电、光伏资源甚至可能比乌兰察布还丰富。
这就要讲乌兰察布的另外一个优势了。大家如果经常坐火车,可能听过乌兰察布的城市口号,北京向西一步,就是乌兰察布。
它离北京只有大概 350 公里,高铁两个小时左右就能到。
北京本身就是国内 AI 公司、科研机构和互联网公司最密集的地方之一。你把算力继续往宁夏、新疆搬,电可能还能更便宜,土地也更多,但网络时延也会越来越高。
以前做云计算的时候,西部数据中心主要承接存储备份、离线计算这些不着急的活,慢几十毫秒根本没什么影响。大模型训练其实也一样,训练任务一旦跑起来就是几天、几周,对北京到机房这点时延并不敏感。
但现在 AI 还有越来越多的算力用在推理上。Agent 执行一个任务,中间还要不停的调用模型和各种服务。这些直接面对用户的计算,对于时延非常敏感。
这也是乌兰察布相比宁夏、新疆最重要的优势。电已经足够便宜了,同时离北京还只有几百公里。
查到一个数据,乌兰察布从 2017 年开始建设直达北京的光缆,后来又建设了第二条。公开数据里,乌兰察布到北京的网络时延可以做到 5 毫秒以内,其中一条线路大约是 4.2 毫秒。
所以乌兰察布的优势恰到好处。
往西走,宁夏、新疆的电可能还能更便宜,但离北京越来越远。往东走,距离北京更近,但电力和土地的成本又更高。
刚刚我兴奋地把这些事讲给了乌兰察布的朋友,他只问了我一句话:
这能给乌兰察布带来多少就业机会?
一时不知道怎么回答。说实话,算力中心能带来的就业机会,少之又少。
显示更多
终于等到了国模一哥智谱的财报。
今年上半年收入同比增长接近 400%。我看有人觉得总收入没有预期高,我倒觉得还好。因为国模真正开始大规模商业化,其实也就是最近几个月。
大家可以想想,自己真正觉得国产模型已经可以和 OpenAI、Anthropic 交替着用,大概是什么时候?至少我的感受很明显,就是今年 3 月之后。
所以这轮国产模型能力提升,真正完整反映到收入里,应该是下半年。从 ARR 也能看出来,智谱在财报会上解释,16 亿美元 ARR 是用 8 月单月收入乘以 12 算出来的。
倒推下来,8 月单月收入已经达到 1.33 亿美元,折合人民币大约 9 亿多。
刚刚把智谱财报会听完了,信息量挺大的。我快速写下自己的理解。
1、按照智谱管理层的说法,GLM-5.3 的提升全部来自后续训练。他们扩大了任务环境,把训练内容从普通 Coding 任务,扩展到更加接近专家真实工作的完整任务。
在基础架构、参数等保持一致的情况下,仅仅扩大后训练规模,端到端任务完成率提高超过 50%。
他们认为,决定模型上限的是四个因素的组合:基座规模、有效深度、训练深度、任务环境。
这四个维度的边际收益会不断变化。某个阶段后训练的空间最大,就先把后训练做深。如果后训练吃得差不多了,就再回过头扩大基座参数。
基座继续做大以后,还要考虑激活参数和有效深度之间的平衡,既不能让激活量太大拖慢推理,又要想办法增加每个 Token 实际经历的计算深度。
对于 GLM-5.3,他们的逻辑是,后训练和任务环境还有很大空间,所以先把同一个 Base 榨得更彻底。等这部分收益开始见顶,再考虑回来迭代 Base 模型。
2、所以智谱现在的节奏,并不是每发一个版本就重新训练一次 Base。
像 GLM-5.1、5.2、5.3,都建立在同一个大基座上。智谱会先通过中训练、后训练和任务环境,把这个 Base 的能力尽可能往上推。等这一轮的边际收益开始下降,再切到下一代更大的基座。
现在,他们判断 GLM-5 这一代的后训练已经吃掉了很大一部分空间,所以下一步会重新回到 Base Scaling。
但下一代也绝对不只是简单把总参数继续往上堆。他们想同时做三件事:
第一,把模型的总规模继续做大,抬高能力上限。
第二,控制每次推理真正激活的参数量。因为几 T 的模型如果每个 Token 都激活大量参数,那推理速度肯定会明显下降。
第三,提高有效计算深度。尝试 Loop Transformer 一类的思路,让同一批激活参数经过更多轮计算。这样不需要简单增加激活参数,也可以增加每个 Token 实际经历的计算量。
3、智谱判断,接下来模型可能会出现两条价格曲线。
第一条是,同等智能水平的模型,价格会持续下降。GLM-5.3 Flash 就是在走这条路,用更低的成本提供接近甚至超过上一代旗舰模型的能力。
第二条是,真正能打开新任务边界、明显提高任务成功率的前沿模型,仍然会有溢价,甚至价格还有继续上涨的空间。
所以,现在他们对于模型的定位非常清楚。GLM 5.3 继续探索智能的上限,主要覆盖复杂 Coding、Agent 和高价值任务。GLM-5.3 Flash 则是主打性价比,负责高频、大规模调用。
4、还听到一个有意思的指标叫算力乘数。
简单理解,就是每投入 1 元算力,最后能换回来多少 API 收入。当然,这个算力包括训练和推理两部分。
今年上半年,智谱的算力乘数同比提升了 14 倍。为什么能提高?一方面因为模型变强了,每个 Token 能承担更复杂、更高价值的任务。另一方面 Infra 效率也在提升,完成同样任务需要的成本更低。
感觉这个指标可以一针见血的表达大模型公司的竞争的第一性原理。
5、和国产芯片的结合。GLM-5.3 Flash 上线时,背后已经大规模使用国产芯片集群,6 天跑了 60 多万亿 Token。
接下来更难的是效率和成本。智谱过去半年也明显把更多精力放到了 Infra 上,重新做推理引擎和服务栈,又做了 PD 分离、量化、Layer Split、缓存和通信优化。
同样的国产硬件,端到端服务性能相比最初基线提升了 3 倍,单位 Token 推理成本相比年初下降 80%。
6、智谱也毫不避讳的谈到了中国模型公司的算力约束。
他们的思路是尽量从数据、后训练、任务环境和工程效率中弥补差距。
其实这也是前两天硅谷风投 Dimension 总结的,芯片的出口管制反而逼出了国内极强的工程效率文化。
算力有限的时候,可以先 Scale 数据、后训练和任务环境。推理太贵,就继续做架构和 Infra 优化。等这些方向的收益开始下降,再回头扩大基座。
本质上仍然是刚才说的,同样的算力,怎么尽可能换来更多模型能力。
7、另外,智谱也正面回应了大模型怎么商品化的问题。
他们承认,单次 SOTA 本身很难形成长期定价权。今天 Benchmark 第一,可能几周以后就会被追上。在基础的任务上,模型之间已经没什么差距了。
但同时,模型也不会因此完全变成没有差异的商品。真正能拉开差距的,是模型迭代速度、真实任务完成率、单位智能成本,以及能不能进入客户更深的工作流。
尤其任务越长,模型之间的差距反而越容易被放大。回答一道题可能只差几分,但连续跑几个小时的软件工程任务,中间要调用工具、处理失败、重新规划,最后能不能把任务做完,差距会非常明显。
而且模型一旦进入客户的代码库、工具链和内部工作流,周围还会积累 Prompt、Agent Workflow、权限体系、评测标准和各种工程适配。这个时候换模型,也不只是换一个 API 地址,迁移成本会越来越高。
所以智谱的判断是,简单能力会越来越商品化,但真正能完成复杂任务、进入真实工作流的前沿模型,依然会有很强的差异化和定价权。
8、智谱下一步想做的,是让模型开始参与下一代模型的训练。
现在已经能看到一些早期迹象。比如通过 Model vs Model 自动生成、筛选数据,用 Agent 收集任务、搭训练环境、生成 Verifier,甚至直接参与推理系统的优化。
这些能力目前还散落在不同环节里,但方向已经非常明确。过去需要大量人工完成的数据生产、环境搭建和 Infra 优化,未来都可能逐渐交给模型。
唐杰提到,他们希望进一步把这件事贯穿整个训练流程,从 Pre-training、Mid-training 到 Post-training,都让模型参与进来。他把这个方向叫 Fully Self-training,其实就是 OpenAI 提到的 RSI。
以上,希望对大家有启发。有时间的话,大家还是全部过一次智谱的财报电话会,还是很有启发的。
显示更多
感觉所有的自媒体,都该看看快手程一笑的分享。
认真看完了快手创始人程一笑在今年光合创作者大会上的分享。说实话,程一笑现在很少公开露面,类似这样的分享很难得。我现在也在做自媒体,所以也非常关注国内头部内容平台一号位对于内容行业的判断。
程一笑说,快手内容正从大品类向更细分领域纵深发展。快手上深耕垂直领域的创作者,现在月人均收入是泛流量作者的 2.2 倍。
划重点,大家注意这个数据。非常反常识。
这和我们过去对于自媒体账号的理解完全不一样。以前起号,都喜欢选择一个受众足够广的方向。毕竟只有这样才容易涨粉。粉丝多了,后面才有机会变现。
但这两年,逻辑确实在发生变化。因为泛流量的内容,越来越难和用户建立起深度的信任关系。而没有信任和个人品牌,变现会越来越难。
其实大家看我这个小红书账号,也是类似的思路。起初的时候,我还会写一些职场、管理类的内容,后来,我逐步聚焦到 AI 的方向上,努力写出获得感。其实这是我深思熟虑的选择。
几年前,我和同事尝试过搞笑类的短视频,当时的账号叫来广营小盖。这些内容老少皆宜,确实有流量。但后来会发现,这类流量的粘性非常差,商业化也比较困难。我当时知道的一些类似账号,现在几乎都已经不做了。
核心就是因为大家看搞笑内容,很多时候就是图一乐。笑完这条也就过去了,很难因为这个持续信任你。再加上核心用户比较泛,也很难基于这批用户去提供一个稳定的产品或者服务。
程一笑这次还分享了个案例,一个叫梨青青的 20 多岁的博主。
说实话,这个博主我之前完全没听过。查了一下才知道,人家创作的是 JK 制服相关内容。不好意思,我确实老土,之前完全不了解这个圈子。
梨青青的视频其实非常朴素。我看了下,她基本都在介绍怎么区分正版和山寨,买这些东西的时候有哪些坑之类的内容。感觉基本都是圈内人才会关心的具体问题。
但你想,JK 制服能有多大的受众?和美食、游戏、体育相比,肯定小得多。有意思的是,梨青青的粉丝很快就做到了百万级,后来还做联名产品,单个产品 GMV 就超过了 1200 万。
这就是程一笑说的那个观点。快手的内容生态已经从大品类逐步过渡到小圈层。所以,他们在培养或者扶持细分圈层标杆作者。其实不只是快手,小红书等等其他平台也是如此。
再讲个故事。今年春节,我和高中同学交流,他在做自媒体。选题就是刚刚提到的泛人群,几乎每天就是找热点,然后表达自己的看法,最后再通过直播变现。
他干了小半年,很累,没有什么收成。然后过年的时候喝完酒,我当时就觉得他做的事情,从逻辑上推演很难做出商业结果。
热点内容肯定容易获得推荐,但几乎也是水过地皮湿,很难在用户心中留下印象。就像这两天景甜的事情,我刷到过很多视频,可是真正愿意让我关注的根本没有。这类内容本质就是找个乐子,吃瓜嘛。
我真正愿意关注的,通常还是那些能让我形成稳定预期的账号。要么我觉得他讲的东西对我有帮助。要么是这个博主本身就很有意思,他做的事情很吸引我。
而做泛内容,像我哥们,今天讲明星,明天又追其他的热点,真的很难和用户建立起信任。
而没有信任关系,做直播电商就只能靠吆喝和价格刺激。但真拼价格,他又怎么可能拼得过那些大主播。
今年,我越来越能感觉到程一笑说的这个趋势。所有的平台都是如此。所以我觉得所有做自媒体的朋友,早点对所谓的大赛道祛魅吧。
说到这里了,话多了。再说一个我看到的机会:做县城的垂直三农类 IP。这事我观察了很久,蠢蠢欲动,但无奈精力不够。大家感兴趣可以试试。
我觉得中国几乎每一个小县城,都有机会长出一两个这样的头部账号。这类账号的内容根本不用做得多复杂,就是记录当地最真实的生活。
秋天收玉米了,跟着家里人下地收玉米。明天村里谁家娶媳妇,就去记录一场农村婚礼。
赶集、杀猪、修房子、做家乡菜,这些我们从小大家都习以为常的事情,其实都是内容。连普通话都不用讲,直接说老家方言。因为这类账号服务的人群就是当地人,以及在外的游子。
目标用户刷到这些内容,看到熟悉的村庄和生活方式,天然就会有一种无法言说的亲近感。时间久了之后,大家认识你,然后再去直播带货卖当地的醋、小米、杂粮等等,就会非常顺。
真的,程一笑的分享,也让我再次意识到一件事:一定要认认真真做有价值的垂类内容。只追求泛流量的阶段,真的已经过去了。
显示更多
腾讯 Hy4 preview 内测的真实感受。
现在这个模型竞争是真的激烈。完全没想到,腾讯混元 Hy4 preview 这么快就来了,之前很多人还预测说得年底。我昨天一早拿到了内测名额,干了 2000 多万 Token,还是想和大家说下我的真实感受。
先说模型基本的配置,这现在看模型,就和手机一样,得先看参数。Hy4 preview 的基本面是:
1)总参数 770B、激活参数49B。
2)1M 上下文。
3)输入缓存命中 0.3 元。
能看出来,确实腾讯也在逐步提升模型的总参数量,这也是意料之中的事情。目前各个公司都在追求更大规模参数的模型,毕竟大参数和模型之间,还是有直接的对应关系。
Benchmark 等等能在其他地方查到的信息,我就不说了。直接谈谈我的使用感受。
1、Hy4 preview 仍然在快速进步,综合能力基本上已经逼近 GLM-5.3 的水准,超过 DeepSeek V4 系列。这次之后,我觉得腾讯的模型也正式跨入到国内第一梯队的水准了。至少和之前我们讨论的 Kimi、GLM 等等模型,可以有来有回了。
2、或者这么说,我这两天全天候在 WorkBuddy 中深度使用 Hy4 preview。在我日常跑的这些 Coding 或者办公任务里,已经很难明显感觉到 Hy4 preview 和其他几个头部模型之间有什么差距。感受不出来,根本感受不出来。有更复杂 Coding 场景的同学,也可以试试,评论区里交流。价格还是非常便宜。
3、我让它做了一个北京地铁动态交互网站,前前后后大概跑了半个多小时。大家可以直接看效果。其实它第一次生成出来的版本,完成度就已经非常高了。这个 Case 我之前也试过 Hy3 正式版,基本做不出来。所以单看前端 Coding,Hy4 preview 相比 Hy3 的提升还是非常明显的。
4、我把自己目前正在跑的一个后端项目交给它,让它帮我检查里面可能存在的漏洞。其中有一部分涉及订单场景,不同平台的支付逻辑交织在一起,代码本身还是比较复杂的。Hy4 preview 最后真的找到了一个并发场景下,订单号和支付逻辑之间的 Bug。
这部分代码其实是 GPT-5.6 写的。后来我也让 GPT-5.6 自己重新反思、检查了一遍,它没有找到这个问题,Hy4 preview 反而找到了。当然,一个 Case 不能说明两个模型谁一定更强。但至少这个结果挺让我意外的。
5、不用猜,Hy4 preview 这次肯定在后训练方面,着重优化了办公任务。毕竟腾讯的 WorkBuddy 现在重点在渗透知识工作者,这类人群的杀手级的应用场景就是文档处理、数据分析等等。
我给了它一个比较复杂的审计任务,需要在几张表之间来回比对数据,最后根据这些数据找出问题,再给出结论。这个任务其实很考验模型能不能一直记住前面的业务规则,同时把几张表里的信息真正对应起来。
6、最后我还顺手测了一个比较有意思的 Case。我把我们产品的 Logo 给它,让它只用纯 HTML,帮我做一个动态效果,有点像之前 Grok Bot 那种感觉。大家也可以直接看最后的效果。半个月前,我同样也让 GLM 5.3 跑过这个 Case,现在,已经难分伯仲了。
7、当然,仍然也还是有一些缺点。比如模型仍然会有不同程度的过度思考。地铁那个 Case 里,我看到模型在生成动画时,它会花很多时间反复检查一些其实已经没有问题的细节。
这个问题在长任务里会更加明显。模型能力强了以后,它确实会习惯性的反思,但反思太多,任务时间就会被拉长。
尤其是一些需求非常明确的小修改,我其实只希望它赶紧改完,不需要每一步都想得那么复杂。我看到官方也提到这个问题了,最近我用 GPT 5.6 和 5.6,也会遇到类似的问题。
8、另外就是审美。虽然比 Hy3 preview 有提升,但我感觉 Hy4 在后训练上,应该还没有花很多精力做这件事。
就像 Logo 动画那个例子,我提示词比较简单的时候,它生成的第一版还是会出现一些比较难看的光晕、渐变,包括元素之间的比例和动效节奏,也容易往那种很典型的 AI 审美上靠。
当然,如果我继续给它反馈,让它把这些东西去掉,最后是可以改得非常完美。所以问题更多还是默认审美没有做到特别好。希望正式版的时候这个问题可以解决。
显示更多
做 AI PM 的朋友,可以看看这个产品的反思。
一个特别明显的感受是,几乎所有移动互联网时代发展起来的产品,现在都在思考同一个问题:怎么把成熟产品进一步 AI 化。
这件事挺难的。
AI 化稍微激进一点,用户可能会疯狂吐槽。因为很多产品大家已经用了十几年,原来的交互方式和使用习惯早就形成了。你一下子改变使用方式,很多用户肯定会不适应。
但反过来,完全不做 AI 探索也不行。AI 带来的新交互和新能力,会直接影响产品未来的竞争力。
今天看起来用户还习惯原来的方式,但哪一天习惯真的发生变化了,再追可能就晚了。
前段时间我跟飞猪的朋友聊了一下他们最近在做的事情,感觉还挺有启发。
飞猪同样也是移动互联网时代发展起来的旅行产品,现在也在重新思考刚才那个课题。他们之前的问一问也有过一段时间的热度,现在最新的 AI 叫飞猪帮帮。
具体产品我就不展开介绍了,大家感兴趣可以自己去看。
目前看这个产品形态肯定也不是终局。但我觉得他们探索过程中的思考还是很有价值。
一个成熟产品真的开始往 AI 方向优化的时候,很多以前只停留在概念里的问题,都会变成非常具体的产品和技术问题。
他们在这个过程中积累的一些经验,我觉得挺值得记录下来。
乍一看,飞猪是在一个成熟产品上做 AI 化,但它的底层逻辑,和今天的 Coding Agent 非常像,都是模型 + Harness + Memory。
Coding Agent 调用的工具是文件系统、终端、浏览器,旅行 Agent 调用的工具是机票报价引擎、酒店库存系统、景区数据接口等等。工具不同,架构是同一套。
我们看到的所有成规模的 Agent 产品,最后都会收敛到这个结构上来。
没聊之前觉得这事很简单,不就是在已有接口上接一下模型 API 嘛,聊完之后才发现远远不止于此。
他们甚至连模型都是自己在开源模型基础上微调的。因为只靠调用通用模型的 API,有很多问题没办法解决。通用模型不能理解具体的业务逻辑,需要加很多规则做限制。
而且更麻烦的是数据安全没办法保证,没有谁愿意把自己的业务数据交给通用模型,这对用户也不负责。
所以,他们搭建了自有的训练环境和数据管线来做后训练,在开源模型的基础上训练出面向旅行场景的自有模型。这一点我完全没想到。
旅行产品本身有自己的表达方式和业务经验。比如一个用户跟 AI 说我周末想出去放松一下,模型如果机械地理解周末,可能会安排周六一早出发。
但对一个上班族来说,很可能想的是周五晚上下班直接走,或者周六睡个懒觉再出发。这些是这个行当里默认的经验,需要通过后训练固化到模型层面。
如果靠规则来约束,推理的时候效果就会差很多。
作为一个成熟的产品,飞猪手里本来就有大量旅行场景的数据和任务,通过后训练让模型慢慢理解这些需求,效果就会好很多。所以,他们在后训练上花了非常多功夫。
具体的做法是把真实的旅行场景建模成智能体编程的任务,让模型在真实工具调用的环境里学习。
而且因为旅行和电商不太一样,价格和库存都在快速变化,差一分钟问同一个问题正确答案可能完全不一样,所以训练环境必须是在线的、实时的。
这类模型也不需要追求智能的上限,甚至不需要做那么多轮次的推理,毕竟用户等不了那么长时间。要不然用户着急买机票呢,还得等 50 秒的推理,谁能有这耐心。
跟上一代做移动互联网产品一样的逻辑,每慢一秒,用户就会流失一批。
模型是大脑,但光有大脑根本不够。真正做成产品,还需要在模型外面加一层 Harness,负责工具调用、规则约束和结果校验。
比如像刚才说的旅行场景里,机票价格和库存一直在变化,这些信息不能让模型凭记忆生成。
模型理解完用户需求之后,必须去调用真实的机票库存和交易系统,最后展示给用户之前还要做一次校验,确保价格、库存这些关键信息仍然有效。
所以我现在越来越觉得,很多垂直 Agent 的技术路径,其实跟 Claude Code、Codex 这类 Coding Agent 非常像。
底下是模型,上面是 Harness。真正的产品能力,很多苦活累活都在 Harness 这一层。所有的 Agent,架构应该都会趋同:模型 + Harness + Memory。
有一些规模不大的 Agent 可能模型可以直接用通用模型 API,但上层的 Harness 和记忆肯定是得自己做。
所以 Agent 产品真正的苦活累活都在 Harness 这一层。模型解决的是理解和推理,但现实世界里的数据校验、异常处理、兜底逻辑,全得靠 Harness 来扛。
哪怕是规模不大的垂类 Agent,模型直接用通用的也能凑合跑起来,但 Harness 和记忆这两层一定得自己做。
Agent 的架构上,他们之前的思路更偏 Multi-Agent,把功能拆得非常细。
酒店一个 Agent、机票一个 Agent,每个 Agent 负责一件事,上层有一个总 Agent 负责编排和调度。
这个思路问题是 Agent 一多,上下文需要在不同 Agent 之间不停传递,容易出现信息丢失,调用链路也非常长,产品出了问题还非常难排查。
现在,他们结构精简了很多。随着模型能力快速进化,在做好 Harness 的前提下,一个 Agent 现在可以同时负责几件事。
即便是面对机票、酒店、门票这些库存性质和使用规则截然不同的品类,一个 Agent 也可以灵活调用机票查询、酒店查询、门票查询、Web Search 等工具来包办。
最后是 Memory。飞猪在记忆这块做了三层:长期记忆、中期记忆和短期记忆,能够把用户跨时间的行为和偏好整体关联起来。
用户喜欢住高档酒店,喜欢坐某个航空公司的航班,这些东西跟 Agent 说一次就好了,如果每次都要重复,用户就很毛躁。
我理解他们三层记忆的分工是这样的。长期记忆是用户画像和长期偏好。中期记忆解决跨会话的问题,比如这几天已经讨论过一次去日本旅行的事,下次再聊 AI 还是知道的。
短期记忆就是当前会话的信息。
这套机制和 ChatGPT 的记忆逻辑也类似。大家感兴趣的话,也可以查查。
另外,我想再说下对于交互的思考。几年前经常看到一种判断,有了大模型之后,LUI 也就是自然语言交互会慢慢替代 GUI。现在来看这个判断过于乐观了。
在一个成熟产品里,用户惯性非常大,而且 LUI 在很多场景里其实比较低效。包括 ChatGPT,我们看到它自己也在 LUI 里融合 GUI,说明这两种交互各有擅长的场景。
需求已经非常明确、追求精确的时候,GUI 很好用。打车就是一个典型例子,已经知道去哪了,地图上输两个字,选一个位置,弹出列表,点一下,选择车型,搞定。
如果这些步骤全部改成对话,体验反而更差,速度也会慢很多。
但碰到模糊需求或者条件非常多的时候,LUI 的优势一下子就出来了。比如想找一张机票,要求从迪拜中转,最好是过夜航班,不需要过境签,两段航班尽量是同一航司。
这种需求在 GUI 里不停地筛选,整个过程非常痛苦,但用自然语言一句话就能说清楚。
飞猪帮帮的做法就是把 LUI 和 GUI 融合在一起。用 LUI 来驱动 GUI,达到更丝滑的搜索和筛选效果。
到现阶段,客观地看,对于大部分产品来说,GUI 才是主体,LUI 是给用户增加一种以前没有的表达需求的方式。直接一把梭哈纯 LUI,实在是为了 AI 而 AI。
很多人觉得做 AI 原生应用就得是纯 LUI,这完全没有 get 到要点。原生不原生只是一个概念,最终还是要以满足用户需求为基础。
所有成熟产品,都得重过 AI 这一关。
显示更多
The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。
他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。
GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。
在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。
那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。
后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。
但是 O1 之后,整个行业都发现了 RL 的重要性。
大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。
我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。
这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。
Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。
举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。
但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。
这些就是 Atomic Skills。
进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。
所以,如果 Base Model 的目标变了,预训练的数据自然也会变。
前面说过,GPT-3 时代网页文本占了训练数据的 85%。而现在一些新模型里,这个比例已经降到了 15% 左右,代码反而成了占比最大的数据来源。
背后的逻辑其实很好理解。
现在模型公司已经非常清楚模型需要的关键能力,诸如 Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。
所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近 Agent 任务的数据,也开始提前进入预训练。
这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。
比如我们已经知道,未来模型需要很强的 Coding、Reasoning 和 Agent 能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。
原来只是一段代码,现在可以把它变成找 Bug、修改代码、调用工具、连续完成任务的训练样本。
这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。
模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。
这些变化,也催生了现在经常听到的 Mid-training。
原因也很好理解。
预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对 Reasoning Trace、Agent 交互记录、多轮工具调用、长上下文任务。
前后两个阶段的数据分布差别可能非常大。
如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。
对 MoE 模型来说,这个问题会更加明显,因为预训练过程中不同 Expert 已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。
所以 Mid-training 可以理解成一个过渡阶段。
在正式进入后训练之前,提前让模型适应更长的 Context、更接近 Reasoning 和 Agent 的数据,以及未来真正会遇到的任务分布。
这样 Pre-training 和 Post-training 之间就不会切得那么生硬。
所以整体来看,Pre-training、Mid-training、Post-training、RL 这几个阶段之间的界限,确实已经越来越模糊了。
或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning 和 Reinforcement Learning。
前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。
回到开头那个标题。The Base Model Is Dead 当然是个有点夸张的说法。
Base Model 没有死,真正变化的是它在整个模型训练体系里的角色。
过去我们希望 Base Model 尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为 Reasoning 和 Agent 准备的底子。
先把 Atomic Skills 准备好,再把更多复杂能力留给后面的 RL。
Base Model 依然重要,只是它越来越像一个起点。
显示更多
模型 Coding 能力的竞争,应该要结束了。
说实话,本来我对 GLM 5.3 没有抱太高的预期,毕竟这段时间,其他几个开源模型都已经把参数追到了 1T 之上.....而 GLM 5.3 仍然只有 700 多 B。差距很大。
但我今天我拿到体验资格,测试了六个多小时。坦诚的跟大家说,纯体感,我觉得 GLM-5.3 应该又继续回到了开源模型 SOTA 老大哥的位置了。
注意,只是我的体感。
我看智谱在博客里还是很低调,挺好的,国模也越来越有自信。不一定非得炸炸呼呼。
就像当年明月说的那样,张牙舞爪的人,往往是脆弱的。因为真正强大的人,是自信的,自信就会温和,温和就会坚定。
我不知道大家怎么看这些事,现在的几个头部模型,包括 GPT-5.6 和 Opus 5 在内,我已经很难再通过具体任务去分出孰强孰弱了。
只有在某个模型明显掉链子的时候,我才会一下子感觉出来差距。否则在大多数任务里,基本很难靠一两个 Case 立分高下。
我还是再说下 GLM 5.3 的基本情况,以免很多同学不知道:
1)整体模型架构没变。
2)总参数没变。
3)所有的优化全部来自后训练。
我真的预期 GLM 5.3 会把参数提升到 1T,没想到,居然没变。所以确实也如大家所说,智谱是后训练之王。
换个角度,如果智谱是要到 GLM 6 的时候才会把参数做到 1T 开外,那未来还是有很大的想象空间。
上午跟朋友讨论 LLM,我说我预判到了明年,Coding 这场模型战争可能真的快打完了。
因为就像我刚才所说,发展到现在,大部分任务中,几个头部的开源模型和闭源模型,大家已经是有来有回了。没有谁是碾压式的领先。
包括 Fable 5,如果用多了,我真感觉没那么玄乎,它最强的地方我觉得还是前端,给一个模糊的提示词,Fable 经常能自己发挥,做出审美和完成度都非常高的页面。后端方面,和 GLM 5.3、GLM 5.6 有明显差别吗?没有。根本没有。
所以,我感觉按照现在这个追赶速度,再往后跑个一年,Coding 这事上,几个头部模型的差距还能有多大? 或者最最头部的模型,还能强到哪里?我现在是打个问号的。
显示更多
和大厂的朋友、投资人聊了一圈,挺颠覆认知的。
这两天密集见了不少大厂朋友、猎头和投资人,收获特别大。以后准备每个季度专门抽两天时间,跟不同圈子的人聊聊。
平时埋头工作,还是很容易慢慢陷入到自己的信息茧房里。下面是这两天的一些笔记。
1、这源自一个猎头朋友的洞察。他说,整个行业现在真正缺的,是把 AI 变成实际生产力的人。
会用 WorkBuddy、ChatGPT、各种 Agent,很快就不算什么特别有价值的能力了,因为这些工具会越来越简单,人人都会用。
真正拉开差距的仍然是业务理解和判断能力。比如面对一个业务问题,能不能搞清楚问题卡在哪里,哪些环节可以重新设计,然后把整个流程跑通,交付一个真正有用的结果。
所以未来很多岗位的分水岭,根本不在执行能力上。只会按部就班完成任务的人,价值感还是很容易被 AI 压缩。
2、无论大公司还是小公司,现在都越来越追求人才密度。
以前一个团队里,有几个特别厉害的人,再搭配一些普通执行者,也能运转。但 AI 出来以后,这种结构确实在快速变化。
一个能力 80 分甚至 90 分的人,配上好的 AI 工具,能覆盖的工作范围会迅速变大。
举个例子,以前需要产品、研发、运营几个人一起完成的事情,现在一个能力比较强的人,自己就能先跑出一个七八十分的版本。
这时候 60 分和 90 分的人之间,差距就不只是 30 分了。高手借助 AI 放大自己的能力,能力一般的人,原来赖以存在的执行工作又恰恰最容易被 AI 接过去。
所以以后好公司可能会越来越倾向于少招人。一个岗位宁愿空半年,也不愿意为了把 HC 填满,随便找一个差不多的人。
3、一个做管理的朋友,之前每天差不多 80% 的时间都在开会、协调、沟通。最近因为一些变化,重新回到半一线状态,开始自己做产品、写东西、解决具体问题。
他说最大的感受是整个人突然重新有了创造的快乐。
这让我越来越觉得,这个时代纯管理岗的风险很大。一个管理者如果离开了组织和头衔以后,自己已经不会做任何具体事情,竞争力会越来越弱。
反过来,一个人如果还保持好奇心,愿意自己下场做东西,现在可能真的是一个特别好的时代。
4、跟几个朋友聊选人的逻辑,我越来越认同一句话:筛选远远大于培训。过去很容易有一种想法,觉得这个人能力差一点没关系,态度好就行,慢慢教。
后来会发现,一个人的思维方式、责任感、做事情的标准,改变起来非常困难。
尤其是成年人。一个人如果习惯了等靠要,很难靠几次培训让他变成一个主动发现问题的人。
所以无论是招普通员工,还是找合伙人,前面的判断特别重要。
发现不合适,尽快 say no,这样双方成本都更低。很多管理问题,表面上看是在讨论怎么带人,往前追一步,其实是当初选错了人。这话绝对是真理。
5、AI 越来越强以后,我反而越来越觉得审美和价值判断特别重要。
以前一个人做不出好东西,可能是能力不够。现在很多时候能力已经不是瓶颈了,真正的问题变成了,知不知道什么是好的东西。
AI 一次可以给十几个方案。如果自己没有判断标准,这十几个方案其实没有太大区别,最后只能挑一个看起来最顺眼的。
我想起呼兰之前的观点,他说接触一个新领域,最重要的是先去建立审美。
先大量看这个领域里真正好的东西,搞明白高手为什么这么做,什么算好,什么只是看起来热闹。有了坐标之后再去模仿,慢慢形成自己的东西。
6、吴军在一个访谈里说,懂行的人驾驭 AI,不懂行的人依赖 AI。
很多人觉得 AI 越来越强以后,自己就不用懂那么多了。领导给一个需求,交给 AI,AI 给答案,再交给领导,好像就能完成工作。
但仔细想想这个角色其实非常危险。因为这只是在领导和 AI 之间做了一层转发,既不清楚领导真正想解决什么,也判断不了 AI 给的答案对不对。
只要模型再往前走一步,这层人很容易就没有存在的必要了。所以 AI 越强,越不能放弃对专业本身的理解。懂得越深,越知道怎么问、怎么判断、什么时候该信 AI、什么时候该怀疑它。
这样 AI 才真正成为杠杆。
7、关于 AI 取代工作的焦虑,很多人其实是在消极面对。真正值得担心的可能不是某一天突然被 AI 替代,而是在未来五年、十年里,明明已经看见工作方式在变,自己却一直没有变。
历史上的技术革命基本也是这样。很少有人昨天还工作正常,第二天整个职业突然消失。
真正被淘汰的人,往往有很长的调整时间,只是这段时间里一直没有做出调整。
8、一个投资人跟我讲了一个区分能动性高低的框架,特别有意思。
能动性低的人,总希望行动之前把问题全部想清楚。这件事情成功概率多大?最优路径是什么?失败怎么办?能不能先给一个完整答案,再决定要不要开始。
但很多事情根本没有完整答案。只有真的做了第一步,现实世界才会给新的信息,然后才能决定第二步怎么走。
高能动性的人看待行动完全不同。第一步本身就是用来获取信息的。先做一个版本,先发出去,先找人聊,先试着卖,拿到真实反馈再调整。
AI 对这种人的价值非常大。过去一次试错可能要一周,现在一天可以跑很多轮。一个本来就愿意行动的人,迭代速度会变得非常夸张。
但一个人如果始终坐在那里,想靠思考把所有不确定性消灭掉,AI 给再多答案也没什么用。现实世界的反馈,没法被提示词替代。
9、人真的是环境的反应器。一个朋友前半年跳槽到一家 AI 公司,几个月没见,这次再聊的时候,非常明显地感觉到他整个人的状态都变了。
说话的方式、关注的问题、每天学的东西,跟之前完全不一样。
我们很容易低估环境的影响。总觉得自己是独立思考的,但实际上每天和什么人待在一起,大家讨论什么问题,周围人的工作标准是什么,会一点点改变对正常的理解。
身边所有人都觉得一天做完一件事已经很快,慢慢也会接受这个速度。身边的人每天都在试新工具、做新东西,也很难完全无动于衷。
有条件的话,尽量让自己待在一个好的环境里。环境没法直接把一个人变优秀,但它会不断告诉人什么叫正常。这个正常的标准特别重要。
10、日常工作里,可以刻意训练自己追求又快又好。
以前经常觉得,不着急的事情就慢慢做,反正时间还早。但最近越来越觉得,即使没有外部 deadline,也可以主动给自己设一个。
比如原来一天能做完的事情,试试看两个小时能不能完成,而且质量不能明显下降。一旦目标变成又快又好,就会被迫重新思考工作方式。
哪些步骤其实没必要,哪些事情可以交给 AI,什么时候最容易被打断,什么事情必须集中精力一次做完。
很多效率问题并不是能力问题,只是以前从来没有要求自己足够快。
速度本身也是一种训练。一个人开始习惯快速完成、快速反馈、快速迭代以后,单位时间获得的经验也会更多,最后又会反过来让质量继续提高。
显示更多
大厂光环给人的错觉
到上海出差,和一位在大厂的朋友闲聊。他说他们大部门的总监去年年底宣布离职创业,走的时候风风火火,特别骄傲。但没想到折腾了大半年后,最近又回来上班了。
最近,他给大家做了一次特别实在的创业经验分享,其中说了一句话,很是深刻:“ 那些过去曾经做出过成绩的人,需要知道哪些是时代给的,哪些是平台给的,哪些是团队帮的,哪些才是自己真正挣来的。大厂光环有时候会给人错觉。”
显示更多
我完全不理解为什么美团要做大模型,而且目前看,能力也是路边一条。美团利润那么薄,不像其他几个大厂能随便嚯嚯。相比之下,拼多多的选择就更有定力,也并不是每家公司都要成为硬科技公司吧。
显示更多
特想聊下智谱这两天的事。
看到群里有人吐槽说,智谱靠 Coding Plan 赚得盆满钵满,就这还涨价。既然涨价,为啥我不去用 DeepSeek?
看来这哥们是真不懂。我就借着这话茬子聊下自己的想法。因为我觉得,智谱这家公司整体还是挺良心的。
DeepSeek V4 Flash 正式版是便宜,但谁要是觉得这个模型和 GLM 5.2 同等水准,那我只能说,他根本没认真用。Flash 仍然是一个中等水平的模型,在长程任务上的表现,一言难尽。
当然,也不能因为比较模型能力,就变成踩一捧一。DeepSeek 和智谱都是非常让人敬佩的 AI 创业公司。
一个把 API 价格打到极低,让全行业重新思考模型成本。一个把开源模型做到了 SOTA 水准,让硅谷公司对国内模型刮目相看。
我仍然记得 Fable 5 管控后,朋友圈那么多人转发智谱模型的文章。
说回到 Coding Plan,很多人可能不知道 Coding Plan 的诞生背景。我简单科普两句。
早之前,大家熟悉的是 ChatGPT Plus 这样的会员。那会儿我们使用 AI 的方式主要还是在 Chatbot 中,一问一答。
后来大概是在 25 年的 2 月份,Anthropic 发布了 Claude Code 的预览版本,当时他们的模型在 Coding 上的能力有了明显突破,开发者开始真正用 Claude Code 读取代码仓库、生成代码。
不过,问题很快就出现了。
这种使用方式非常消耗 Token。一个任务可能连续运行几十分钟,中间还要反复读取代码、修改代码、运行测试。
要是让开发者直接按照 API 用量付费,心理压力会非常大。因为在任务开始之前,你根本不知道这段代码最后会花掉多少钱。
没过多久,Anthropic 推出了 Max Plan,分为 100 美元和 200 美元两档,分别提供更高的 Claude Code 用量。这其实就是后来 Coding Plan 的雏形。
如果没记错的话,到 2025 年 Q2,国内的模型公司也陆续发现, Coding Agent 是一个非常值得投入的方向。
智谱是最早押注这个方向的国产模型公司之一,而且后面的进步速度我们也都有目共睹。
当时智谱还没有自己的 Claude Code。大家主要是在 Claude Code、Cline 这些编程工具里接入 GLM 模型。
智谱就在这个阶段顺势推出了 GLM Coding Plan,用固定的费用提供高额度的模型调用。
我们今天已经习惯了 Coding Plan 这个说法,开山鼻祖就是智谱。说实话,我一直觉得,Coding Plan 今天能在国内这么流行,智谱确实有很大的贡献。
问题是,Coding Plan 天生就不是一门特别舒服的生意。因为它的模式有点像自助餐。
假设一家自助餐厅收费 100 块。有些人进去以后吃点蔬菜、主食和水果,食材成本可能只有三四十元。
还有的顾客进去以后专门吃海鲜和牛排,成本很容易超过 100 元。
只有两种用户混合在一起,自助餐厅才有机会盈利,继续经营。
我之前有高中同学就在老家开了一家自助餐厅。有的顾客为了晚上多吃一点,中午甚至会刻意少吃,专门留着肚子。
大家进去以后都挑最贵的东西吃,最后这家店干了一年,实在经营不下去了。赔钱赔的我同学肉疼。
国内的 Coding Plan 一定程度上也进入了这个窘境。
如果很多用户购买以后并没有充分使用,平台可以靠平均成本维持。但 Coding Plan 的用户本来就是奔着 Coding 来的。
特别是今年,随着 GLM 能力越来越强,大家交给模型的任务越来越复杂,也越来越容易把额度用完。
在这个情况下,基本上就两个选择,一个就是停掉类似的服务,另外一个就是涨价。
像 Kimi K3 发布之后,因为请求量迅速逼近集群承载上限,Kimi 也暂停了 Coding Plan。DeepSeek 到现在主要还是按照 API 收费,没有推出类似的官方包月 Coding Plan。
所以今天还能持续向个人开发者提供自家旗舰模型 Coding Plan 的头部模型公司,也就剩下智谱了。
第三方云平台我们暂且不说,因为云平台提供的模型,其实是有降智的,这一点梁文锋在前段时间也有简单提到过。
也许有人会说,你这家伙是不是上头了,怎么替智谱说话。没有,我非常冷静。刚刚还买了 Pro 套餐。
我只是觉得,大家可以横向比较一下。即便调整价格以后,智谱的套餐和海外同档产品相比依然便宜不少。
而且在实际使用中,GLM 和 GPT 等闭源模型能力的差距已经微乎其微,1M 上下文,稳定的长程任务能力,值这个价。
如果这两周 GLM 新一代的模型发布的话,那会更爽。毕竟按照之前唐杰的说法,有可能追平 Fable 5。
当然,我完全能够理解群里老用户的不满。
智谱最初把价格定得很低,套餐也比较宽松。大家已经习惯了原来的价格和额度,现在突然调整规则,肯定会拿过去的体验进行比较。
某种程度上,今天的争议,也是过去智谱补贴力度太大的果。就像那几年滴滴打车,突然有一天没补贴了,大家会说怎么这么贵。
不过,我也必须得吐槽说,智谱之前在套餐调整上确实处理得不够好。规则解释不够清楚,老用户迁移机制也比较粗糙。
智谱后来自己也为这些问题道过歉,类似的事情确实都应该提前解释清楚。
我只是不同意另一种说法:智谱靠 Coding Plan 赚得盆满钵满,现在还贪心涨价。
至少从目前公开的信息看,我们没有证据证明这是一门暴利生意。相反,整个国内的模型公司都在通过限额、涨价、停售和按量付费,试图解决算力不够的问题。
要知道,国内哪怕是字节这么家大业大的公司,和 OpenAI 的算力相比,也差一个数量级。
我觉得,Coding Plan 靠低价补贴吸引用户的阶段,已经基本过去了。一项服务想长期存在,最后还是需要找到一个能够维持下去的价格。
我当然也希望,智谱能够继续把推理成本降下来,等模型和算力效率进一步提升以后,再把价格慢慢压下去。
而且我相信,这一天肯定会到来。
显示更多
张一鸣目前把 50% 的时间都投入到了 Seed 上。这是徐新在播客里提到的。
大部分公司发展到一定规模后,创始人都会逐渐从业务一线退出来,开始管理战略、资本、组织和文化。这没有问题,也是大公司的必经阶段。
但张一鸣选择了一条不同的路。即使字节已经是一家拥有巨大商业规模的公司,他依然把大量时间投入到 AI 最前沿的技术探索中。这可能也是字节未来能否赢得大模型竞争的关键因素之一。
因为大模型很多时候像炼丹。今天押注什么方向,采用什么训练方法,如何组织最顶尖的人才,这些选择都会直接决定公司的上限。
所以,创始人需要持续阅读论文,和最前沿的研究者交流,理解那些还没有被市场验证的方向。
徐新说,公司的系统、流程、人员都可以逐渐复制和替代,但创始人的大脑,以及他调动资源的能力,没有人能够替代。
显示更多
很多提示词和 Skill,都已经过时了。
Anthropic 的工程师发了一篇文章,提到他们针对 Claude Opus 5、Claude Fable 5 这一代新模型,团队把 Claude Code 的系统提示词删掉了 80% 以上,结果在代码评测里没有看到明显损失。
这件事至少说明,在 AI 快速变化的节奏里,很多所谓的最佳实践,保质期可能非常短。
模型能力一直在提升,一些过去必须反复强调的规则,今天可能已经没有价值,甚至会限制模型的表现。
我也想借这个机会,写一下最近关于提示词和 Skill 的一些真实经验和思考,希望能够给大家一些启发。
一、提示词依然重要
现在很多人会觉得,提示词已经没有什么意义了。
这话对了一半。过去那种八股文式的提示词,价值确实越来越低。比如先给 AI 设定一个复杂角色:
你是一位资深的新媒体编辑,熟悉互联网行业,拥有十年写作经验,请帮我优化这篇文章。
这类角色预置,在新模型上的作用已经没有过去那么明显。模型本身知道编辑是怎么工作的,也知道一篇文章大概要怎么修改。
但这不代表提示词不重要。
如果把提示词换成另一个词,它其实就是:我们怎么跟 AI 沟通。
就像我们和人沟通一样,同样让一个人完成一件事,不同的沟通方式,最后得到的结果也可能完全不同。
所以,我现在更愿意把提示词理解成一种沟通思路。你怎么描述问题,怎么拆解任务,怎么告诉 AI 你真正关心什么,这些依然无比重要。
比如,我想让 AI 帮我总结一篇论文,我很少只说总结一下这篇论文。
我通常会告诉它:
这篇论文主要解决了什么问题?作者是怎么解决的?这个方法和过去的方法相比,真正的变化是什么?
这样问之后,AI 的回答通常会更容易抓住论文的主线。
因为我没有只给它一个模糊的动作,而是告诉了它,我想从哪些角度理解这篇论文。
二、少做角色预置,把任务说清楚
过去写提示词,大家喜欢铺垫很多背景。
先设定角色,再描述能力,然后补充语气、风格、工作流程,最后才说真正要完成什么。
提示词写了几百字,核心任务可能只有一句。
现在我觉得,这些铺垫很多时候已经没有必要。
提示词里真正重要的,是把几件事情分开说清楚。包括这次要达到什么目标,规则或者流程是什么,怎么才算完成。
比如,整理一段语音底稿,可以这样写:
把下面的语音底稿整理成一篇可以继续修改的公众号初稿。
删除重复的口头禅,合并意思相近的内容,调整明显跳跃的段落。
注意保留原来的核心判断,不主动增加新的观点、案例和结论。
完成标准是读者能够看清文章在讨论什么,作者的核心判断是什么,以及这些判断之间有什么关系。
我现在越来越觉得,好的提示词不需要写得复杂,先把这几件事情想清楚,已经解决了大部分问题。
其实就像把一件事交代给同事,你怎么说,他才更容易理解。
三、规则需要有,但不要太多
有一段时间,我看到特别长的提示词,会觉得非常专业,恨不得马上保存下来。
现在的感受刚好相反。
一条提示词特别长,很多时候说明写提示词的人自己也没有完全想清楚。
他只是把可能遇到的问题全部堆了进去,希望模型自己处理。
规则当然需要。
比如我在写作时发现,模型经常大量使用单字动词,文章读起来会比较硬。
我不喜欢这种表达,就会明确告诉它尽量使用更准确的双字动词,但不要为了凑字显得生硬。
这属于稳定的个人偏好,告诉模型是有价值的。但规则太多就会出现问题。
比如你同时要求语言简洁、内容详细、不要长句、不要太口语、不要调整原文节奏、同时优化文章结构......
这些规则很容易打架。
毕竟模型必须先花费大量精力理解哪一条规则优先,最后可能每一条都照顾了一点,但整体效果反而下降。
新模型已经具备比较强的推理和判断能力。提示词不需要提前规定每一个动作,只需要保留那些真正重要的规则。
规则越多,不一定代表控制越精确,也可能代表人没有完成取舍。
四、要不要提供示例,要具体情况具体看
以前写提示词,还有一个非常常见的做法,就是提供大量示例。
这个方法当然有效,但我现在越来越谨慎。
因为示例一方面能够帮助模型理解我们的要求,另一方面也会限制模型的探索空间。
尤其是模型能力越来越强以后,它有时候会过度模仿示例,最后只能在示例附近生成答案。
所以,要不要提供示例,我觉得不能一概而论。需要自己结合具体的情况去试。
现在,我大部分的情况下,都默认不提供示例。
比如让 AI 帮忙写文章开头,我提供了示例,它基本就照猫画虎了,很刻意。
其实这时候,我们可以把自己思路说的更具体点,比如:
这个开头可以考虑从一个具体故事进入,也可以从一组反常的数据进入,或者从我最近的一个真实感受进入。
这并没有规定开头必须怎么写,但给了模型几个明确的思考方向。
所以,仍然是那句话,思路非常重要。
五、告诉模型,什么样才算完成
这也是我最近非常重视的一点。
我们经常告诉 AI 要完成什么,却很少告诉它,什么样的结果才算完成。
比如让 AI 总结一篇文章,最简单的提示词是:
总结这篇文章。
但你也可以写成:
总结这篇文章。完成后,我希望能够回答三个问题:作者发现了什么变化?为什么会发生这种变化?这件事对普通从业者有什么影响?
这相当于给模型提供了一个简单的验收标准。
再比如,让 AI 完成一份产品分析,可以说:
最终结论需要能够帮助团队做出产品决策,不能只介绍产品有哪些功能。
这个要求就比请深入分析这个产品清楚很多。
深入是一个非常模糊的形容词。什么叫深入,每个人的理解都不一样。但能不能支持产品决策,是一个可以检查的标准。
说完提示词,再说 Skill。Skill 就是一份按需加载的小型工作手册。但并不是每一个提示词、每一个场景,都适合做成 Skill。
一、经常发生、流程稳定的事情,才适合做成 Skill
我觉得一类任务想要做成 Skill,至少要满足几个条件:
第一,它经常发生。第二,它的工作流程相对稳定。第三,里面包含一些模型本身不知道的个人经验、团队经验或者业务知识。
这些事情会反复出现,处理方式也相对稳定,适合慢慢沉淀成 Skill。
但某一篇文章的具体观点和材料,没有必要放进 Skill。它们只和当前任务相关,直接作为参考材料提供给模型就可以了。
没必要把所有东西都做成 Skill。
Agent 在运行时,即便没有加载 Skill 的全部内容,通常也需要先读取它的名称、简介和适用范围。这些基础信息同样会进入上下文,对模型的判断产生影响。
Skill 越多,不代表 Agent 越强。大量边界模糊的 Skill,也可能让模型不知道该调用哪一个。
二、Skill 里要放独特经验
我觉得一个 Skill 最有价值的地方,绝对不是那些网上随便就能找到的常识。
比如你在写作 Skill 里写文章要有逻辑、标题要有吸引力,这些内容模型本来就知道,写进去不会带来太大帮助。
真正有价值的是你自己的经验。
比如,修改语音底稿时,要保留口语里的活人感,每个核心判断最好有一个事实、数据或者亲身经历支撑。
这些内容代表了我们的个人品味、工作经验和业务知识。把这些经验编码进 Skill,才是 Skill 真正的价值。
三、Skill 需要控制抽象程度和边界
很多 Skill 的问题,是解决问题的范围太大。
比如一个叫写作的 Skill,边界就非常模糊。写作包括选题、资料阅读、形成观点、整理初稿、修改结构、优化语言、生成标题、检查错别字。
每一个环节需要的经验和评价标准都不一样。
把所有东西都放进同一个 Skill,最后这个 Skill 只会越来越长。
所以我觉得,Skill 最好只解决一个相对明确的问题。比如口述内容整理 Skill、标题生成 Skill、事实核查 Skill。
Skill 的边界越清楚,模型越容易判断什么时候调用,也越容易把它做好。
四、Skill 的主文件应该尽量短
Skill 通常是一个文件夹。
里面可以包含主文件、参考案例、常见问题、风格规范、检查清单,以及其他辅助材料。
所以没有必要把所有内容都写进主文件。
主文件只需要告诉模型:这个 Skill 什么时候使用、它主要解决什么问题、有哪些核心原则、默认按照什么思路推进、遇到具体问题时,可以继续读取哪些参考文件。
至于详细示例、风格要求、常见错误,可以放进单独的文件,等模型真正需要时再加载。
主文件是一张地图。模型先看地图,判断这次任务需要哪些内容,再继续读取相应的文件。
这就是渐进式加载。
不需要的内容不要提前塞给模型。这样既能减轻上下文负担,也能够减少不同规则之间的冲突。
五、Skill 最好包含检查环节
这一点和提示词非常接近。
只告诉模型怎么生成,往往还不够。一个好的 Skill,最好包含一套简单的自检标准。
比如产品体验稿 Skill,可以检查:有没有写清楚真实使用场景、有没有说明过去的方法有什么问题、有没有只有功能,没有判断。
这些自检标准,也是在告诉模型什么样才算完成。
一个 Skill 的价值,不能只体现在生成过程,还要体现在它能够帮助模型判断结果是否合格。
显示更多
上周在山西看古建,我彻底爱上了 ChatGPT 的语音模式。
起因是我逛大同善化寺的时候,请了个导游,结果非常坑。很多明显的历史问题导游都说错了,而且追问也答不上来,看起来完全是背了一套讲解词。
后来,我打开 ChatGPT 的语音模式,戴上耳机,简直太爽了。大家看截图。我用的是实时语音模式,但 ChatGPT 也转为了文本留存。
感觉这个模式非常适合沉浸式的逛古建。从佛教到历史,再到营造法式,ChatGPT 都可以像一个很渊博的朋友一样,和我交流。
周日,我去了永安禅寺,又用类似的方式逛了一下午。意犹未尽。
显示更多
没有 Kimi 3,Opus 5 会这么便宜吗?我表示怀疑。
一个前同事离职了,她说自己现在要告别过去很长一段稳定、确定,但也重复、停滞的时光。 后面两组词用得很准确。从局外人来看,她早就应该离开了。
那种所谓的稳定,此时看是蜜糖,未来看则是砒霜。 无论在多大的公司,无论什么职位,我们都是借由公司的载体和市场交换价值。李诞的这个观点,我非常认可,且身体力行。
显示更多
感觉所有重度使用 AI 的人,都应该去听一听罗大佑的新歌《所以》。 他唱出了 AI 对于时代中人的冲击。我单曲循环听一周了。
想起昨天还有个朋友在群里吐槽,他说和 AI 沟通得越多,就越不想和真实的人交流。和 AI 说话很轻松,不需要照顾对方的情绪,也不用担心自己的表达被误解。
但和人聊天不一样。我们要判断语气,理解话外之意,还要顾及彼此的感受。久而久之,真实的人际关系反而显得笨拙、低效,甚至充满负担。
罗大佑在歌里写,AI 的指数不断上扬,人类把网络延伸到了天空和宇宙,也把自己困进了数据的罗网。 我们可以随时连接全世界,却越来越难确认,眼前的表达究竟来自一个真实的人,还是 AI 生成的内容。
也许这时候我们应该停下来想一想,作为人重要的是什么。技术可以一直向外延伸,人最终还是要关注自己内心,回归自己的生活。
因为人终究不是机器。
显示更多