注册并分享邀请链接,可获得视频播放与邀请奖励。

小盖
@xiaogaifun
做有意思的事情。
77 正在关注    3.3K 粉丝
没有 Kimi 3,Opus 5 会这么便宜吗?我表示怀疑。
一个前同事离职了,她说自己现在要告别过去很长一段稳定、确定,但也重复、停滞的时光。 后面两组词用得很准确。从局外人来看,她早就应该离开了。 那种所谓的稳定,此时看是蜜糖,未来看则是砒霜。 无论在多大的公司,无论什么职位,我们都是借由公司的载体和市场交换价值。李诞的这个观点,我非常认可,且身体力行。
显示更多
感觉所有重度使用 AI 的人,都应该去听一听罗大佑的新歌《所以》。 他唱出了 AI 对于时代中人的冲击。我单曲循环听一周了。 想起昨天还有个朋友在群里吐槽,他说和 AI 沟通得越多,就越不想和真实的人交流。和 AI 说话很轻松,不需要照顾对方的情绪,也不用担心自己的表达被误解。 但和人聊天不一样。我们要判断语气,理解话外之意,还要顾及彼此的感受。久而久之,真实的人际关系反而显得笨拙、低效,甚至充满负担。 罗大佑在歌里写,AI 的指数不断上扬,人类把网络延伸到了天空和宇宙,也把自己困进了数据的罗网。 我们可以随时连接全世界,却越来越难确认,眼前的表达究竟来自一个真实的人,还是 AI 生成的内容。 也许这时候我们应该停下来想一想,作为人重要的是什么。技术可以一直向外延伸,人最终还是要关注自己内心,回归自己的生活。 因为人终究不是机器。
显示更多
这两天,连续看了梁文锋的观点、字节跳动 Seed 的科学家计划,还有中国籍数学家首次获颁菲尔兹奖,突然就感觉,中国的基础研究,已经越过山丘。
0
124
457
9
转发到社区
字节 Seed,可能是最接近硅谷实验室的团队。 字节这事儿做得还是让我非常敬佩。 如果五年后再回头看字节的 AI 历程,我想,他们今天推出的科学家计划肯定会成为其中一个重要节点。 事情是这样。今天上午,字节 Seed Edge 启动了一个科学家计划,准备邀请 100 位前沿科学领域的学者和博士生,与 Seed 团队一起研究真实的科学问题。 科学家可以把自己领域里真正困难的问题带进来,Seed 提供模型、算力和 AI 研究团队,双方一起探索,大模型究竟能不能参与那些没有标准答案、需要长期推理和反复验证的研究。 看到这个计划,我首先想到的是 OpenAI。 去年,OpenAI 曾经专门推动过 OpenAI for Science,希望让 AI 更深入地参与科学研究。 但到了今年,在激烈的模型竞争下,OpenAI 调整了这方面的组织和投入,原来的独立 Science 团队也被解散了。 Anthropic 也有在做类似的事情。今天还看到他们的研究员在播客里讨论怎么利用 AI 把 10 到 15 年的药物周期研发压到 5 年以内。 看来现在,字节要开始认真做类似的事情了。这是国内第一个大规模投入 AI 加速科学发现的研究计划。 我简单解释两句。 从商业化的角度来看,这事肯定没有 Coding 那么直观。毕竟现在 Coding 只要效果好,很快就能转化为收入。 AI 加速科学发现这样的研究反馈周期会长很多,而且现在看起来还比较遥远。 但只要这个方向取得突破,产生的价值可能远远超过一个软件产品。 大家想想,如果 AI 可以把未来 25 年的科学进展压缩到 5 年,那么到了 2030 年,人类就可能提前拥有原本要到 2050 年才能获得的科学和技术。 这当然是一个非常乐观的判断。但哪怕只在一些领域取得突破,也可能影响几亿人的生活。 往大了说,它可以加快整个人类文明向前推进的速度。 这不就是 AGI 的价值吗? 可能很多人熟悉字节跳动,但不一定熟悉字节的 Seed 团队。这个团队一直在做深入的前沿研究,而且人才密度很高。前段时间,记得晚点一篇文章提到姚顺雨的观点说: 大模型训练没有银弹。 真正决定模型能力的,还是把数据质量做好,把基础架构做扎实。 OpenAI 和 Anthropic 过去很多年的积累,本质上也是这些看起来没那么性感的基本功。 其实,字节 Seed 很早就在这么做了。不信大家可以查查,Anthropic 从来没有指责过字节蒸馏他们的模型。 因为 Seed 很早就定了一条价值观,不依赖外部闭源模型蒸馏来获取核心能力。还有他们在基础架构、数据上的投入也比较大。 包括 Seedance 2.0 为什么能够一下子炸了,业内一个比较普遍的判断是,字节在数据上做了大量基础工作。 毕竟发展到今天,各家在模型路线上的差距已经没有那么大了。真正拉开差距的,往往是一些脏话累活,以及整个研究团队的文化。 另外,Seed 内部还有一支团队,叫 Seed Edge。 这个团队专门研究一些确定性没有那么高,甚至几年都未必能看到结果的课题。 这次的 STEM 科学家计划,就是由他们发起的。 前段时间我写过的 EdgeBench,也是 Seed Edge 的成果。 他们发现模型从环境中学习,似乎也和预训练一样,存在自己的 Scaling Law。 投入的交互时间越多,模型能力的提升也会遵循一条相对稳定的规律。 我曾经看到过一个观点:培养熵,才是研究实验室长期繁荣的唯一方式。 这里的熵,可以理解成一个研究组织内部保留了多少不确定性、差异和可能性。 因为研究和做产品不太一样。做产品时,目标通常比较明确,组织需要尽快形成共识,把所有人的力量集中到同一个方向上。 但研究面对的往往是未知问题。既然答案还不存在,也就很难提前判断哪条路线是对的。 在这种情况下,如果一个实验室过早形成统一判断,所有人都去研究眼下最热门、最容易出成果的方向,短期效率可能很高,长期却容易陷入同一个局部最优。 大家使用相似的方法,追逐相似的指标,最后得到的也很可能是相似的结果。 真正有创造力的研究组织,需要保留一些暂时无法被证明的想法。 有的人沿着主流路线继续推进,把已有方法做到更好。也有人去研究冷门问题,做一些人可能几年都拿不出明确成果。这就是培养熵。 这些熵当然会带来噪声,带来争论,甚至带来失败。但新的突破往往就是在这种状态里酝酿出来的。 回头看那些长期保持创造力的研究实验室,其实都有类似的特点。 说实话,字节做这件事,我也挺意外。因为过去类似的构想,基本上都是硅谷公司在做。 中国互联网公司过去给人的印象,一直是产品能力和商业化能力特别强。 它们很擅长把一项技术迅速做成产品,再推到足够大的用户规模。 字节 Seed 愿意在这个阶段认真投入这件事,挺让人振奋的。 因为模型能力提升越来越快,很多短期指标都会迅速被后来者追平。这样的前沿性的探索,会真正决定模型的上限。
显示更多
0
32
24
3
转发到社区
日常写作,我会高频用到几个提示词。 今天想把我日常写作和阅读资料的提示词分享给大家,都是我过去两年慢慢积累和调整出来的。 我想说,很多场景中,提示词依然重要,依然重要。 和 AI 用不同的方法沟通,最后可能返回的结果完全不一样。 我之前写过自己的写作流程。简单来说,就是先用语音输入法把脑子里的想法口喷出来,不管结构,也不管口头禅,先把意思说完整。 然后再让 AI 根据我的文风,把这些比较乱的口语整理成初稿。 接下来,我会静下来,逐字逐句的修改。这中间,也会让 AI 参与。下面这些,就是我平时使用频率最高的提示词。 1)阅读资料 如果读的是一篇论文,或者技术类的讨论,可以这么说: 详细总结下这个论文(也可以是产品)解决了什么问题,思路是什么?有什么非共识的判断。 如果是一个随性的播客: 详细总结下这个播客的主线是在讨论什么?有什么非共识的判断吗? 2)整理语音底稿 假定你是我的资深编辑。这是我打的语音底稿,你不用大改,只需要把错别字改掉,没有捋顺的逻辑改掉,把特别口水的内容改掉,让它成为一篇逻辑顺畅但是符合我文风没有 AI 味道的文章。 该补充的地方补充,保证交给我的是可读的。MD 的内容供你参考。 当然,我也希望你能深度思考。看看我的表达哪里不准确。所以,确定的步骤是这样。 第一,你先理解语音底稿,和附件的信息,形成自己的理解和判断。 第二,你再在我的语音底稿的基础上开始修改和优化。但注意,整体的表达要用我的风格,不用改节奏和风格。 第三,不要刻意的使用排比句,不要使用一个字的动词。 第四,不懂的地方问我。不要硬凑句子。 有时候,我用语音输入法口喷完后,发现自己其实思路也没特别想清楚。这时候,可以和 AI 讨论。提示词是: 你读完这份语音底稿和 MD 内容后,告诉我:这篇文章真正想表达的核心判断是什么?只能说一个。 如果里面同时存在几个观点,也请告诉我哪个最值得作为主线,其他观点应该放在什么位置。 或者再进一步: 请站在一个长期关注 AI 的读者角度,检查我的语音底稿。看看哪些内容只是大家已经知道的常识?哪些内容真正提供了新的信息、判断或者观察? 3)修改稿件 有时候,总感觉某几句话说的稀里糊涂,总觉得没到位,这时候我会说: 你看看这句话是不是没说透?咱们深度讨论下。 再或者还有的情况下,我确实卡住没思路了。这种情况下,可以用这个提示词: 我实在没思路了。你看看如果继续线性推进我的观点的话,你会怎么写?不要着急续写,先给我你的思路。 如果有时候需要个例子,但自己没有想法,可以这么说: 帮我想一个锚点类比。好的类比是读者生活中熟悉的事物,同时能够准确刚刚的概念。 4)请 AI 提反馈建议 上面是我写的文章。不需要拍我马屁,作为一个资深的作者,你觉得这篇文章还有哪些地方可以优化? 或者有时候,担心自己的文章写的不准确。这时候可以用: 不要顺着我的观点说。请站在反方,找出这篇文章最容易被质疑的三个地方。 哪些判断证据不足?哪些推论跨得太远?哪些地方可能存在另一种解释? 再或者写完之后,我发现一篇文章信息很多,单段很好,但文章结构可以调整。 可以用: 先不要改句子,只检查文章结构。每一部分分别在解决什么问题?目前的顺序是否合理?哪些内容应该提前,哪些内容可以合并,哪些内容会打断阅读节奏? 还有的还是,感觉开头不好,可以试试: 这篇文章的开头有点慢。请从我文章中已有的经历、细节或者反常识判断里,找一个更自然的开头。 不要上来总结背景,不要先讲大道理,也不要虚构场景。 上面这些提示词我都没有做成 Skill。有一些常用的,我直接放到了苹果电脑的备忘录,打开就能用。 另外一些不常用或者简短的,基本上我就记在了脑海,其实只要记思路就行,和 AI 沟通的思路。
显示更多
这简直就是WAIC最值得听的演讲。 刚刚进入 2026 年下半年,AI 的进展依然非常快,信息多得让人有点喘不过气来。 在这样的时间节点,再听听阶跃董事长、千里科技董事长印奇 WAIC 在主论坛开幕式上讲他对 AI 发展脉络的理解,还是让我很受启发。 我想写写自己的感触。前奏可能有点长,因为印奇提到说他发现过去 70 年来 AI 技术的发展脉络,呈现出高度的连续性。 恰好这段时间我在看《人工智能简史》,深有感触。记得丘吉尔说过,你能看到多远的过去,就能看到多远的未来。 1 过去 70 年,人工智能一直在解决一个问题:怎么让机器拥有接近人类的通用智能? 最早影响很大的一条路线是符号主义。基本想法是把人的知识和推理过程写成一套符号与规则。 比如,如果发生 A,就执行 B。满足某几个条件,就可以推出一个结论。 这个思路很好理解。既然人会根据规则推理,那就把规则教给机器。可现实世界太复杂了,规则无法穷举。 后来,机器学习逐渐成为主流。人们不再试图把所有规则一条条写给机器,而是让它自己从数据中寻找规律。 比如给模型看大量猫和狗的图片,经过训练之后,它逐渐能够判断一张新图片里出现的是猫还是狗。 再之后,深度学习和大模型把这条路线推到了新的高度。尤其是过去几年,模型开始拥有比较强的语言理解、内容生成和推理能力。 AI 第一次能够比较自然地和人交流,也能够处理过去很难通过固定规则解决的问题。 顺着这个框架继续往下看,到了 2026 年,大模型其实又走到了一个新的节点。 大家有没有发现,去年国内几家大厂还在争论元宝、千问、豆包这些聊天产品谁能抢到用户入口。 今年,大家争抢的重点已经慢慢变成了 Agent 入口。 因为过去我们使用 AI,主要还是让它回答问题,或者完成一个很短的任务。 现在的 Agent 已经开始处理持续几个小时甚至几十个小时的复杂任务。而且,AI 对于编程语言的驾驭能力也逐步超过人类。 Agent 的条件已经成熟。AI 从模仿人类逐步开始在部分任务上超越人类。 2 还有一个让我恍然大悟的观点,印奇说他发现这些年 AI 的发展过程中,所有的重要里程碑都和语言紧密相关。 维特根斯坦说过:语言的边界,就是世界的边界。大概意思是,人能够理解什么,很大程度取决于语言。 没有语言描述的东西,人就很难思考。比如一个人如果没有颜色的概念,他就很难理解红色。 对 AI 也一样。 如果 AI 只理解自然语言,它主要能进入的就是文字、知识和对话的世界。我们告诉它一件事情,它能够听懂。 我们问它一个问题,它能够回答。这已经非常重要,但它的能力大部分还停留在语言里。 这两年,Agent 能力突飞猛进的原因之一就是因为模型充分掌握了编程语言。 因为代码可以调用 API、读取数据库、操作软件、修改文件、控制系统。 AI 一旦能够理解和生成代码,就相当于拿到了进入整个计算机世界的一把通用钥匙。 这也是为什么过去一两年,模型 Coding 能力如此重要。编程语言会扩展 Agent 的边界。 紧接着,还有一个判断:Agent 肯定会成为未来生产力的最小单元。 过去的软件,其实没有资格成为一个独立的生产单元。Excel 很强,Photoshop 很强,搜索引擎也很强,但它们仍然是工具。 真正理解目标、拆解任务、检查结果的,始终是人。所以过去一个组织里,最小的执行单元通常是一个人或者一个岗位。 Agent 带来的变化,是它开始能够独立跑完一段相对完整的工作闭环。 我们给它一个目标,它可以自己拆解、调用资源、执行操作、检查结果,然后交付成果。 打个比方,过去的软件像车床和传送带,每台机器只能处理一个步骤,需要工人在中间操作和衔接。 Agent 更像一个可以独立接收任务的工作站,原料交给它,它能够自己安排步骤,处理过程中出现的问题,最后交付一个相对完整的产出。 或者这么讲,过去的软件,本质上增强人的能力。而 Agent,会直接成为生产过程的一部分。 一旦 Agent 成为这种基本执行单元,整个生产力的组织方式都会跟着变化。 3 会发生什么变化呢?简单来说,印奇认为会出现新系统、新载体、新网络。我分别讲下自己的理解。 第一个是新的系统。 过去几十年,每次计算平台发生重大变化,操作系统都会随之变化。 PC 时代出现了 Windows 和 macOS,主要负责管理电脑上的硬件、文件和软件。 移动互联网时代出现了 Android 和 iOS,手机上多了摄像头、定位、通知和各种传感器,操作系统需要把这些能力管理起来,再开放给不同的 App。 到了 Agent 时代,操作系统需要管理智能体的身份、权限、记忆和协作等等。 所以演讲里提出了一个公式:智能体能力,等于模型能力 × Agent 操作系统能力。模型像大脑,决定 Agent 能不能理解和思考。 Agent OS 负责把模型和外部世界连接起来,给它提供记忆、工具、数据、权限和运行环境。 这一点我听完还是挺有启发的。从 PC 到移动到 Agent,每一次平台变化,操作系统管理的对象都不一样,这条脉络一拉出来就很清楚。 第二个是新的载体。 相信看到这里,大家就能理解为什么 OpenAI 会做硬件了。 移动互联网时代,手机这样的终端主要负责连接人与数字世界,所有操作都由人来完成。 到了 Agent 时代,终端会重新围绕 Agent 来设计。 比如过去出门旅行,我们需要自己打开地图、查看日程、搜索航班,再分别处理各种信息。 未来 Agent 可能已经知道我们的行程,看到航班延误之后,主动调整后面的安排,并把新的方案告诉我们。这完全是不同的逻辑。 所以这一轮所谓的 AI 硬件,真正要解决的,可能也不是在现有设备上增加一个聊天入口。 大家都在寻找一种更适合智能体长期存在、持续感知和随时行动的载体。 它可能仍然是手机,也可能是耳机、眼镜、汽车或者机器人。 具体最后会长成什么样,现在还很难判断,但可以确定的是,一定会有新的载体出现。 第三个是新的网络。 互联网连接的是人、信息和服务。到了 Agent 时代,还会出现大量智能体之间的连接,也就是 A2A 网络。 最近我就在公司里搭了一个很小的 Agent 局域网,让不同同事的 Agent 可以互相发送任务、同步进度。 比如我的 Agent 发现一个产品问题,可以直接把问题交给研发同事的 Agent,后者分析原因、尝试修复,再把结果发回来。 当然,这套东西现在还很早期。诸如权限怎么管理,传递的信息出了错又该由谁负责,都还没有成熟的答案。 但只要 Agent 能够独立承接任务,它们之间产生连接和协作,就是很自然的结果。一个 Agent 不可能擅长所有事情,它也需要寻找其他 Agent,分配任务,再把结果整合起来。 很有启发。提纲挈领。
显示更多
0
62
123
24
转发到社区
Vibe Coding 完这个网站,我兴奋的没睡好。 Kimi K3 确实很强。真心推荐,大家都做一个自己的个人独立网站,用 Vibe Coding的方式。
0
53
258
21
转发到社区
Kimi K3 确实非常惊艳,让我想起了当年 DeepSeek R1 刚出来时的震撼。早上看到朋友圈那么多人转发 K3 的发布 Blog,我心里有一种莫名的情绪。 以前我对国产模型和海外模型没有太强的立场。谁的能力强,我就使用谁。但过去一段时间,随着 Anthropic 各种离奇封号和使用限制的出现,我突然意识到,国内能够拥有真正达到 SOTA 水平的模型,非常重要。 要不然像 Fable 5 这样的模型被出口管制了,我们根本没辙。我也不想说什么 K3 超越 Opus 4.8、GPT 5.6 之类的狂言,没意义,大家用一两次就非常清楚了。我的感觉是,至少 K3 在我的几个任务场景里,表现一点不输几个闭源模型。难分伯仲。
显示更多
0
34
73
1
转发到社区
强烈建议大家搭建一个自己的 blog。 强烈建议大家都搭建一个自己的个人博客。可以用它来记录自己的思考,也可以用来展示 Vibe Coding 的作品。 今年年初,我花了不少力气,重新搭建了一个博客。现在回头看,我觉得这是我上半年做过最重要的事情之一。 可能有人会觉得,现在已经有微信公众号、小红书,还有各种各样的内容平台。 这些平台有现成的用户,也有推荐流量,还有必要单独搭建一个可能根本没人访问的个人网站吗? 我说一下自己的理解。 前段时间,我看到 OpenAI 一个员工已经让 Codex 帮他们招人。招聘方只需要把职位要求交给 Agent,告诉它想找一个什么样的人。 Agent 会去 LinkedIn 和互联网上搜索相关信息,找到合适的人选,整理候选人的经历,最后再尝试联系对方。 这件事给了我很大的启发。我们需要在互联网上有一个入口,让 AI 能够看到我们,了解我们。 像微信公众号以及国内很多内容平台,里面的大量内容很难被公开搜索,也很难被通用 Agent 稳定读取。 假如未来一家公司让 Agent 在互联网上寻找合适的人,而我们所有的经历、作品和思考都放在这些封闭的平台里,Agent 很可能根本找不到。 独立博客的情况会好很多。只要网站能够公开访问,做好基础的页面结构,Agent 就更容易读到里面的内容,了解我们做过什么,对什么问题感兴趣。 一个独立博客很可能会成为自己的第二份简历。 十年前,我也搭建过一个个人博客。那时候用的是 WordPress,基本只能选择一个现成模板,调整一下颜色、字体和页面布局。 想做一些特别的交互,或者实现一个脑子里突然冒出来的效果,还是很难。 现在有了 AI,我们完全可以自由的创造。只要有想法,大部分效果都可以慢慢做出来。 最近我越折腾自己的博客,越觉得有成就感。我写了很多自己对于生活的思考,我把这个博客当成感性内心的自留地。 也许有一天我死了,别人能在这里,看到这哥们曾经是个有趣的人,活得还挺深刻和热烈。 搭建一个博客,其实花不了多少钱。 网站本身可以通过 Vibe Coding 来完成,Codex、Claude Code、TRAE、Workbuddy 等等产品都能搞定。 然后再买一个域名。比如我的域名是 CloudBase,一年大概两百多块。也有免费的部署服务,比如 Vercel。 很多人总觉得,要等自己足够厉害、写了足够多的文章,才有必要搭建个人博客。 其实完全可以反过来。不需要一开始就想清楚这个博客要写什么,也不用考虑有多少人会看。 就像我自己,当初建成博客是冲动使然,但这半年下来,也积累了不少内容。很多事情都是这样。先有一个容器,才会产生持续往里面填东西的动力。 总之,大家真的可以去鼓捣一下。 在 AI 时代,个人博客能承载自己的思考,展示自己的作品,也能让未来的搜索系统和 Agent 更容易发现我们。 这个事情投入不大,但时间越长,价值可能越高。
显示更多
0
34
83
10
转发到社区
能力不够,努力也不够,然后一遇到点挫折就唧唧歪歪喊委屈,找解释,希望获得别人的理解和同情,以维护自己光大伟正的形象。反正我是不允许自己成为这样的人。 哪有那么多委屈啊。摔倒了,拍拍身上的灰尘,咱继续往前走,乐乐呵呵的。关关难过关关过,不等不靠不幻想。
显示更多
给大家分享六个我在 Codex 中会高频用到的提示词,感觉也是一个使用 AI 的习惯。 最近硅谷又开始流行一个概念,叫 Loop Engineering。 简单来说,就是让 Agent 在一个任务中持续执行、检查、修正,直到达到目标。 我觉得它和 Prompt Engineering 依然有很多弯弯绕绕的关系。到今天为止,无论是用 ChatGPT 还是 Codex 这样的 Agent,提示词依然很重要。 模型能力再强,我们怎么和它沟通,会直接影响最终的产出。 不过,今天的提示词已经不需要写成八股文了。不需要每次都套一套复杂的格式,提示词说到底就是我们和 AI 交互的思路。 跟和同事沟通是一个道理,沟通方法不同,达成的结果往往也不一样。 下面是我最近使用 Codex 时,最常用的六个提示词思路。注意,重点是思路。具体怎么问,可以根据自己的任务随时调整。 一、从何而来,何以至此 遇到一个复杂概念,比如一篇论文、一个新的技术框架,想快速搞懂它,效率最低的方法往往是从第一行开始,一行一行往下看。 看了半天,记住了很多术语,却不知道作者为什么要研究这个问题,它和以前的方法有什么关系,也不知道这篇论文真正重要的地方在哪里。 这时候,我通常会先问 Codex: 详细总结这个论文解决了什么问题,思路是什么?有什么非共识的判断。 因为我觉得理解一个概念,第一步是搞清楚它从何而来,何以至此。 没必要急着深入到细节,而是应该往回倒,想一想为什么会是这样,到底要解决什么问题,又是怎么一步一步走到现在的。 很多知识单独拿出来看,会显得非常抽象。一旦知道它是为了解决什么问题、之前别人是怎么做的,就会立马明白其中的逻辑。 比如一篇论文提出了一套新的架构,先不用急着看每一个公式。 搞清楚旧架构遇到了什么问题,为什么继续增加参数、增加数据或者调整训练方法已经解决不了。脉络理出来之后,后面的细节就容易理解了。 二、让 AI 指出我的思维盲区 我在和 Codex 协作时,如果自己对方向比较确定,通常会不断地告诉它需求和想法。 Codex 一般都会顺着这个方向执行,完成得也还不错。 这种场景下,Codex 扮演的还是执行者。我告诉它要做什么,它就会尽可能做好。 只要当前方案能成立,它通常不会跳出来挑战我们的判断。 但其实协作过程中,Codex 会阅读相关材料,看过完整代码,知道我们为什么这样改,也知道前面做过哪些取舍。 很多时候,它掌握的上下文甚至比其他参与者还完整。 所以做完一个相对完整的任务之后,我会让 Codex 暂时跳出执行者的角色,重新审视整个过程,然后问它: 从刚才这个任务来看,我的思维盲区是什么? 这时候 Codex 会基于上下文以及它对于这件事情的理解,列出来可能存在的思维盲区。 多数情况下,Codex 反馈的这些新的视角对我来说都有很多启发。大家可以试试。 三、让 AI 反思它最没把握的地方 还有的时候,我们会给 Codex 一个相对复杂的需求,让它自己搞定。Codex 可能会花很长时间执行。 这个过程中,很多决定是 Codex 自己做的,诸如用什么方案,怎么实现。 最后做完之后, Codex 基本上也会用比较确定的语气说它搞定了,然后列出来自己做了什么。 但其实,AI 也有自己的盲点。所以,在进入细节看具体的实现之前,我会先问: 重新反思一下,刚才执行过程中最没把握的地方有哪些? 再或者,还可以继续要求说得更具体:哪些结论经过了实际验证?有哪些问题暂时无法确认? 这样一问,Codex 通常会主动把风险暴露出来。 比如某个接口没有真实环境所以没跑完整测试,某段代码看起来已经废弃但无法百分之百确认,某个功能只测了正常流程没有覆盖异常输入,或者为了兼容旧逻辑选了一个保守方案但不确定是不是我们真正想要的。 这些信息非常重要。 四、让 AI 用大白话讲清楚它的逻辑 AI 做长程任务的时候,速度肯定是人的几十倍。我们不可能每次都逐行检查代码。即使看了,也未必能快速理解它为什么这么改。 这时候,我通常会直接问: 言简意赅地讲一下,刚才这个任务的解决逻辑是什么。不要逐个文件介绍,用通俗易懂的话讲清楚就行。 也可以问得更具体: 这个问题原来为什么会出现?做了哪几项关键修改?修改之后这套逻辑是怎么运行的?后面最容易出问题的地方在哪里? 这个提示词看起来简单,但我觉得特别重要。当 AI 可以独立完成越来越多工作之后,人很容易只关注最后的结果。只要功能正确,就皆大欢喜。 但时间长了以后,我们会逐渐失去对项目的理解。这种理解层面的让渡非常可怕,因为后面一旦 AI 出问题,搞不定了,需要我们接手,那我们面对的可能完全是一个黑盒。 所以我会要求 Codex 把关键逻辑讲到我能听懂。 比如它可以这样解释:以前每次切换页面,系统都会重新请求一次数据,所以页面会闪烁。 我现在把数据放进了共享缓存里,第一次打开时请求,之后优先读取缓存,缓存过期之后再重新更新。 这样的解释没有太多代码细节,但我们很容易理解。理解之后才能继续判断这个方案是否符合预期,缓存多久合适,会不会出现数据更新不及时的问题,下一步应该怎么继续。 代码可以交给 AI 写,很多细节也可以让 AI 处理。但关键逻辑,最好还是让它讲到我们真正理解。 五、让 AI 做结构化的信息呈现 有些事情,AI 用文字讲了很多,我们还是很难理解。特别是系统架构、数据流、业务流程、模块依赖这些内容。它写了三四段,看的人云里雾里。 这时候我一般不会继续让它再换一种文字表达,而是直接说: 能不能给我做一张图,把这套逻辑表达清楚?具体用什么图,根据场景来定。 流程图适合表达任务的执行顺序,架构图适合说明前后端和数据库之间的关系,脑图适合整理功能结构,时序图适合展示一次完整请求的过程,对比图适合说明修改前后的区别。 Codex 现在已经可以调用图像生成能力,也可以生成 Mermaid、Excalidraw、HTML 图表等不同形式的图。 六、表达完需求后,先让 AI 确认理解 给 Codex 说完需求,它会马上开始执行。但注意,我们表达需求的时候,本来就很容易遗漏信息。 特别是现在用语音输入法,表达可能东一句西一句。Codex 只能根据有限的信息去猜。一旦最开始理解错了,后面执行得越认真,浪费的时间越多。 所以我表达完需求之后,经常会紧接着说: 先看看是否理解了我的需求,不要开始执行。有不理解的地方直接追问我,追问清楚之后再继续。 或者有时候也会让它把理解复述一遍: 先用自己的话复述一下我的目标、限制条件和最终要交付的结果。 这一小步,真的可以提前消除很多误会。
显示更多
0
47
21
3
转发到社区
100%认同这个PPT的观点。 - 用 AI 生成内容非常便宜,但阅读和消化这些内容的成本非常高。 - 当你用 AI 生成一份东西,然后直接发给同事时,相当于把审核 AI 输出的负担转嫁给了他们,而不是由你自己承担。 这意味着: - 我们鼓励你在所有工作中使用 AI。借助 AI,我们的工作速度应该提升 10 倍。 - 分享之前,先对内容进行删减和筛选。原本 10 页的内容,很可能压缩到 2 页就够了。审核者花费的时间,比你节省下来的时间更宝贵。 - 加入 AI 不擅长的人类判断。 - 最低要求是,别让你交付的东西一眼看上去就像 AI 生成的。
显示更多
0
13
17
3
转发到社区
字节是 AI 时代产品经理最好的选择了。 上周末跟几个老同学吃饭,他们都在一线互联网公司上班。 聊着聊着就盘起了大家现在都在用哪些 AI 产品。 我们五个人掰着手指头数了一圈,发现一件挺有意思的事,除了 ChatGPT、Claude 这些头部产品,大家使用最多的国内 AI 原生应用,居然清一色来自字节。 拿我自己来说,手机里装着豆包、豆包爱学、豆包输入法、即梦、扣子,电脑端还在用 TRAE 和豆包的浏览器插件。 我们几个当时就很唏嘘。因为我们刚毕业那会,2011 年,正好赶上移动互联网。 当时互联网圈里有个流传很广的说法:百度的技术、腾讯的产品、阿里的运营。 但十多年过去,这个说法好像已经很少有人提了。至少现在的年轻从业者,已经不太会用这套话来概括互联网公司。 如果还用类似的句式来总结的话,现在好像变成了字节的产品、字节的技术。 字节同样属于移动互联网那十年里成立的这批公司之一,这两年,人家又在 AI 时代重新活成了一家新公司。这确实太牛了。 用我哥们的话说,一家大公司最难的,往往还不是做出一个新产品,而是在时代发生变化的时候,能够重新调整自己的技术、产品和组织。字节这一轮,转身转得非常快。 现在提到 AI 竞争,核心无非就是模型。 目前最重要的几类模型,大语言模型、视频模型、音频模型、图片模型,字节在每一个品类里头都处在第一梯队,甚至像 Seedance 这样的视频模型,属于世界第一。 还有前段时间字节又发了一个语音生成模型,我非常喜欢。音频这个方向没有视频那么容易破圈,但大家可以去找来试一下。 它已经可以通过自然语言直接生成一段音频了,不再是之前那种搞克隆、搞音色模仿的路子。 并且字节落地场景比较丰富,在 B 端和 C 端都有头部的产品。 就像 Seedance 2.0 这一波,模型发布之后,很快就能接入即梦这样的 C 端产品,也能通过火山引擎云服务提供给影视公司和广告公司做内容,或者给实体产业客户做机器人和智能驾驶的训练数据合成。 说到火山引擎,我说多一句。记得当年火山引擎刚成立的时候,当时云计算市场三分天下,大局已定。 反正那会我就悲观的觉得字节做云没什么戏。但你看现在,火山引擎反而完完整整地抓住了 MaaS 的红利,成了这波 AI 云的领头羊。 记得十年前 VC 投项目,创始人如果是从阿里出来的,会特别加分。现在似乎风向变了,从字节出来的人反而在投资人眼里特别吃香。 王慧文之前在即刻写过,说现在 VC 可以分成两拨:投字节系的和不投字节系的。哈哈哈哈哈。一代又一代的公司啊。 我哥们说他这两年的目标就是跳槽去字节做产品经理。他觉得 AI 时代,产品经理最好的选择也就是字节了。 这些年他换了好几家公司,美团、腾讯、快手、百度都待过。他说他特别好奇的是,字节这家公司到底是怎么运作的。 他说的这种好奇心,其实也是我心里的一个问号。
显示更多
0
17
21
1
转发到社区
越来越觉得很多面试就是在浪费时间。 几个小时聊下来,能拿到的有效信息少之又少,特别是招工作经验比较少的人。最近我自己就看走眼了好几个。 所以试着调整了一下我这个小公司的招人流程。 面试通过之后,加入进来一起合作三天时间。这三天时间正常付薪水。如果三天后,双方觉得匹配,再继续推进。如果不行,就直接算了。 因为很多人面试的时候会粉饰,我就感觉通过提问的方式,很难真正挖到对方是一个什么样的人。但三天的深度协作,就足够了解到对方的思维方式、好奇心等等。 当然,这种方式只适合中小公司。
显示更多
0
23
15
1
转发到社区
呼兰这话说的真通透啊。 看了一期呼兰的访谈,特别感动。 主持人问他,当明白这个世界就是一个巨大的草台班子之后,会不会对很多事情祛魅?祛魅之后,我们是不是还要重新构建意义,重新建立新的秩序? 呼兰回答说,很难重建,更多时候都是缝缝补补。这句话一下子击中我了。 恰好上周末参加好哥们的婚礼,喝了几顿大酒。 婚礼这种场合很奇妙。白天大家穿得体体面面,站在台上台下鼓掌、合影、说祝福的话,像是所有人的生活都被整理得很漂亮。 但到了晚上,酒喝到第二轮,老朋友们围坐在一起,话题就慢慢从吹牛和开玩笑,滑到了各自真实的人生状态。 我一哥们在互联网公司,收入还行,但这两年裁员太多,他说这两年身边走了好多人,自己也不知道什么时候轮到自己。 不敢请假,不敢跟领导有分歧,绩效季之前连觉都睡不踏实。平时很少有晚上九点之前下班的。 另一个哥们在老家煤矿工作,体制内,日子看起来很安稳清闲。 但他又觉得安稳这个东西,待久了跟困住也没什么区别。 工资不高,没什么盼头,每天做的事情他闭着眼睛都能做完。 他倒是想折腾点什么,但也不知道自己还有能力干什么。还有在小城市,人情关系绕来绕去,虚情假意的应酬很多。 聊到最后会发现,每个人都有每个人的烦心事。看起来都在往前走,但没有谁真的走进了一个完全顺滑的人生。 结了婚的人,有结了婚的难。两个人过日子,柴米油盐、孩子教育、双方父母、情绪磨损,哪一样都不是靠一句好好沟通就能解决的。 但单身的人,也有单身的难。自由是真的,孤独也是真的。一个人做决定很爽,但出了事也只能自己扛。 我那天喝多了,胡思乱想。 二十来岁的时候,总觉得这世上就没有什么自己解决不了的问题。工作不顺当,那就换一份。 感情出了问题,那就重新开始。今年过得很糟糕,那就等新的一年,新的一年开始了,我一定把它过好。 心里总会隐隐觉得,前面有一个更完美的版本在等着我。 后来才慢慢琢磨过味道来。上一份工作有问题,换了工作,还会有新的问题。 这家公司有这家公司的麻烦,下一家公司也有下一家公司的麻烦。 和伴侣之间总会有冲突,孩子、钱、时间、家务、情绪,堆在一起,哪有那么多永远体面、永远温柔的关系。 做一件事之前总想一次做成、一次做对,真正开始了才知道,全是一边做一边改。 生活总是这样,不能叫人处处都满意。 想起李娟的话。人总会被困在某处,这就是每一个人的命运,你不困在这里面就要困在那里面。 有的人是困在疾病之中,有的人是困在贫穷之中,有的人是困在繁忙的工作里面,有的人是困在空虚里,反正每个人都有自己的困境。 哎,根本不是之前想象的那样,有一个干净的起点,有一条笔直的路,有一个漂亮的结果。 更多时候就是缝缝补补。工作缝缝补补,关系缝缝补补,自己跟自己的相处也是缝缝补补。 所以我现在越来越觉得,所谓心智成熟,绝对不是动不动就推倒重建,哪有那么多可以重建的机会。 很多事情一旦走到今天,就已经逐步变得浑浊。所以,接受浑浊,而不是追求清澈,幻想完美。 年少未谙世事时,总觉得人生的关键是做出正确选择。选对工作,选对城市,选对伴侣,选对方向。 后来才知道,选择当然重要,但没有哪一个选择能永远保持崭新。很多事情都是这样,刚开始的时候充满期待,但时间久了,总会出现一些磨损和变化。 真正考验人的,是当这个选择慢慢磨损之后,我们还愿不愿意鼓起勇气,继续缝缝补补。 真的,对抗和愤怒很多时候无济于事。缝缝补补才是常态。
显示更多
打车和出租车师傅闲聊,他说干他们这行当,最终都得拼时间。 驾驶水平以及对路的熟悉程度大家都差不多,有的人可能今天运气好,接了个去房山的大单,但也不能每天都好,拉长时间看,运气也会回归均值,所以最终,就是看谁能熬时间。 他这话给我挺大启发。我们干其他的事情不也是如此吗?做成一个事,本质上是能力、认知和运气的结合。 运气我们无法主宰,但能力和认知是可以主动提升的。比如要去选自己喜欢+擅长的事情,这就是认知。 比如,选择什么时间点做什么事情,这也是认知。比如,判断什么时候该有耐心,什么时候该放弃,这也是认知。 而能力是指具体干一件事具备的技能,比如表达、沟通、剪辑、写作、运营等,这都是能力。 一件事没做成,或者暂时还没做成的话,我们还是应该尽量往能力和认知方向复盘,提高能力,提高认知,然后等待下一个机会点。 坚定地相信能力和认知对了,时间投入也到位了,结果也不会差。
显示更多
我们团队用 Codex 踩的一个大坑。 想和大家真诚分享下我们刚刚周会上聊到的话题。这可能会是很多人使用 Codex 这类 Agent 产品会踩的坑。 简单来说,如果面对 Codex,我们只是不断地下指令、接受建议,没有理解和判断,那这些产出并不能真正算自己的能力。因为换一个人来点,结果也差不了太多。 面对能力越来越强的 Agent,我们可以不用亲自去处理每一个细节,但还是要知道这件事为什么这么做、大概是怎么解决的。 如果一开始不知道,也没关系。AI 做完之后,我们应该回过头去问它,然后再形成自己的经验和理解。 为什么会有这么一长段的感触呢?事情得从前半年说起。 今年春节后,我的小团队全员配备了 Codex。在内部的协作中,我们经常提到的黑话是:先让 AI 去干。 说实话,这个工作方式看起来简单,但真正做到其实挺难的。毕竟人有思维的惯性。 好消息是,经过几个月的刻意练习,大家已经养成了让 AI 先干的工作习惯。 但紧接着,我发现新的问题来了。有的同事开始不求甚解。Codex 说行他就行,说不行他也就不行。他不去研究背后的原理和逻辑。 举一个真实的例子。 之前我写过一篇教程,分享怎么把 DeepSeek V4 接入 Codex。 当时 Codex 还不支持第三方模型,所以需要借助 CC Switch 这样的桥接工具。 后来 Codex 宣布支持第三方模型接入,我心想,这下简单了。 于是我让同事研究一下,看看 DeepSeek V4 怎么快速接入。 他麻溜的截图把需求告诉给 Codex,结果 Codex 分析了之后,说目前还是没办法接入,因为协议不兼容。 他给我发了截图,就此打住了。 我当时以为他搞不定,于是接过来继续研究。后来确认,Codex 新开放的第三方模型,要求必须兼容 OpenAI 的 Responses API。 而 DeepSeek V4 还不支持这个协议。所以虽然 Codex 开放了第三方模型,实际上 DeepSeek 还是无法直接接入。 这事就这么结束了。 这周一,我一个做传统生意的好朋友告诉我说, 为啥一发图片,Codex 就报错。 我问了后才知道,它按照我之前的教程,接入了 DeepSeek V4,而 V4 本身就不支持多模态。 于是,我想折腾把 Kimi 的新模型接入到 Codex 中。毕竟这段时间,我用 Kimi 的新模型做 PPT、分析数据,效果还是非常好。这个模型是原生多模态的。 按我的预期,这次应该会快很多。因为第一次已经踩过坑了,只要先判断 Kimi 支不支持 Responses API,后面的思路基本就清楚了。 同事接过了新的任务,开始干。和之前的干法一模一样,他继续把文档和需求告诉 Codex,让 Codex 代劳。 Codex 分析之后,判断出来 Kimi 的模型因为协议不兼容,所以无法直接接入。 这时候,聪明的 Codex 给了他建议,说:要不我来写个桥接软件,这样就可以了。 他说可以。于是,Codex 按照这个思路搞定了。 然后他兴高采烈过来告诉我,任务完成。哈哈哈哈。我一问,发现他根本不知道这其中的逻辑和原理。 我说如果协议不兼容的话,那是不是我们直接用 CC Switch 这样的软件就行,没必要再自己构建一个。 他对这一切一无所知。我感觉这干法有问题,相当于他把所有的思考、理解都外包给了 Codex。 于是,就有了今天周会上我们的交流。 我的经验是,我们应该成为 AI 的 Leader,而不是传声筒。 Leader 不一定亲自干活,但一定知道为什么这么干。AI 可以负责执行,人要负责理解、判断和决策。 这让我想起左耳朵耗子之前的口头禅,要成为一个大家愿意追随的 Leader。 1、帮人解决问题。团队或身边大多数人都在问:这个问题怎么办?,而你总是能站出来告诉大家该怎么办。 2、被人依赖。团队或身边大多数人在做比较关键的决定时,都会来找你咨询意见和想法。 也许和 AI 沟通协作,我们仍然应该朝着这个方向努力。如果只是提要求,当传话筒,那我们心里完全没底。 吴军之前讲过一个故事。 1503 年,哥伦布的船队到达了牙买加。当地的原住民一开始热情地接待了他们,但后来因为船队有人偷了当地人的物品,原住民就拒绝再提供食物了。哥伦布他们面临断粮的危机。 哥伦布这个人略懂天文知识,随身带着一本天文年历。他翻了一下,发现 1504 年 2 月 29 号晚上会发生一次月全食。 月食发生前三天,哥伦布约见了当地的部落首领。他告诉首领,他的神因为当地人不再提供食物而感到愤怒,作为惩罚,三天之后,月亮会愤怒地变红,然后从天空中消失。 到了那天晚上,月食真的发生了。月亮逐渐变红,然后隐入黑暗。原住民吓坏了,赶紧向哥伦布求情。 哥伦布做了一通法事,说只要继续提供充足的食物,神就会宽恕他们。当地人就这么被拿捏了。 这个故事的本质是什么?哥伦布和原住民看到的是同一个月亮、同一场月食。 但哥伦布理解月食背后的天文原理,所以他能利用这个现象。原住民不理解,所以只能被这个现象支配。 同样的事情放到今天的 AI 时代。AI 工具摆在所有人面前,每个人都能用。 但如果仅仅停留在 AI 告诉我们答案,我们接受答案。AI 给出方案,我们执行方案。 AI 说做不了,我们也默认做不了,那这和原住民看月食没什么区别。 我越来越觉得,AI 可以成为我们的执行者,但不能成为我们的认知。 真正属于人的工作,是不断把 AI 给出的结果,重新变成自己的理解。
显示更多
0
74
252
26
转发到社区
吴恩达三言两语,就把 Loop Engineering 说清楚了。 吴恩达果然厉害。前两天在他的 Newsletter 中,短短几句话就把 Loop Engineerring 这个新词的本质说清楚了。刚看完他的文章,结合着说下我的理解。 1、如果用一句话来总结的话,Loop Engineering 讨论的其实是,如何让 AI 像工程师一样,一边干活、一边验收、一边返工,直到达到要求。 一个程序员标准的写代码流程是这样的:写完代码、运行程序,然后发现 Bug,紧接着修改代码,继续测试,直到没问题为止。 现在越来越多的 AI Coding Agent 已经能够自己完成这个过程。 给它一份产品需求文档(Spec),再给它一套评测标准(Eval),Agent 就会进入循环:写代码 → 运行测试 → 发现问题 → 修改代码 → 再测试。 如果测试没通过,它会继续改。如果功能不符合需求,它也会继续改。整个过程不需要人工介入。 2、Loop Engineering 这个词听起来挺唬人,但核心思想其实并不复杂。 以前我们给 AI 提需求,更多是在描述想做什么。现在还需要提前告诉它,什么叫成功、什么叫完成,以及如何自动判断有没有完成。 这也是 Spec 和 Eval 存在的意义。有了这些标准,Agent 才能自己写代码、自己测试、自己修 Bug,形成真正的闭环。 3、吴恩达认为,如果把视角放到整个软件开发流程里,大家最近讨论的 Loop Engineering,只是一小部分。 所以他专门画了下面这张图,把软件开发拆成了三个嵌套在一起的 Loop。 在 Coding Loop 之外,还有第二层循环,叫 Developer Feedback Loop。 简单理解,就是开发者不断调整产品的过程。Agent 负责实现需求,开发者负责修正需求。 当我们看到一个功能真正做出来之后,经常会发现自己一开始想的和真正想要的并不是一回事。 于是开发者会重新修改需求,再交给 Agent 继续开发。这个循环的速度通常比 Coding Loop 慢得多,可能几十分钟,甚至几个小时才会发生一次。 但它决定的是产品会长成什么样。其实这部分讲的就是 Builder 要决定做什么,以及产品会长什么样。 诸如一个按钮放在左边还是右边,Agent 可以帮我们实现,但判断还得自己做。 4、在这层 Loop 还有个误区,很多人以为,开发者脑子里只要有了清晰的产品愿景,剩下的事情交给 Agent 就行。其实完全不是。 一开始,我们会先写一个大概的 Spec,交给 Agent 去实现。 等第一个版本做出来,自己真正用了一遍之后,往往又会发现:原来我真正想要的,并不是这个。哈哈哈,我就经常经历这样的过程。 于是再回过头修改 Spec,把之前没有想清楚、没有表达清楚的地方补充进去,再让 Agent 继续开发。 如果发现 Agent 总是在同一个地方犯错,比如某个用户流程总是走不通,或者某类输入总是处理不好,这时候就需要补充一套 Eval,把这些容易踩坑的场景固定下来,作为以后每次开发都必须通过的测试。 或者这么讲,第二层 Loop 就是不断校准自己的认知,并将这些理解逐步沉淀进系统之中。 5、我记得去年参加一个活动时,大家讨论过一个话题:如果 AI 的品味越来越好,是不是以后我们只需要说一个想法,它就能把整个产品做出来,人几乎不用再介入? 吴恩达说自己不太喜欢品味这个词。他觉得,相比 AI,人类真正的优势不是品味,而是拥有更多的上下文。 比如,我们知道用户是谁,知道他们的真实使用场景,也知道他们到底在为什么事情烦恼。这些信息很多都不在模型的上下文里。 只要人手里还有 AI 不知道的信息,就必须有人参与到这个 Loop 中,把这些关键信息持续注入系统。所以,Developer Feedback Loop 很难完全自动化。 6、最外层的 Loop,说白了就是获取真实世界的反馈。前面两层 Loop,解决的都是实现层面的问题。 而到了这一层,关注的是这个产品方向到底对不对,以及我们接下来要做哪些功能。 通过了解用户的反馈、分析数据或者研究竞品的产品等等方式,我们需要不断修正自己的产品判断。 诸如这个功能到底有没有必要做?用户真正的痛点是不是这个?产品是不是应该换一种交互方式?甚至,我们是不是一开始就选错了方向? 真实世界的反馈会不断影响开发者的判断。开发者再把新的理解更新到 Spec 中,交给 Agent 继续开发。这就是三层 Loop 之间的关系。 7、非常透彻。所有对 Loop Engineering 有所困惑的同学,都应该看看这篇文章。文章我放评论区了。 最后,再画蛇添足一句,我感觉这些新词,真的就是换了种说法而已。之所以能爆火,核心还是因为这些概念,精准击中了目前 AI 行业正在发生的变化。 要我说,Loop Engineering 就是递归式的自我提升。Keep Building。
显示更多
0
55
642
156
转发到社区
成立两年,这家AI公司的估值都冲到200亿了。 下午在中关村和几个朋友聊天。大家都很感触,智谱转眼之间就成了一个万亿市值的公司,这谁能想到,前两年甚至还觉得人家要黄了。 这就是创业啊,探索逻辑,不是考试逻辑。 顺着 LLM,我们聊到了具身智能。有朋友说,现在国内这批具身智能公司中,谁有智谱或者Anthropic的潜力。 我毫不隐讳的抢答,我自己最看好自变量这家公司。过去一年,我写过很多次自变量的模型。 从我的视角,他们每次的新模型或者新论文还是都能给我不小冲击。 今天是上半年的最后一天,不是很忙,这会坐在电脑前,我想写写自变量这家创业公司。 如果你关注具身智能的话,无论从哪个方向看,自变量基本都绕不开。 而且自变量现在的发展节奏也非常猛。刚刚成立两年时间,最新一轮的估值就已经突破了 200 亿。 美团、阿里、字节、小米这四大互联网公司分别都领投过。 这事还是非常罕见,换个角度说,我们可以理解为这几家互联网公司都非常认可自变量的技术方向或者技术水平,要不然也不可能轮番下重注。 自变量这家创业公司有什么来头?我先说下具身智能模型的背景。 具身智能领域的模型,虽然大家嘴上都说在做大脑,但技术方向其实差别很大。 说白了,具身智能大脑要解决的核心问题就一个,让机器人能够和物理世界交互,像人一样去干活,擦桌子、洗衣服这些。 但具体怎么实现这件事,路线分歧还是比较大的。 从模型结构上看,有的侧重做 VLM,也就是视觉语言模型,核心能力是看图、看视频、回答问题、做推理,对世界的理解更多是语义层面的。 另一条路是世界模型,更关心的是给定一段历史状态和动作序列之后,能不能预测出下一帧世界会变成什么样,关注的是物理约束和因果关系。 而且要训练具体模型模型,数据是绕不开的核心问题。和大语言模型可以从互联网上抓取信息不一样,具身智能的数据得从物理世界采集,这件事本身就很难。 没有那么多现成的数据。 从数据来源看,有的公司会用真实世界的数据,采集成本高、场景杂、噪声多,但贴近真实部署。 有的用仿真环境的数据,在物理引擎里自动刷任务、生成轨迹。训练方式也很多样,有走强化学习的,有做模仿学习的,有先学状态转移再做规划的。 总的来说,这个领域现在还处在百花齐放的阶段,大家方向不同,评测标准也没有统一。 和 LLM 领域完全不一样。毕竟 LLM 领域,大家都在 Transformer 的基础上,做 Scaling Law,做 RL,大的方向是一致的。具身智能方向还没有什么标准答案。 自变量的探索特别有意思。今年 4 月份,他们发布了全球第一个世界统一模型 WALL-B。 之前整个行业做具身模型,主流思路是 VLA,也就是把视觉、语言、动作几个模块拼接起来。 但 VLA 走到后面是有天花板的,因为它的核心范式是模仿,一旦环境发生迁移,就比较麻烦。 后来很多人就在讨论,是不是把世界模型和 VLA 结合起来,在 VLA 上面外挂一个世界模型,因为世界模型能够在脑海里做预演,可以解决任务迁移的问题。 但这种拼接方案,整个行业基本都认为是中间过渡方案。因为拼接就涉及到数据的搬运和迁移。 大模型领域已经印证过这件事了,这两年为什么一直在强调原生多模态?就是希望模型能够原生地去理解多模态信息,而不是非得外挂一个结构。VLA 和世界模型的关系也是同样的道理。 所以当他们在 4 月份发布 WALL-B 的时候,我非常震惊。 自变量做的其实是原生的世界模型,把视觉、语言和动作放到同一个模型里从零开始联合训练,统一的架构,各个能力在一个系统里头直接协同。这是全世界第一个朝这个方向尝试的模型。 WALL-B 是 4 月份发的。然后上个月自变量又在这个基础上发了另一个模型 WALL-WM。 在做完世界统一模型之后,他们又回过头去思考一个更底层的问题:具身智能模型基本单元到底是什么?因为用什么最小单元来建模,会极大影响模型学习什么。 这个在大模型领域已经印证了,视频模型也经历过。比如视觉领域,之前的最小单元是像素,后来大家慢慢发现,更合适的其实是语义。到了语义这个层面,视频模型才有了质的飞跃。 自变量团队沿着这个思路推演,判断具身智能领域也面临同样的问题。现在大部分具身系统,默认的基本单元还是时间序列,按时间均匀采样。 但他们尝试之后认为,这个基本单元应该是关键事件序列,就像人一样,人感知世界不是按固定帧率来的,而是按事件来的。 于是在之前世界统一模型的基础上,他们又提出了事件驱动的世界模型。 先是做了端到端的统一架构的原生世界模型,然后又在这基础上做了事件驱动。 总之我的感觉是,这些探索也许是在倒逼着整个行业去思考,什么才是难而正确的事。 有同学可能会问,是不是你说的这些还是纯概念? 哎,具身智能前两年确实被一些观点带歪了,觉得这行当泡沫很大。其实不是。 一个新技术的演进是涌现式的,用 Anthropic CEO 的话说,是指数级增长。很多人感知不到,是因为在指数曲线的前半段,变化看起来很慢。 但仔细看一看过去这半年,变化其实已经在发生了。好多人嘲笑机器人跑马拉松,觉得这能说明什么。 但隔几个月再去看同一件事,感受是不一样的,明显比之前跑得好太多了。这就是在变化,只是没到那个让所有人都惊掉下巴的时刻而已。 还有很多人可能没注意到,自变量的机器人前段时间已经和 58 到家合作,进入了不少家庭,直接做家务去了。 注意,不是在实验室里做演示,是真的去普通人家里擦桌子收拾东西。还有工业场景也已经在跑了,汽车产线、物流分拣,都在真实环境里干真实的活。 当然,这些都是很微小的开端。就像 GPT-3.5 刚出来的那个阶段,好多人没有看见,还蒙在鼓里,但其实产业渗透已经开始了。 如果对具身智能或者人形机器人感兴趣,推荐去看一看自变量发的一些技术报告和模型。 哪怕不是做这方面研发的,只是作为一个爱好者,看看也会觉得很有意思。 我自己经常去翻这些信息,看完之后大概就能理解目前这个行业遇到了什么问题,以及大家在怎么解决。 光是这个过程本身,就挺有趣的。
显示更多