注册并分享邀请链接,可获得视频播放与邀请奖励。

Eric Xu (e/Mettā)
@xleaps
polymath, polyglot, root of a ternary tree. building prev @Meta @Google @Reddit phd in classic ai; rookie pilot 🛩️; martial artist
3.7K 正在关注    35.3K 粉丝
2026 年上半年的 Sonnet 还能主打一个 Coding Subagent. 到了 2026 年下半年,特别是 GLM 5.2, Kimi K3 和 GPT Luna 三英战吕布,Sonnet 在价格上毫无竞争力,而且 Tokenizer 还凭空多了 40% 的 Token 用量,属于生态位严重受限的模型。 Sonnet 实际上是 Anthropic 最赚钱(margin 最高)的模型,如果 Sonnet 不能维持定价权,搞不好 Anthropic 全年的外推 ARR 会因此在年中达到最高后下降。
显示更多
科普一下“多模态”的具体含义。 首先,我们虽然不认为盲人有“智力”上的缺陷,但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉,不是其他模态(文字或者语音)能够简单取代的。这里面有一个人择原理:即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统,也选择了用 2D 屏幕而非字节流表达计算机操作,因此 AI 为了在现实世界和数字世界中完成任务,必须接受人类已经接受的模态和输入。 多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界,特别是视觉信号,可以帮助模型 grounding ,比如“红灯”它到底是一个什么样的信号, 在语义上毫无问题,但在开车场景里要接近人择的感知和推理,才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型,都是人择的。 即是是纯粹追求虚幻的 AGI 目标,就以长程任务为标尺, DeepSeek 要做的长程任务,持续学习,最终也都绕不过多模态,特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言,不依赖计算机屏幕,来操作针对视觉无碍者设计的计算机,很好完成长程计算机操作任务。 AI 也会在这种选择压力下,迫使 tokenize 人择的数字视觉信号。 DeepSeek 不愿意在 AGI 的路上做多模态的输出,和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题,牵涉到如何构建扩散或者 flow match 模型,如何让输出的分布不塌陷到平均期望上,如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务,可以被通用的 AI 模型一句话调用,因此可以从通用智能里外化掉。 DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的,而且许多我知道的企业应用里,都有人在试图给 DeepSeek 嫁接一个 ViT.
显示更多
Just like I predicted: Kimi K3's license requires inference providers to enter a separate commercial agreement (ARR > $20M). Kimi might be the first company doing a "fabless" business model. -- 验证了我几周前的预言: Kimi 的开放权重模型 K3 ,有单独的商业授权协议,在这样的协议下,模型训练和推理可以在商业上分开,就和半导体设计与制造一样。 围绕着开放权重模型会有一整套的生态和公司,比如专门从事为企业应用微调的,专门做 prefill-only 适配的等等。这种生态系统层面的力量,是封闭厂商完全没法匹配的。
显示更多
0
9
169
22
转发到社区
大模型是一个专利期十个月的制药生意
0
14
382
89
转发到社区
大家或许不知道的是,那些 OpenAI 和 Anthropic 的账单,包括 API 和月订阅 都是 Stripe 处理的 不是说要卖铲子么 Stripe 就是卖铲子的其中一家 从产业链上每 Watt AI 拿走大约 $0.05 但支付本身消耗瓦特极低,所以是一个近似于 Meta 的极好的生意 可惜是未上市标的,否则上涨应该是超过内存股票的
显示更多
我觉得 Stripe 这是业务发展太牛逼了,它打算以 100 亿美元的估值收购 OpenRouter。 想想两三年前很多人只觉得 OpenRouter 是个规模大点的中转站,甚至对中转生意轻视,这波交易要是成了,那就是中转生意的天花板了
显示更多
0
9
158
7
转发到社区
这个模式我在 LinkedIn 上前几天写过 其实是一个真正追求产品质量的团队最终必然要实现的一种模式 (我原创的名词:叫做 shadow steering ) 它是这样的: 平时一个普通的模型工作。另一个更聪明的模型在后台并不需要做什么 甚至无需输出 只要输入 (输入成本极其便宜)来维护一个 prefill kv. 到了某个时刻 harness 侦测到小模型质量下降干不下去的时候,大模型介入 输出一百个 token 的指导 小模型被点悟 一点即通 继续干活 这个 “影子点拨”可以藏在小模型的思考轨迹里 反正用户看不见 这种直接在轨迹上的点拨比 off policy 不知道高到哪去了,因为可以在长程任务中期给一个 on-policy 的指点 后面拿来蒸馏非常舒服 这个模式可以用来节省大量中等模型成本,也可以用来蒸馏,用来测试,用来收集长程任务质量等等 回到这则新闻本身。我看到的是它只能说明一件事情,DeepSeek 下一代模型已经训练完毕,在影子测试而已 智能程度让用户感知到了 Fable 5 而已。
显示更多
0
18
159
22
转发到社区
因为行业内,可以说些其实是公开但是大多数人未必知道的事实 开放权值模型在商业领域的授权一般用户接触不到,但实际上从一开始就有的。当年 llama 时代就规定了如果模型被 700M 以上月活的公司拿去做事情,要有商业许可证。 当年的 Qwen2.5-72B 也是 100M 月活(MAU) 后要商业许可证. Kimi 的我不清楚但官方也说过有商业授权。 Inference 起来之后,哪家提供 GPU 去推理就从某种程度上看不再重要,重要的你的服务(包括在上面的微调)到达一个量级,就属于商业应用,不再受普通用户许可证规约。 所以整个行业的生态目前还是比较健康的,最终头部开放权重模型厂商基本上就是不拥有硬件的纯模型厂商,和 nVidia 不拥有物理的芯片生产,却照样赚钱一样。 目前拥有模型 serve 能力的厂商因为各种动机,反而不愿意自己去开发模型,反而去研发某种“先进封装”能力(即微调产业链,routing , 模型为推理硬件做优化等等)。 而哪些号称要狂买硬件设施的垂直集成的模型厂商,未来会发现硬件实在不是一个好的业务,$W 回报率很低。 这样,整个模型生态将来会和英伟达/台积电的生态同构,设计(模型训练)和制造(模型推理)商业模式分开但 co-design。 当然你可以说,模型训练和推理垂直整合最优效率。您说的对,其实当年半导体的设计制造一把下也是有诸多好处的,然而行业趋势不受局部最优影响,这个行业里有太多的张忠谋。
显示更多
月之暗面 kimi 的开源是有限制的,cursor 之前用的 kimi 的底座做了自己的模型,会有强制署名但是没有收益分成。 用户量门槛:产品的月活跃用户(MAU)超过 1 亿。 收入门槛:产品的月收入超过 2000 万美元。 Cursor 的年化收入(ARR)已达 20 亿美元,单月进账约 1.67 亿美元但是很可惜 kimi 没有多分到一分钱。这次如此顶尖的模型也开源,是应该考虑给自己多增加一些授权收益了,提高一点天花板。 能力到这个份上不能再给人白嫖了,开源可以但应该加上一些限制给自己多创造一些收益,否则没有持续现金流优势很难持续保持,烧钱总有一天是会烧完的
显示更多
0
2
113
21
转发到社区
出来说句公道话,这是不可能的 Caffe 问世的时候 是深度学习刚开始的西部拓荒时代 大家都还手写算子手工搭建计算图呢 Caffe 让搭建卷积网络变成搭建一个描述。 这在当时是纯新的范式,哪里有什么“闭源产品”可以借鉴? 如果真的有,不妨说出名字。
显示更多
@46ge5 成名作caffe也是借鉴的他看过的一个闭源产品做的
推荐这个系列 每篇都小而美 文章和解释一看就懂 而且很简约 没有什么“炸裂”, “本质”, “不是这个是那个” 这些毫无意义的 AI 填充物
我不是 Elon Musk 的粉丝什么的,但是我常常审视自身的“外插局限”。 每当我预测什么事情的上下限的时候,我就先阅读一遍当年那个号称卫星专家写的“为什么 Starlink 不可能实现” 的帖子 ----- 每颗 Tintin 卫星(Starlink 星座的演示卫星)重 400kg。假设每颗卫星加燃料(并且重量不会因为其他原因增加)是 1kg,那么单次 F9 在每个倾角轨道上可以发射 22 颗(整流罩里大概率根本塞不下这么多,但我们先忽略)。所需的一次性 F9 发射总数是 546 次;假设第一颗在 2020 年上线,而整个星座到 2025 年完成(官方说法是“2020 年代中期”),那就需要每年 110 次 F9 发射。整个研发和部署的总成本据说是 100 亿美元。 SpaceX 目前只有一个能进行极轨发射的设施,SLC-4E(也许 Brownsville 可以,但从那里发射极轨会擦着墨西哥海岸线飞过去——我感觉他们不会太高兴……)。所以每个发射场一年要发射 54–55 次 F9。 我们来极其乐观一点。每颗卫星都用一次性的 Falcon Heavy 发射;每颗卫星都刚好是 400kg(不太可能,因为你需要载荷质量余量,而且更低的卫星轨道大概率还需要更多燃料);我们忽略每颗卫星是否真的塞得进整流罩;我们完全忽略发射倾角(以错误倾角发射,对一颗想变轨的卫星来说简直是地狱);也就是说每次发射 160 颗卫星(几乎肯定不可能,因为整流罩体积不够)。这样最少需要 75 次 FH 发射(几乎肯定不现实)。我们还假设它第一次发射是在 2019 年 1 月 1 日,并且最终完成日期定在 2027 年 12 月 30 日。这意味着每年要发射 8–9 次 FH。听起来很简单,对吧?但这已经比 SpaceX 目前每年从 SLC-4E 发射的次数高出大约 23%。它实际上必须把自己的极轨发射次数翻倍,而且这是绝对最低要求。这个“最低要求”几乎肯定在物理上就是不可能的。 我觉得造卫星不会是问题,Elon…… SpaceX 里居然没有人做过这种信封背面的粗算,然后问问 Elon——这是不是稍微有点太有野心了?
显示更多
其实Space X的市值上限也很低的。 SpaceX 的一个核心业务是Starlink。 2025的starlink 营收113亿美元。 ATT+Verizon+Tmobile+Comcast一起的市值是加起来6000亿美元左右。 但是 这四家的revenue加起来是 1380+1250+ 1210+883= 4723亿美元。 starlink的营收和这些大哥比起来,一个零头都不到。 那么现在的卫星业务能不能替代ATT+Verizon+TMobile+Comcast吗? 星链业务加起来能占整个connection 市场业务10%就了不起了。 本来这种卫星业务就是一个现有通信系统的补充。 太空数据中心,不就是PPT么。 这不叫市盈率,这叫市梦率。 老马不是神仙,XAI搞了那么大阵仗,结果呢? 沦落到出租数据中心给别人用。 高估值还需要靠跟google的关联交易。
显示更多
不知道推上有没有热心的同工开始把 POPE LEO XIV 的通喻翻译成中文 这将是一件有意义的事情
大约半年前和一个朋友闲聊的时候聊到 AI 怎么投资 . 他不是做技术的 我于是半开玩笑半认真地说你看到亚洲人做 CEO 的股票就去买就行了 这几天 Intel / AMD 又大涨,他刚刚发个信息说“我终于相信亚裔的力量” 🤣 😂
显示更多
I jokingly told a friend of mine a good investment alpha in AI is “Asian CEOs”. Nvidia — Jensen Huang AMD — Lisa Su TSMC — C.C. Wei Micron — Sanjay Mehrotra Broadcom — Hock Tan Intel — Lip-Bu Tan — He told me he now fully understands Asian power 🤣
显示更多
一个中国人的名字里藏着他出生那一年的新闻联播。比如叫建国的,我们都能猜出他的年龄。 为了做 2000 万有机虚拟中国人的数据集,我花了几天让模型学会了名字和出生时代的关联。记录如下:👇
显示更多
0
11
87
14
转发到社区
看了好几篇介绍 Claude Managed Agents 的中文长文,越看越不懂这是用来干什么的,最终还是要靠跟 Claude 对话来问明白,然后结合我参与 coding agent 项目的经验来理解。我觉得介绍任何新概念,必须把下面三件事情说明白: 1. 它尝试解决的问题是什么? 2. 它如何解决了这个问题? 3. 你如何用它来解决这类问题? 如果你决定自己写一个 Lovable,你需要有一个云端的 agent 来响应用户在浏览器里面输入的 prompt,然后编辑存储在云端的那个网站,这是 Managed Agent 尝试解决的问题。如果你用 Claude Code 写代码,这事情跟你没半点关系。如果你写客户端的 agent loop,例如说 iOS 应用,这也跟你没关系。 Managed Agent 解决自建云端 agent 以下常见问题: 1. 需要自建 context 存储。用户今天创建一个 Lovable 项目搞两下,关掉浏览器后明天再打开,这个 context 怎么继续下去?你要找个地方存。用 Managed Agent 的话就它帮你存。 2. 需要不停地根据新模型的行为调整 harness。老的模型需要这样 prompt,需要在这时候 compact memory,新模型出来你可能要摸索着改。用 Managed Agent 的话就由 Anthropic 帮你维护 harness 更新,你根本接触不到 agent loop。 3. 需要智能启停云端 agent 实例。用户打开一个 Lovable 项目,启动对应 agent;用户关闭浏览器,过一段时间后停止实例;实例崩溃了但前端还连着,赶紧重启新实例。Managed Agents 可以帮你管理这些实例,你从前端发 prompt 过去就好。(实例仅在 agent loop 跑着的时候计费,停下来等下一个 prompt 就不再计费。) 你自己写的这个 Lovable 可以通过 API 来调用 Managed Agents 创建 context、harness 和 sandbox(临时存储和编辑用户网站的环境),你不再需要手工解决上述问题。 在创建 harness 时你可以提供 system prompt 和 tools,这样云端 agent 知道自己该干什么,懂得调用 tools 来跟 sandbox 打交道或者跟其它云端服务打交道。例如说你写的 Lovable 要支持生成图片,你可以提供一个调用 Nano Banana 的 tool 给 harness。 最后我还是要吐槽那些贩卖信息赚取流量的中文内容,对于一个新热点如果你连顶上三个问题都说不清楚你还是别写了吧。
显示更多
0
5
88
10
转发到社区
#BuildInPublic# 开源了一个 AI 模拟引擎 SGO (语义梯度优化引擎) 在 AI 世界迭代产品或者功能,目前最最缺少的就是现实世界现实用户的反馈;这些反馈意见序列实际上构成了产品的演化路径。 然而用户(真人)反馈周期较长,且不能覆盖所有的情景。当下,我们常常让 LLM "假装"某一类用户得到一个近似的反馈,但这种反馈都是一个一个的数据点,完全取决于事先规划好了的角色。 SGO 采用的思路是: 用和人口普查对齐的合成数据来模拟真人用户。NVIDIA 开源了多个主权数据集,比如对于美国,Nemotron-Personas-USA 数据集里有一百万个基于美国人口普查数据生成的合成人物。不是那种 LLM 随便编的"有着三十年经验的工程师",而是有完整背景的人——伊利诺伊郊区的建筑工人、德州农村的手工艺人、纽约的单亲妈妈等等。他们有各自的爱好、习惯、关注点。这些人的年龄、学历、职业、收入分布都跟真实人口一致。 SGO 的采样, 模拟和梯度计算框架可以让你直接从这些人里拿到反馈,周期大约 30 秒,LLM API 花费大约 $0.10。 使用方法也很简单:把要优化的东西贴进去,比如产品描述、融资 pitch、一则爆款文章等等(有一个用户甚至把他的约会 profile 放进去优化)。总之什么都行。 SGO 会很科学的帮你自动选择优化目标和目标受众。确定好以后,从这 100 万个有机数据人群中科学采样 (stratified sampling)、分类聚类、逐一询问反馈(contrafactual inquiry)、对照目标,逐一构建所谓的"语义梯度" (相当于目标对于各个变量的 Jacobian 矩阵), 以及最终的汇总反馈和迭代方向。 代码开源,目前部署在 HuggingFace Spaces 上可以直接试用。 你可以把 SGO 作为 Skill 单独使用,也可以把它放在一个内循环里,和 auto-research 联合使用。 HF Space: 希望 SGO 和 auto-resesarch 结合,帮助大家优化那些跨越数字世界和现实世界的许多场景。 PS: 现有的跑通的场景 * 简历优化 * 商业计划 * App UX 设计 * 广告牌设计 * LOGO * 网页的版式和颜色 * 约会档案 * 一个甜点屋的名字
显示更多
0
8
103
20
转发到社区
太赞了 我一个朋友上个月把 claw 装上了 steam deck 也是形似 Steam deck 原生 Linux 还能用 Aurora 所以安装很容易 能装上 switch 还是第一次见到
Ladies and 乡亲们, Let's welcome the world's first Claw 🦞 running on Nintendo Switch The Childless Cat Lady 🐱 Tutorial will arrive tomorrow
@yihong0618 众生畏果,抱怨世界模型; 菩萨畏因,深修自身 Prompt。
@yihong0618 众生畏果,抱怨世界模型; 菩萨畏因,深修自身 Prompt。