註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 WorldModel
WorldModel 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 WorldModel 的搜尋結果
做大世界模型研究的人很需要这个工具:stable-worldmodel 它做的就是这一块。这个仓库提供可复现的 world model 研究与评测平台,文档、测试、PyPI 包和论文入口都在一处,适合想把实验、对比和结果复核放到同一套流程里的人。 GitHub 现在约 1.5k stars,今天新增 318 stars。 仓库地址:
顯示更多
0
26
23
1
轉發到社區
🔥赛博修仙哪家强?书生、画家、建筑师、禅师和梦游者 ,趣味解读“世界模型”五大门派 2026年,AI圈最热的话题就是世界模型。过去一年半,上百亿美金砸进去,光今年前7个月就冒出来20多家新公司。 要是把这股热潮比作修仙,那各路门派选的功法可太不一样了。书生、画家、建筑师、禅师和梦游者各有其道。 先说最早火起来的那拨书生,即语言中心派。他们的思路特简单:大语言模型不是已经能预测下一个词了嘛,那把图像、视频、动作统统转成文字,不就能接着预测了?小鹏汽车就这么干,把驾驶视频和指令全塞进语言模型里。 但问题也明显。智源的王仲远说得直白:这玩意儿学的是“用语言描述的世界”,不是世界本身。就像个熟读兵书的书生,嘴上头头是道,真上了战场连马都骑不稳。换个摩擦系数或者重力参数,立马抓瞎。 第二拨画家们走的是像素路线。代表人物就是Sora那帮搞视频生成的。他们的想法更直观:世界长什么样,我就让AI看海量视频,学会预测下一帧画面该长什么样。用扩散模型直接生成像素,看起来特华丽。 可这路也有硬伤。业内现在有句话叫“视频生成不等于世界模型”。一个能生成熊熊烈火的模型,可能根本不懂燃烧的物理过程。它学的是像素的统计规律,不是因果逻辑。看得见,摸不着。 第三拨建筑师务实一点,搞三维结构。李飞飞管这个叫“空间智能”,让AI理解三维空间里物体怎么摆放、什么关系。World Labs就在做这个。 但光有形状也不够。你能重建一个杯子的3D模型,却很难告诉AI它摔下来会怎么碎。离真正的“理解”还差得远。 第四拨禅师就有点玄了。LeCun推的JEPA系列,走的是视觉表征路线。它的核心心法是:理解世界,不必重构像素。别人在临摹名画,它偏要去悟画家的笔法逻辑。在潜空间里预测状态变化,不生成任何画面。 好处是参数少、速度快、不怕噪声。但坏处也在这——它到底“悟”到了啥,外人根本看不懂。就像修仙小说里那种闭口禅,外人只道他修为高深,真问他却一个字说不出来。 第五拨梦游者更像梦中证道。以Dreamer为代表的强化学习派,先在脑子里建一个虚拟世界模型,然后在里面反复做梦、模拟、试错。等练得差不多了,再出来实战。蔚来的智驾就是这么搞的,让算法先在模拟的未来里跑个几千遍再上车。 五条路,各有各的牛逼,也各有各的坑。 那为啥到现在还没人能“飞升”? 第一,连“世界模型”到底是个啥都没吵明白。 视频生成也叫世界模型,物理引擎也叫世界模型,概念乱得很。李飞飞专门写了篇长文来厘清,说明这行业连渡劫标准都没统一。 第二,数据根本不够。 大语言模型能从网上扒无穷无尽的文本,但物理世界的数据呢?一个杯子掉地上碎了,人类看一眼就懂,可要让AI学会这个因果,得需要带精确几何和物理标注的多模态数据。这种东西比互联网文本稀缺好几个数量级。 第三,架构还在乱战。 到底是重建像素还是预测潜空间?是生成式还是判别式?到现在没人知道答案。2026年虽然被叫成“世界模型元年”,但元年嘛,就是刚起步的意思,别指望大成。 有意思的是,各家掌门人最近都开始往一块凑了。 李飞飞觉得,渲染、模拟、规划这些知识本质上是同一套,最后应该融成一个统一模型,既能生成照片级画面,又能理解物理因果,还能规划行动。 上海AI Lab那边也在推新思路,世界建模不该只是预测世界,而是服务Agent。说白了,模型得帮AI干活,不能光会看。 我觉得这事最后大概率不是某一条路线胜出,而是谁能把各派功法打通。修仙小说里真正飞升的,往往都是在看似矛盾的功法交汇处找到机缘的。 #WorldModel# #PhysicalAI# #EmbodiedAI#
顯示更多
0
80
33
0
轉發到社區
World Model × Reward Density:递归自我迭代的真正拐点 过去几个月,讨论 AI 递归自我迭代(Recursive Self-Improvement, RSI)时,关注点几乎都放在模型能力和算力增长上。 但研发系统的实验效率相对模型和算力,可能才是真正的瓶颈。 过去一年,这个系统正在发生两个根本性变化:一是 World Model 快速成熟,二是 AI Model Design 的 Reward Density 持续提高。这两个趋势彼此强化,最终指向同一个结果——AI 研发正在从依赖真实实验,转向依赖模拟、预测与自动验证。 World Model 的意义远不只是让模型理解现实世界,更重要的是让 AI 可以构建越来越接近真实世界的原生模拟环境(Native Simulation World)。过去的模拟器主要依赖人工编写规则、物理公式和专家经验,只能覆盖有限场景;未来的模拟器将越来越多由模型生成,直接学习真实世界中的交通、人类行为、企业经营、材料性质、机器人动力学乃至科学规律。模拟世界将逐渐从 Rule-based 转向 Model-based。 这意味着 Simulation 与 World Model 不再是两个独立模块,而是一个递归系统。真实世界提供数据,训练 World Model;World Model 构建更真实的 Simulation;Simulation 为 AI 提供几乎无限的实验机会;实验产生大量高质量合成数据,再反过来继续优化 World Model。 整个循环可以表示为: Reality → World Model → Simulation → Synthetic Experience → Better World Model → Better Simulation → ... 一旦进入这一循环,Simulation 本身开始成为新的数据源。过去互联网几乎承担了全部训练数据来源;未来互联网、Simulation、机器人和自动实验室将共同构成模型训练的数据基础。其中,Simulation 将成为增长最快的数据来源,因为它几乎没有成本,可以无限复制、暂停、回滚、并行和加速运行。 机器人是最直接的受益者。今天机器人最大的瓶颈并非模型能力,而是真实数据获取速度。现实中,一台机器人一年只能积累几千小时经验,而 Simulation 可以同时运行数百万个机器人,在一天内完成现实世界几年甚至几十年的探索。机器人训练因此会逐渐从 Reality-first 转向 Simulation-first,真实机器人更多承担最终校准,而非主要学习过程。 科学研究也将遵循相同路径。未来药物、材料、催化剂、电池、蛋白质设计等领域,大部分假设将在 Simulation 中完成筛选,仅将最有希望的方案送入真实实验室验证。湿实验将越来越像对 Simulation 的最终确认,而非发现过程本身。 如果说 World Model 解决的是实验环境,那么 Reward Density 解决的是实验反馈速度。 AI Model Design 正在成为所有研发任务中 Reward Density 提升最快的领域之一。过去修改一个 Attention、优化一个训练策略或者调整一个架构,往往需要数周训练才能知道结果,反馈极其稀疏。今天越来越多中间信号已经能够提前提供可靠奖励,包括 Loss Curve、Scaling Prediction、Training Stability、Token Efficiency、Inference Latency、Proxy Benchmark 等。很多决策无需等待完整训练即可获得有效反馈,研发循环开始从周缩短到天、再缩短到小时。 World Model 的加入进一步提高了 Effective Reward Density。过去,一个团队提出一百个模型设计,只能真正训练其中极少数。未来,大部分方案将在 Simulation 中完成预验证,仅保留少数最优设计进入真实训练。单位时间内能够获得的有效反馈数量因此不是线性增加,而可能提高一个甚至多个数量级。 真正发生变化的不是 Reward Density 本身,而是有效 Reward Density: 过去: 100 个想法 → 训练 3 个 → 获得 3 个 Reward。 未来: 100 个想法 → Simulation 验证 95 个 → 训练 5 个 → 获得近百个高质量 Reward。 研发系统开始进入典型的正反馈。 RSI 意味着:Model → Better Model。 但如果拆开来看,其实是: Model → Better World Model → Better Simulation → Better Evaluation → Better Model。 更进一步,World Model 本身也是模型,因此模型不仅开始优化模型,还开始优化整个研发基础设施,包括 Evaluation、Reward Model、Simulation、Compiler、Kernel、Memory System、Chip、Interconnect、Datacenter、Energy 以及 Robot Lab。优化对象从单一模型扩展到整个 Intelligence Stack。 从这个角度看,RSI 的速度可以拆解为五个核心变量: RSI Speed = f(Model Capability × Experiment Speed × Reward Density × Automation Ratio × Compute) 过去几年,模型能力和算力提升最快,而实验速度、Reward Density 和自动化比例一直是限制因素。现在,这三个变量正在同时改善,并形成多个相互强化的反馈环。 Reward Density 提高,实验速度提升;实验速度提升,提高自动化比例;自动化比例提升,进一步增加迭代频率;更高的迭代频率提升模型能力;更强的模型又提升 World Model;更好的 World Model 再提高 Reward Density。 整个系统开始形成真正意义上的递归飞轮,而不是单变量增长。 因此,RSI 更可能表现为阶段性加速,而不是平滑指数增长。每当一个关键瓶颈被突破,例如 Evaluation、Simulation 或 Robot Lab,整个系统都会进入新的增长档位。 基于目前的发展节奏,可以将 RSI 粗略划分为四个阶段。 第一阶段已经开始。AI 能够辅助模型研发,但仍高度依赖人类完成实验、分析和决策,研发循环以周为单位。 第二阶段将在 World Model 和 Reward Density 继续成熟后出现。AI 将能够提出设计、完成 Simulation、自动 Evaluation、自动 Revision,人类只负责批准关键实验,研发循环压缩至小时级。这将是自动 AI Research 真正形成飞轮的起点。 第三阶段将随着 Robot Lab 普及而到来。Simulation 与自动实验室形成闭环,真实实验自动更新 World Model,整个研发流程实现 7×24 小时运行。现实世界逐渐从主要训练场转变为校准场。 第四阶段,也是 RSI 真正意义上的广义扩张。AI 不再只是优化模型,而是持续优化芯片、网络、能源、机器人、制造系统和整个智能基础设施。递归优化对象从 Software 扩展到整个 Physical Intelligence Stack。 基于上述路径,接下来最值得关注的是五个领先指标:AI 完成一次研发迭代所需时间;AI Model Design 的 Reward Density;World Model 对真实训练结果的预测精度;Simulation 与现实实验的一致性;以及整个研发闭环中自动化完成的比例。 这些指标共同决定了递归自我迭代是否真正开始进入加速阶段。 接下来,Simulation 将成为主要训练场,Reality 将成为最终校准场。 当 World Model 足够准确、Reward Density 足够高、Robot Lab 足够自动化之后,AI 将第一次拥有持续、自主、高频率优化自身的实验环境。这并不意味着智能会瞬间爆发,而意味着决定增长速度的约束正在系统性消失。 当研发系统本身成为优化对象时,递归自我迭代才真正开始。
顯示更多
0
29
10
2
轉發到社區
李飞飞写 world model 的分类学,本质上和你们V子写以太坊 ZK rollup 的路线图是一件事情,给看不懂的VC指明方向,接下来就跟着指挥棒瞎聊瞎打钱然后再瞎写一堆"Why we invest in XXX"结束。
顯示更多
晚点独家丨蚂蚁灵波启动首轮融资,拟募资 15 亿元,年底完成二轮融资 晚点独家获悉,蚂蚁集团旗下具身智能公司灵波科技(以下简称 “蚂蚁灵波” 或 “灵波”)已启动首轮融资,首轮拟募资 15 亿元,目标在今年年底完成二轮融资。该融资若如期完成,将突破具身领域创业公司的融资速度。 灵波过去一年公开展示出来的路线是全球少有的完整布局:Vision 、Depth 、Mapping、Video、World Model 、VA 、VLA,几乎把机器人感知、理解、行动的大脑链条都覆盖了。 据悉,当前资本市场对具身领域的投入,一半资金流向本体公司,一半流向具身大脑,且后者占比在加速提升。知情人透露,正因为蚂蚁灵波的独特布局被认为是具身智能发展的关键,所以早在灵波启动融资之前,已有投资机构开始主动接触灵波。在刚刚结束的世界人工智能大会(WAIC)上,甚至有投资人直接去到灵波展台,探访技术和产品发展情况,表达投资意向。 蚂蚁灵波的路线和美国 Physical Intelligence 如出一辙。全球具身智能赛道,Physical Intelligence 是公认的大脑层(Brain Layer)代表公司之一。Physical Intelligence 做的不在于让机器人学会一个动作,而在于让机器人获得一种可迁移、可泛化、可持续学习的物理世界智能。这也是为什么一家几乎没有机器人产品的公司,能够获得超过 110 亿美元估值的核心原因。 资本今天越来越相信:机器人最大的价值,不在身体而在大脑。因为,身体未来可以采购,甚至标准化。但是,世界模型、动作模型、数据这些不能买。所以全球现在估值最高的公司 Physical Intelligence 、Skild AI 几乎都不是因为机器人硬件,而是因为大脑层。 这一点,行业已形成共识。机器人大脑已经被宇树明确写进了 IPO 募资方向,这也是宇树招股书里最值得关注的信息之一。招股书显示,宇树此次 IPO 拟募集约 42 亿元,其中一个核心募投方向就是:智能机器人模型研发 、具身智能模型(机器人大脑)研发 。这也论证了具身大脑在机器人大规模落地中不可或缺的地位。 机器人大脑,将是具身智能角逐谁才是具身领域 OpenAI 的关键。 分析人士也向晚点透露,蚂蚁集团坚定布局具身智能方向,在灵波累计投入的资金已超一线创业公司的融资额。本轮融资后,蚂蚁灵波仍将是蚂蚁在具身和物理 AI 领域最核心载体,蚂蚁将在 AI Infra、数据资产和应用场景等资源上持续给予灵波最大支持,本次融资也是为了加快灵波具身大脑的发展。 不过,该人士也认为,尽管蚂蚁灵波作为国内机器人大脑的领军企业,但是最终估值并不会只取决于模型能力,而会取决于三个关键变量:是否证明 LingBot 系列模型在行业内具有领先的泛化能力;是否形成真实的大规模部署和数据飞轮;是否能从 “蚂蚁的具身智能团队” 成长为 “全球物理 AI 基础模型平台”。这三条路能否跑通将决定蚂蚁灵波在行业中的地位。如果这三个条件兑现,它未来的估值逻辑,将更接近 Physical Intelligence 这样的 “具身大脑平台”,而不是一家具身本体公司。
顯示更多
《用 CPV 模型预测 AI 技术演进》 过去几年,AI 领域几乎每天都有新概念出现。 Prompt Engineering、RAG、Memory、Agent、MCP、J-space、Tool Use、World Model…… 大多数讨论都围绕一个问题展开: 下一个热点是什么? 我更关心另一个问题: 为什么热点会依次出现? 如果一种理论只能解释已经发生的事情,它的价值有限;真正有价值的理论,应该能够预测未来。 CPV(Cognitive Positioning Value)提供的,正是这样一种视角。 它关注的不是某项技术,而是反馈最终作用到了系统的哪一层。 ⸻ AI 的发展,本质上是反馈不断向深层沉淀 CPV 将反馈划分为五个层级: CPV1:行为(Action) CPV2:状态(State) CPV3:模型(Model) CPV4:结构(Structure) CPV5:边界(Boundary) 越往下,反馈改变的对象越深。 AI 技术的发展,几乎就是沿着这五层不断推进。 ⸻ CPV1:改变输出 这一阶段的代表是 Prompt Engineering。 Prompt 改变输入。 模型改变输出。 任务结束,一切恢复原状。 模型没有成长。 它只是完成了一次推理。 后来出现的 Prompt 自动优化、思维链(Chain of Thought)、提示模板,本质上仍然属于这一层。 它们提高了完成任务的能力,却没有改变模型本身。 ⸻ CPV2:改变状态 随后,人们发现一个新的问题: 模型什么都记不住。 于是,Memory 出现了。 长期记忆、用户画像、上下文管理、会话历史…… 反馈终于开始影响模型的运行状态,而不是一轮对话。 模型开始拥有“今天的自己”。 但这里仍然存在明显的局限。 Memory 越来越长。 越来越混乱。 越来越互相矛盾。 于是,新的结构压力出现了。 ⸻ CPV3:改变模型 真正的成长,不应该只是不断累积记忆。 而应该修改世界模型。 例如: 昨天认为用户喜欢苹果。 后来连续半年都选择安卓。 系统不应该同时保存两条冲突的信息,而应该形成新的理解: 用户真正偏好的是开放生态。 这里发生变化的已经不是 Memory,而是模型本身。 未来的 AI 一定会越来越重视: 记忆巩固(Memory Consolidation) 经验抽象(Experience Abstraction) 世界模型更新(World Model Revision) 它们共同指向同一个方向: 反馈开始改变模型,而不是继续堆积数据。 ⸻ CPV4:改变结构 随着模型越来越复杂,另一个瓶颈出现了。 一个网络承担所有能力,越来越低效。 于是开始出现: Planner。 Executor。 Memory。 Vision。 Reflection。 Safety。 它们逐渐成为不同的功能模块。 MoE、Tool Use、Agent、MCP、多智能体协作,都可以看作这一趋势的不同表现。 未来 AI 更像一个组织。 而不是一个越来越大的 Transformer。 反馈开始重组系统结构。 ⸻ CPV5:改变边界 这是最深的一层。 今天,人们谈论 AI,通常想到的是: 一个模型。 未来,AI 的边界会不断扩展。 浏览器。 手机。 电脑。 机器人。 汽车。 摄像头。 传感器。 云端。 其他 Agent。 这些都会成为 AI 系统的一部分。 到那个时候,我们讨论的不再是一个模型,而是一个持续运行的智能系统。 它的边界不断重新定义。 人与 AI 的关系也会随之改变。 ⸻ 为什么 CPV 能预测未来? 因为每一层都会产生新的结构压力。 Prompt 足够成熟之后,系统开始需要记忆。 记忆足够丰富之后,系统开始需要学习。 模型足够复杂之后,系统开始需要重新组织。 结构足够完善之后,系统开始突破自身边界。 技术演进并不是热点随机切换。 而是上一层已经无法继续承载反馈。 新的层级因此诞生。 这是一种复杂系统普遍存在的演化规律。 ⸻ J-space 给了我们一个验证 Anthropic 最近公开的 J-space 研究,让人们第一次能够观察模型内部的工作空间。 很多人关注的是: AI 是否拥有了类似意识的东西。 我关注的是另一件事。 J-space 解释的是: AI 此刻如何思考。 CPV 解释的是: AI 为什么会演化到下一阶段。 两者回答的是不同的问题。 前者研究计算过程。 后者研究反馈如何不断向更深层沉淀。 它们并不冲突。 反而共同构成了一幅更完整的智能演化图景。 ⸻ 一个理论真正的价值 未来几年,还会不断出现新的技术名词。 也许叫 Workspace Editing。 也许叫 Self Evolution。 也许叫 Autonomous Organization。 名字会不断变化。 但如果这些技术仍然停留在同一层反馈,它们只是同一类问题的不同实现。 真正值得关注的,不是名字。 而是它让反馈深入了哪一层。 能够回答这个问题,才能真正理解 AI 为什么会这样发展,以及下一次技术跃迁会发生在哪里。 CPV 的意义,不在于解释某一项 AI 技术。 它试图描述的是: 所有能够持续学习的复杂系统,都遵循着同一种反馈演化规律。 因此,它不仅可以解释 AI,也可以预测 AI。
顯示更多
刚发现一个OpenMOSS(复旦大学等机构)发布的 Awesome-WAM 仓库,按一套架构分类法把 WAM 分成两类: 1、Cascaded WAM(级联式):先生成未来视频/画面,再从中抽取动作(UniPi、VLP、TesserAct、AVDC 这类)。 2、Joint WAM(联合式):视频和动作一起生成,又分 自回归(GR-1/GR-2、CoT-VLA、WorldVLA…) 扩散式(UWM、UVA、Cosmos Policy…) 还有World Model for VLA:把世界模型用于模仿学习、强化学习、以及策略评测(Dreamer 系列、WorldEval 等)。 并系统罗列了机器人数据集(OXE、DROID、Bridge…)、UMI、仿真、第一视角人类视频等。 他们还用一个开源的 summarization skill(Paper2Blog),为大量论文自动生成了一篇结构化的中文/解读博客,还把这个生成 skill 本身开源了。
顯示更多
《晚点聊》具身季报系列第二期:分享具身智能行业季度 Top 5 事件: 1/ 人形机器人马拉松第二年,终端大公司身影浮现 - 4 月 9 日的北京亦庄人形机器人马拉松,荣耀包揽了冠亚季军。他们有接近一两百人的团队,研发投入量级显著高于另外的两大夺冠热门宇树和北人(北京人形机器人创新中心)。荣耀定制了比赛所需的大扭矩电机和精密的液冷机制,当其他公司的机器人因为长时间高速跑动,导致电机过热不得不休息,荣耀的液冷机制让电机温度在整个比赛中都能控制在较低水平。 - 更深一层的信息是,荣耀夺冠预示了未来的竞争格局:大厂认真投入的话,可以快速拿出有竞争力极强的人形机器人产品。而在中国,拥有荣耀这样组织能力、人才能力和资金能力的大厂还很多——小米、小鹏、理想已经开始严肃投入。人形机器人正在从单一技术见长的创业公司视角,演变成一种系统工程和系统作战能力的竞争。 2/ Figure AI 的 200 小时直播:为何物流是人形机器人的好场景? - 5 月,Figure 连续直播200小时,这是第一次向全球公众展示人形机器人在工业场景的真实价值,三台人形机器人站在真实物流流水线旁做包裹分拣,把包裹翻面、让条码朝上,速度做到约3秒一个,。物流分拣是个好场景——重复、连续、长时间,不适合人类长期做。而之前的机器视觉加工业手臂的方案四五年来一直解决不好,因为快递软包裹上的二维码太容易遮挡和形变,不靠灵巧手很难处理那些长尾的corner case。 - 同期还有个插曲:成都舞者吴宇飞带着 8 台宇树 G1 在美国达人秀现场跳了一段舞,全票晋级。Figure 和这个节目的先后出现,让美国普通百姓非常直观的看到人形机器人怎么进入工业和商业场景。之前很多人看到中国春晚的机器人表演,还会怀疑是不是 AI 生成的、是不是录了很多遍。 - 物流场景在国内也有实质进展。星动纪元和中国邮政、顺丰做了长时间测试,已经能实现全自主的分包、翻面、扫描等一系列工序。中国公司在人形物流工业场景的落地能力,完全不亚于美国。 3/ 灵巧手与灵巧操作:舞肌可能成为灵巧手领域的 G1 - 灵巧手这个季度在 ICRA 维也纳会议上集中爆发。舞肌二代手20个自由度,体积只有全球头部玩家Sharpa的一半,反驱性能和散热大幅改进。舞肌的定位比较像宇树——专注于把一个低成本、高可靠性的硬件设备做到足够耐用,让大家在这个基础上做大量研究。过去一两个月,已经有大量中美创业公司基于舞肌的手发布了灵巧操作模型或工作进展。 - 灵巧操作模型的进展上, Genesis 发布了用定制五指手做的灵巧操作模型,他们公开称采集了约20万小时数据,用舞肌的手实现了拧魔方、做饭、弹钢琴等精细操作,被认为是目前高自由度灵巧操作的SOTA。 4/世界模型:英伟达发布 Cosmos 3,中国世界模型融资热 - 6月1日,英伟达发布 Cosmos 3,一个全开源的全能世界模型,可以原生处理文本、图像、视频、声音和动作,也可以输出这些模态。技术上用一个自回归 transformer 做推理、一个 diffusion transformer 做生成,中间靠共享注意力机制让两种模态相互影响。英伟达把机器人领域的世界模型分成三种:最底层是Video World Model ,本质底座是一个视频生成模型——根据条件或描述生成视频 、第二类是 Action-Conditioned World Model ,前提基于你的动作——给定一个动作,在这个条件下生成世界模型 和 World Action Model ,通过这个模型生成机器人的动作,可能同时也能生成未来的图像或视频。Cosmos 3 在这个分类里被英伟达放在 Video World Model 这一层,但它是一个 Omni-model,理论上三类任务都能做。 - 世界模型成了非常火热的创业风口。国内冒出大量新公司,有些今年刚成立就冲到10亿美元估值,截止到4月初,有人整理出来的世界模型公司名单已经有49家。 5/ Gen-1 和 π0.7 发布,不被 “VLA” 标签框定 - Physical Intelligence 的 π0.7 在一个传统 VLA 的基础上接了一个轻量世界模型,这个轻量的世界模型可以提供对未来任务图像的预测,用这个预测来影响生成模型生成相应的动作,用这个反馈去调整动作生成,类似于人扔纸团前会先脑补一下轨迹。 - Generalist 的 GEN-1 自己采集了50万小时的真实世界交互数据,不依赖预训练的 VLA 和视频生成模型,独立训练了一个端到端 transformer。这显示了对自家技术路线的极高自信,也展示了 Scaling Law 在具身数据上有效——从1万小时到50万小时,泛化能力持续提升。
顯示更多
看到两个新闻来聊聊Parlay⬇️ 一个是最近 @Polymarket 开始支持Parlay(Combos/串关)。 另一个是昨天尼克斯队阵马刺的比赛中,Kalshi的做市商SIG录得体育市场上最大的亏损(作为参考,taker的总盈利是 $22.4M)。 而 @Kalshi 在今年早些时候就支持了Combos。今年前四个月里,Kalshi总共有8亿美金的Combos成交量,用户的损失在15%(由SIG和Kalshi一起米西😋) ❓为什么做Parlay的做市商不是一件容易的事情? 1️⃣ Parlay的定价需要考虑的是各个事件的联合概率。而联合概率只有在事件独立的情况下才可以由各自概率推导出来P=P1 * P2 *... 所以从做市商的角度出发,如果直接按照独立事件定价,会给出过于乐观的价格。举个极端的例子,“尼克斯赢球”和“尼克斯 -5” 两个事件是包含关系,其实只有“尼克斯赢球”是有效的。 2️⃣ Parlay不像传统衍生品一样可以简单的对冲。这是因为可能结果的组合空间随着事件数量增多而爆炸。做市商需要lock的保证金也会是天文数字(当然SIG肯定和Kalshi有py协议) 3️⃣ 要对抗toxic flow。Kalshi的RFQ只藏在了APP端,并且简单的抓包是拿不到rfq的接口。文档中的combos endpoint跟Polymarket的API一样💩 但是还是有高手taker在今年3/24一天赚到 $750k ⚠️所以核心是在考验做市商的Risk Engine。如果你在做permisionless的parlay rfq,我觉得终极解决方案是通过一个类似 World Model 的东西来做 (@ylecun (不是 不然总会有这样那样的correlation被toxic taker给吃掉,特别当你是一家startup的时候(iykyk我在点名谁😼) 💡最近也有一些startup出来做这个问题,比如YC 26 Spring的 @totalistrading 。 创始人 @ericliu 提到过可以通过组合优化不同Parlay之间的事件进行对冲,从而达到类似Portfolio Margin的效果。 早期Pricing可以通过直接在independent prob上加一个discount;rfq也可以通过非常conservative的rule来ban掉包含同类型市场的组合。 特别是当Parlay扩展到其他非sportsbook的事件时,可能做insurance的玩家会更有优势 @UseCorgi @earthianai
顯示更多
《AI时代,投资者必须全栈》 ai investor has to be Full-Stack Investor 过去的投资世界,讲究“分工”: 有人做宏观,有人做行业,有人做基本面,有人做量化。 但进入 AI 时代之后,这种分工化的投资方式正在迅速失效。 今天,一个真正能理解、看懂并抓住 AI 时代财富机会的投资者,必须是 全栈型投资者(Full-Stack Investor)。 就像技术行业曾经出现“全栈工程师”一样,未来的投资世界也将被“全栈投资者”主导—— 既懂宏观,也懂技术;既能判断行业,也能写工具;既能分析,也能自动化。 这是时代的要求,也会是下一代投资者最核心的竞争力。 一、为什么 AI 时代投资者必须全栈? 1. AI 是一个端到端的超级产业链,任何一个环节都可能反转你的判断 AI 涉及的链条长到前所未有: 算法(Transformer、MoE、World Model) GPU(NVDA / AMD) HBM(SK hynix / Samsung / Micron) 先进封装(TSMC CoWoS / SoIc) 光互联(Broadcom / Coherent / Intel SiPh) 数据中心(VRT、NET、DDOG) 能源(BE、CWEN、XIFR) 云与 AI 平台(GOOG、MSFT、META、OpenAI) AI 应用层(PLTR、SaaS 全部重构) 任何一个瓶颈、任何一个突破,都会改变整个板块的涨跌逻辑。 如果你不了解光互联,你看不懂 GPU 可扩展瓶颈。 如果你不了解 HBM,你判断不了 AMD/NVDA 的代差。 如果你不了解能耗和冷却,你不知道数据中心为什么比 GPU 更紧缺。 如果你不了解算法,你根本无法判断“算力需求是否会继续指数级增长”。 AI 投资不是单点知识,而是端到端系统理解。 2. 信息量爆炸,纯靠人力无法覆盖 AI 相关的信息密度,已经远超传统行业: 供应链新闻 算法论文和技术突破 Big Tech CapEx 更新 监管和出口管制 数据中心扩张与电力审批 GPU 交付时序 行业会议与内部技术路线 X/Twitter 讨论流 各类模型 benchmark 和产品更新 每天 1000+ 条信息可能只是行业平均水平的投资者。 不用工具自动化,就永远落后于别人。 全栈投资者最大的优势,就是能自己构建信息“摄取与过滤系统”。 3. 技术周期太快,不懂技术就无法提前布局 AI 的技术迭代速度大概是: 每 3~4 个月一次重要突破 每 6~9 个月一次产品更新 每 12~18 个月一次算法范式变化(MoE、SSM、World Model) 每 24 个月一次硬件架构代差(H100 → B200 → Rubin) 如果你不了解技术周期,你根本无法预测: 哪家公司未来一年会爆发 哪条供应链会卡住 哪个环节会成为新赢家 谁会在 2 年后被替代 技术理解能力,是 AI 投资者未来的基本素养。 二、为什么“开发能力”也是未来投资者的必修课? 真正的全栈投资者,不只是会分析,还必须会“开发自己的工具”。 因为: 1. 投资者的核心能力之一是“快速验证观点” 你想验证: 最近 48h 哪些 AI 项目最热? 某事件(财报/政策)对哪些股票影响最大? 算力增速 vs 数据中心供电缺口的关系? 模型参数增速 vs HBM 需求增长? 只要你会vibe coding,你就能在马上得到答案,而不是靠别人的两周后的分析。 2. 未来的投资者本身就是“产品经理” 投资者必须设计: 事件监控 数据库 自动摘要 自动分类 情绪分析 回测脚本 。。。。。。 这就是一个“投研产品”的完整系统。 会开发的人,能自己造最适合自己的系统;不会的人,只能用别人的系统,未必最适合自己 三、结语:AI 时代不会让投资更容易,但可能是碳基生物为数不多的选择之一 AI 并不会让投资变简单。 AI 会加速信息流动、压缩套利时间、加速竞争。 在这种环境下: 不会开发、不会自动化、不会跨学科推理的投资者,将被淘汰。 懂技术、懂产业、懂开发、懂金融的“全栈投资者”,会成为下一代的超级个体。 更不用说,当ai开始大量替代人力的时候,投资,可能是唯数不多的,你可以选择不被替代的工作。 真正的 AI 投资时代刚刚开始。 只有全栈型投资者,才能吃到全周期的红利。
顯示更多
0
41
551
175
轉發到社區