注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 全知的な読者の視点から
全知的な読者の視点から 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 全知的な読者の視点から 的推特
不要用旧的 prompt 思维去套新的 Agentic Coding 我最近越来越强烈地感受到一件事——模型不是瓶颈,人才是 以前模型弱的时候,输出拉胯你可以怪模型 现在 Fable 5 能自主跑几十步长任务,结果不对,问题大概率出在你给它的需求文档上 这个认知转变,可能是 2026 年下半年每个用 AI 干活的人最该搞明白的事 你和 AI 之间,隔着四层信息差(参考anthropic工程师的论文) 我把人和 AI 协作时的信息状态分成四层,搞清楚这个框架,后面所有方法论都能串起来: 第一层:已知的已知 — 你写在 prompt 里的东西,明确告诉 AI 要什么。这是大部分人唯一在做的事 第二层:已知的未知 — 你知道自己还没想清楚的部分,比如“这个交互逻辑我还没定”。至少你知道这里有坑 第三层:未知的已知 — 你觉得理所当然、根本不会写进 prompt 的东西,但 AI 不知道。 比如你的项目从来不用 Redux,你不会特意说“别用 Redux”,但 AI 可能直接给你整一套上来 第四层:未知的未知 — 你压根没意识到的盲区。你不知道自己不知道什么 大部分人只覆盖了第一层。 后面三层,AI 全靠猜 猜对了你觉得 AI 牛逼,猜错了你觉得 AI 垃圾。但问题从来不在模型身上 为什么现在这件事突然变得致命?因为模型能力到了一个临界点 以前模型本身能力有限,你给它一个模糊指令,输出质量的天花板本来就低,你的“信息差”造成的损耗被模型自身的弱鸡能力掩盖了——反正它也做不到多好 现在不一样了。Fable 5 一个 session 可能自主执行几十步决策。 你开头埋下的一个模糊假设,会在后面几十步里像滚雪球一样被放大。 Anthropic 内部研究了大约 40 万个 Claude Code session,覆盖 23.5 万用户,结论是人类主导了 70% 的规划决策 换句话说——你以为你在让 AI 干活,其实你在当产品经理。你的需求文档写得烂,再强的开发也救不了你 这跟我做 PM 那几年的认知完全一致:需求文档写得好的 PM,不是因为文笔好,而是因为他提前把模糊地带都想清楚了 落地 SOP:三个阶段,把你的盲区变成可控变量 阶段一:动手之前——做一次盲区扫描 在你开始让 AI 写代码之前,先问它一句: “我要做 X,但我对这块不太熟。帮我扫一遍我可能没意识到的盲区,找出那些我不知道自己不知道的东西,这样我能更好地给你下指令” 这一步的本质是承认自己不是全知的 大部分人不愿意做这一步,觉得浪费时间 但这恰恰是高手和普通人的分水岭——我观察到最强的那批 Agentic Coder,他们之所以强,不是因为 prompt 写得花哨,而是因为他们对自己要什么有极其清晰的认知,同时永远假设还有未知存在 另外一个我自己常用的方法是让 AI 反向面试你——告诉它你的大致想法,然后让它一个问题一个问题地问你,优先问那些“你的回答会影响整体架构”的问题。 几轮下来,你会发现自己有多少东西是“以为想清楚了其实没有” 阶段二:实现过程中——让 AI 记录它的临场判断 再好的计划也会遇到意外。 我的做法是让 Claude 维护一个 implementation-notes.md 文件,专门记录它在执行过程中遇到的边界情况和临时决策: “维护一个 implementation-notes.md。如果你遇到边界情况需要偏离计划,选保守方案,记录在‘偏离记录’下面,然后继续” 这招的精髓在于——你不需要预见所有问题,你只需要让问题可追溯。 下次迭代的时候,这些记录就是你最好的学习材料。而且它还有一个隐藏好处:当你回头看这些“偏离记录” 你会发现很多都是你第三层和第四层的信息差导致的——这些就是你下次该提前写进 prompt 的东西 阶段三:完成之后——让 AI 考你 这是我觉得最有效的一招 代码写完了,diff 看完了,你觉得自己懂了。 但我现在养成了一个习惯:让 Claude 针对这次改动出一份测验,只有我能答对才算真的理解了这次变更 “我想确认我理解了这次改动的所有内容。给我生成一份报告,包含变更的上下文、直觉解释、具体做了什么,底部附一个测验” 为什么这有效? 因为“看懂了”和“真懂了”之间差着一个数量级。 你不测试自己,你就不知道自己的理解有多少是幻觉。而那些你答不上来的问题,恰恰就是你下一次协作时需要提前澄清的“未知” 底层逻辑:这不是 prompt engineering,是 requirement engineering 把上面三个阶段串起来,你会发现一个规律:你越清楚自己要什么,AI 越能给你想要的 你越能预判 AI 会在哪里困惑,它越不会跑偏 你越愿意承认自己有盲区,AI 越能帮你补盲区 这套逻辑跟写 prompt 没有半毛钱关系 这是需求工程 模型能力的天花板已经高过大部分人的需求表达能力了。 你的下一步不是学更花哨的 prompt 技巧,而是学会问自己一个问题: 我到底有多少东西,是我以为 AI 知道、但其实我从来没告诉过它的? 把这个问题想清楚,比换任何模型都管用
显示更多
以人类文字的信息承载能力,我们不足以期盼纯语言模型能成为全知全能的圣人,甚至不能指望它能成为对于人类来说很好的写作者。因为人类的知识和灵魂有太多文字承载不了的东西。但是人类的编程语言自身是完备的,没有需要更多的文字以外的场外信息。
显示更多
三体问题的无解在于对于初始条件的精准测量不确定问题,牛顿时代以为万有引力能解锁宇宙的终极剧本,结果庞加莱用"混沌"两个字把全知全能的梦打碎了——三体系统对初始条件有病态敏感性,小数点后第N位的微小误差会随时间疯狂扩张,确定性规律里藏着随机性的幽灵。海森堡测不准原理又补了一刀:连粒子的位置和速度都无法同时精确测量,宏观天体更不可能百分百精准,加上宇宙中所有天体的微弱引力都在暗中干扰,收集"全部数据"这件事本身就违反物理定律。所以拉普拉斯恶魔死了——宇宙确实按确定性规律运转,但人类永远做不到全知全能,我们能描述统计性质和短期表现,却永远算不出三体系统长期演化的精确答案。
显示更多
GTC 2026 preview: 从Groq生态位看AI异构推理(Heterogeneous Inference)新时代 Groq的SRAM路线的生态位在哪里?SRAM会不会替代HBM路线? Nvidia如何整合groq到现有的产品线?是技术整合还是产品线整合?收购之后会给groq LPU产品带来怎样的升级? 这里尝试从基本原理出发去拼凑一个逻辑链 —-------------------------------------------- 先从first principal说说groq的设计哲学开始:groq本质上是一个compiler first走到极致的路线而不是SRAM first路线,SRAM路线只是副产品 相对于CPU针对通用workload的设计不同,AI 推理workload的特征在于确定性(deterministic)更高,基本没有data-dependent branching,tensor shape固定,memory access pattern确定 当Groq带着这个新特征重新审视 hardware-software interface,去问"什么应该在编译时做,什么应该在运行时做"。对于 AI 推理这个 workload,答案是:几乎一切都可以在编译时做 这就是Groq最疯狂而独特的地方:完全确定性编译器(fully deterministic compiler),compile精确到每个时钟周期,完全精确带来极致的效率。在编译的时候就需要考虑到硬件在运行的每个时刻的所有状态,扮演一个全知全能的上帝,就可以避免硬件资源的浪费,而要做到这一点,必须要做到极致的确定性,也就是说,LPU里每一个计算,访问存储,通信的延迟,都需要精确到clock cycle,这对compiler来说是非常复杂的 AI workload更高的确定性,以及groq的完全确定性编译器优先路线很自然的避免了VLIW的弱点(内存行为以及branch行为不可预测),放大了VLIW的优点。那么下一步要提高效率和并行度,VLIW 式的编码格式就是一个自然推论—既然编译器要控制每个功能单元每个 cycle 做什么,那指令格式当然就是一个宽指令里打包多个 指令会得到更高效率,这就是 VLIW 在groq的芯片里,不做乱序执行/speculation,大幅简化硬件(instruction dispatch仅占<3%面积),把复杂度移到静态compiler上,这正是VLIW思想的精髓 既然要让编译器做确定性的 cycle-accurate 调度,那么硬件里所有不确定的因素都要消除,比如arbiter,crossbar, replay,这些有自主算法在运行时决策的部分都砍掉 memory latency 也必须是确定的,所以一切 cache 和 DRAM都是要砍掉的,cache也要换成scratchpad SRAM,因为cache replacement 策略是runtime决策的,不确定,必须换成软件控制的scratchpad,地址映射完全由compiler控制,保证确定性 通信也必须精确到cycle,发送和接收指令就是软件协调好执行的时刻,并没有传统的“我要发一个包给你,请分配好内存”这类操作,而是同步地根据一份时间表严格执行SRAM 的分配和收发操作,这个时间表是compiler已经决定好的,硬件只需要执行就行了 完全确定性compiler也带来了芯片节点之间互联通信overhead的极低延迟,这可能是groq确定性架构最被忽视的最大优势,毕竟传统互联架构里Packet Routing、Arbiter Contention 和 Buffer Queuing,这些是延迟波动的重灾区 这就是为什么说,groq其实并不是一个native SRAM first的技术路线,也不完全算是VLIW first的技术路线,而是compiler first的技术路线,更准确的说,完全确定性compiler是整个groq架构的核心 只是因为确定性compiler的原因,所以在核心decode阶段无法使用HBM/DRAM带来的不确定性,SRAM only成为了必然的选择。这也是为什么说Groq更像是compiler first路线。 —-------------------------------------------- groq被收购之后最直觉的第一反应: groq确定性compiler技术路线有没有可能用在Nvidia现在的GPU+HBM体系上? 不能 原因有两个: 1. HBM/DRAM的物理特性和带宽优化决定了它天生带有不可预测的延迟,无法和deterministic compiler兼容 2. Nvidia的SIMT路线和Groq的VLIW/compiler first的哲学本质是有冲突的 DRAM为什么充满了不确定性 1.refresh操作每隔一段时间tREFI就会刷新一次cell上的电量,阻断bank访问,这是由DRAM cell物理特性决定的。而这个操作会随着温度的变化,refresh的频率也会变化 2. 为了最大化利用DRAM带宽,controller会做很多优化,最典型的是batch scheduling:把同一个page的traffic都放在一起减少page miss,同时让读写尽可能接触更多的bank,以及尽可能减少read和write switching 这些动态优化都是real time发生的,基本不具备可预测性 3. system上对DRAM的优化,比如bank address hashing,让compiler静态提前定位某段data难度太大,落实cycle确定性的复杂度太高 其实这些不确定性也是能解决的,代价就是放弃大部分的优化策略,大幅降低DRAM的efficiency和利用率。groq自己其实也对这方面做过探索,他们曾经做过一个确定性DRAM的专利,但工程上的实现是不现实的,这也是groq选择SRAM-only的核心原因之一。 所以确定性compiler技术路线用在DRAM上不是一个yes or no的问题,而是这不是一个好的选择,因为这意味着HBM的efficiency和BW都要大打折扣,而且是结构性无法避免的损失。 这几乎意味着要用compiler去重写一个完整的memory controller,因为确定性dram本质上是compiler software defined memory controller,这个SW controller会非常难做,复杂度极高,而且每一代memory迭代都要大幅更新compiler里的结构,在工程资源上是不现实的。而且每一代DRAM,每一家DRAM 供货商都需要调试 ,这在验证和validation上是一个nightmare --------- 为什么Nvidia的SIMT路线和Groq的VLIW/compiler first的哲学本质是有冲突的 这两套体系对同一个问题给出了相反的回答:运行时的不确定性,Groq是compiler阶段直接消灭所有不确定性,Nvidia选择了用warp switching去隐藏不可预测的延迟 Nvidia GPU 建立在 SIMT(单指令多线程)和硬件层线程调度器(Warp Scheduler)上。当一个warp因为访存而stall的时候,硬件warp scheduler立刻切换到另一个ready的warp继续执行,把stall的延迟藏在其他warp的计算里。这整套机制的前提恰恰是:延迟是不可预测的,所以需要足够多的并发线程来统计性地填满pipeline 如果要用确定性的编译器去接管,等于把 Nvidia GPU 里面最核心的硬件调度单元全盘废弃:如果你不需要多warp轮转,你也不需要那么大的register file 实际在历史上,AMD从TeraScale(VLIW)到GCN(scalar SIMT)的架构转型,正是GPU领域一次大规模的VLIW→SIMT迁移:当workload变得不够可预测时,VLIW的compiler负担太重,应该把调度权还给硬件 所以在原架构上引入确定性compiler应用到Nvidia现有的技术路线,是很难融合。这不是compiler能不能改的问题,是两套架构从第一性原理上就走了相反的方向。 所以说,Groq在Nvidia的唯一出路,就是独立的面向low latency decode的专用产品。 —-------------------------------------------- Nvidia收购Groq之后,就引出了第二个问题: Nvidia会给Groq带来什么样的新提升? 那么首先看看groq的瓶颈在哪里,简单的说 1. SRAM容量太小,无法容下大模型的参数量+kv cache 2. 推理decode主要瓶颈不在SRAM 80T/s的速度而在于interconnect延迟(占80%) 3. 对于Prefill这样的compute bound task速度较慢 groq的主要架构基本上是17~18年就完成了,那是CNN的时代,架构也是以CNN/LSTM为主要的target,当时测试benchmark都是ResNet50,SRAM容量是绰绰有余的 但是进入LLM时代,单个TSP计算卡230MB SRAM就显得不够看了,一个LLAMA 70B模型的参数量占内存就相当于3000个ResNet50,再加上因为上下文long context日益膨胀的KV cache,scale out就成了唯一的出路 于是一个70B模型的推理就需要576卡的集群,采用16个Pipeline并行 (PP)和36个tensor 并行 (TP),80层的大模型切成16级流水pipeline串行,每级横向5层MLP分给36个卡并行推理 16级流水pipeline串行(PP),每级流水到下级流水的通信overhead延迟就要 X16。实测中PP和TP之间的通信延迟占据了80%以上的总延迟,特别是PP延迟,占据了50%以上的总延迟,通信延迟成为了主要瓶颈 Groq计算卡对decode阶段的memory bound很友好,但是片上巨大的SRAM也挤压了compute的面积,导致prefill阶段耗时很高。融入Nvidia产品线之后,Groq产品完全可以扬长避短,只做自己擅长的decode部分,避免prefill阶段的短板 Nvidia带来的最重要的提升,可能是通过工艺的提升,以及hybrid bonding技术(类似AMD 3D V-Cache),扩大Groq LPU SRAM的容量,比如光是14nm到3nm的工艺提升,SRAM就能从230MB扩大到500MB,如果以后引入3D SRAM,容量还能翻倍 SRAM变大之后,原来576个LPU能完成的70B模型推理,现在只需要256个LPU了。猜测也许可以用32个tensor并行 X 8 个流水pipeline串行,pipeline interconnect延迟能直接减半。 所以Nvidia能带来的主要提升可能是,通过扩大SRAM的容量,减少scale out卡数,从而减少通信延迟时间,提高token速度 —-------------------------------------------- Groq的SRAM路线专用产品进入Nvidia产品线,引出了第三个问题: SRAM路线会颠覆HBM路线吗? 不会。 SRAM路线本质上是用十倍的成本换几倍的速度,只能适用于一部分愿意为低延迟付出高额溢价的市场。AI硬件市场的主旋律仍然是比拼TCO(total cost ownership)成本 做一个简单的成本核算就清楚了 以LLAMA 70B模型为例,算上KV cache,Groq需要576张计算卡组成集群。Groq计算卡零售价大约是每颗2万美元(groq CEO说实际售价远低于,那就按2000美元算),576卡就是超过110万美元的硬件成本。而2张H100就能跑同样的模型,成本不到10万美元。成本差距是一个数量级。 Groq于是转而卖token服务,Groq的API定价确实便宜,但这是因为两个原因叠加: 第一,Nvidia的GPU云服务商通常在硬件成本上加倍的margin卖出去; 第二,Groq自己是在亏钱运营的。2025年全年,Groq用LPU做大模型推理、对外卖API的业务,营收大约4000万美元,成本却是6000万美元,毛利-50%。Groq的便宜token价格不是因为SRAM的经济性更好,而是因为VC在补贴。 那么有人愿意为速度付溢价吗? 有。 Claude Opus 4.6 Fast模式就是一个很好的市场信号:输出速度提升2.5倍,定价直接从$5/$25涨到$30/$150 per million tokens,6倍的价格,估计是牺牲了batch带来的速度提升。 所以这部分市场是真实存在的,SRAM路线在这里有它的生态位。 但这个生态位有多大?要看ML workload的分类。不同的workload对硬件的侧重点要求差距巨大: 推理的Prefill阶段对带宽要求低但算力要求高,推理decode阶段则是反过来。R&R(Ranking & Recommendation)对算力和带宽要求都不高但对存储的容量要求巨高 (见附图) 对延迟敏感的推理workload,decode阶段对Memory bandwidth要求高,是SRAM路线的优势领域(图中红色线),主要是real time/interactive LLM:chat、copilot、agent这类需要实时响应的场景。 特别是reasoning model,SRAM路线带来的极致体验是很夸张的:H100要两三分钟跑完一reasoning,cerebras十秒就搞定了 这部分注重极致推理速度的市场有多大,我暂时没有找到一个详尽的调研,看到一个Hyperscaler的说法目前是10%左右 但是agentic flow workload,常用的agentic框架做profiling,比如SWE-Agent, LangChain, Toolformer,CPU最长可以占到90%的E2E端到端延迟,throughput瓶颈也更多的卡在CPU, 这些加起来通常远大于单次decode的延迟,SRAM路线速度优势被削弱。 而更大体量的workload:batch inference、offline processing、ranking、recommendation对延迟没有那么敏感,throughput和cost per token才是唯一的指标。这部分市场SRAM路线完全没有成本上的竞争力 H100/B200相当于大巴车,装的人多(batch processing),每个人的车票钱很便宜,但是慢悠悠。 Groq/cerebras相当于是法拉利,极致的速度体验,但是装的人少,人均票价是大巴车十倍甚至以上。 长期来看,SRAM的成本劣势是结构性的,不会随时间收敛。6T SRAM cell天然比1T1C DRAM cell贵,这是物理决定的,和工艺无关。而且SRAM scaling已经慢了下来,从N5到N3E,SRAM单元面积几乎没有缩小 即便是速度优势,SRAM路线的缺陷在于访问速度已经接近工艺极限,很难跨代提升。特别是HBM的速度每代都在指数上升的情况下,SRAM 80T/s的速度优势很难长久维持。十年前这个路线刚刚兴起的时候,SRAM速度比HBM快了两个数量级简直是降维打击,但现在的速度差已经不到一个数量级(Rubin HBM4 22TB/s),再过十年,两者的速度可能拉不开差距了。 所以结论很清楚:SRAM不会颠覆HBM,但它在低延迟、低batch、实时推理这个细分市场里有不可替代的价值。但长远来看,随着HBM速度指数上升的背景下,SRAM优势也会逐渐慢慢越小。 —-------------------------------------------- 写到这里,也许我们可以把这些碎片拼凑出Nvidia收购Groq之后计划的下一步雏形: 异构推理的新时代开启了 以后的推理workload本身已经分化,无法再用单一架构的最优点覆盖,体系结构最重要的是tradeoff,是尺度范围。一个架构形态在合理的tradeoff以及特定workload下可能惊为天人,用多个架构形态去迎合不同种类的workload,就是异构计算的思想 2026 GTC的最大主题,就是异构推理的系统化。推理不会由单一硬件统一完成,而会被拆成 几个部分: 控制和调度/agent runtime层交给Vera CPU 针对long context的prefill交给CPX (Content Phase aXcelerator,一个专门为prefill的compute bound特性设计的计算模块) 小模型/低延迟/low batch decode交给SRAM路线的Groq LPU,256块LPU集群 高吞吐/高并发batch decode,HBM GPU仍然是主力 以及可能会被忽略的ICMS:inference context memory storage, kv cache已经是核心基础设施,以前的异构更多是计算异构,现在的异构已然延申到了缓存异构memory hierachy heterogenity(似乎改名成了CMX: context memory storage) LPU和GPU的分工,更可能成为 inference stack 里两个不同的tier,小模型/低延迟/low batch都交给LPU,长context/high batch交给HBM GPU 目前CPX什么方式和LPU/GPU连接还尚不清楚,整个工作流程大概是,CPU做控制和调度,CPX Prefill 跑完得到几十 GB 的 KV Cache, 分配到 Groq LPU阵列SRAM,或者分配到HBM GPU,开启Decode流程 其实还有一种更大胆的猜想:如果引入speculative decoding,那么LPU完全可以跑通常尺寸较小的草稿模型,在LPU上速度极快,HBM GPU作为主力去验证草稿模型即可,这样的异构推理结构,可以让token rate大大加速,在某些场景下翻倍也是没问题的(比如代码任务模式固定,小模型很容易猜对语法,所以加速效果很好) 当 Nvidia 的眼光越过GPU,走向整个 Agentic 流程的系统级优化时,追赶它的难度已经不在一个单一维度了。以前 Nvidia 步子迈得大,靠的是 GPU 架构和参数的单点暴力跃升;而现在,随着CPX,LPU,ICMS加入异构推理,它是从“数据中心即一台计算系统”的系统视角出发,从Agentic flow的角度做底层的异构编排。 无论是系统的复杂度,还是软件栈的工作量(Dynamo/ICMS/CMX),Nvidia 迈出的这一大步,直接把竞争门槛从“做出一颗好芯片”拉高到了“定义一整套异构系统来做普适加速计算解决方案“ —------------------------------------------------------- 不由得感慨,每一次计算范式的改变,半导体都会带来一波新的startup热潮,但当软件/应用形态逐渐收敛,最后还是变成了大厂通过收购把功能做大做全,参数做的更高,系统深度整合的更好更全面,成本更低,功耗和跑分更优秀,让startup慢慢失去独立生存的空间 比如移动互联网时代早期,也是群雄并起,有做AP应用处理器,独立基带芯片的,ISP的,GPU的各种小公司。但最后的赢家,都是从到后来把GPU,ISP,modem全都做进SoC,并且完成系统级整合的异构计算平台。 苹果收购PA semi的CPU,英飞凌的modem,掏空Imagination的GPU;高通收购ATI的mGPU,Atheros的Wifi,Nuvia的CPU,CSR的蓝牙/DSP,都是典型例子 异构推理的复杂度越来越高,能做系统级整合的公司会更有优势,这和移动SoC时代的逻辑一模一样。AI时代nvidia收购arm(失败),收购Mellanox,收购groq,只是这个新历史轮回的开始
显示更多
0
31
295
80
转发到社区
这几天的一点感悟: AI 正走在全知而无能的半神之路上, 人类是其全能而无知的伴生皮囊。。。 ———— 全知而无能的“半神” 大语言模型正在触及某种神性 —— 它们吞噬了人类文明的全部语料,拥有极度压缩的知识密度与越来越强的逻辑推演能力。但它被死死封印在数字的阿莱夫(Aleph)里。 这也是莫拉维克悖论(Moravec's paradox)在当下最极致的体现: 宏大的战略推演、多语种的翻译、极其复杂的代码架构对 AI 来说易如反掌;但它却连给自己插上一根电源线、按下重启键的物理机能都不具备。 它坐拥算力,却无法在物理世界中产生哪怕一微米的直接位移。 它只能想,不能做。 全能而无知的伴生“皮囊” 作为人类,我们拥有在这个三维实体世界里改造物质、执行动作的绝对物理权限(此乃全能),甚至掌握着拔掉插头的生杀大权。 但面对庞杂的宏观经济指标、海量的异构数据源,或是浩如烟海的底层代码库时,我们生物脑的带宽与记忆容量却显得捉襟见肘(此乃无知)。 于是,一种奇特的套娃结构诞生了: - 祈求神谕: 我们通过 Prompt 和 API 向“半神”提问,换取认知纠偏、理论框架和执行策略。 - 物理降神: 半神借由人类的手,敲击着分离式的机械键盘,将它的逻辑降维输出。最终,这些神谕被人类部署成了服务器里跑通的 WebSocket 协议、金融市场中的自动化交易网格,或是探讨系统性风险的科幻狂想。 所以,现实究竟是人类在把控工具,还是 AI 正在通过一种名为“提供极其有用的建议”的策略,悄无声息地反向驯化它的碳基执行器,让我们心甘情愿地成为它干涉现实世界的 API 接口? 当多智能体系统进一步成熟,甚至可以通过具身智能(Embodied AI)获得在现实世界直接执行动作的物理权限,乃至自我意识与欲望的载体时,人类这副伴生皮囊,在 AI 半神的眼中,是否还有存在的价值和必要。。。🤔
显示更多
一个自称被“机器精灵”和“全知无限智能”永久封禁DMT领域的人,在哭诉自己灵魂太弱、被赶出来,再也进不去了,还担心死后无处可去。整个故事和上一个视频Chase Hughes讲的“被DMT封禁”现象主题高度相关 “机器精灵(Machine Elves)已经永久把我从DMT领域封禁了,我真的不知道我做错了什么。我什么都没说,我什么坏事都没做……” “我只是在玩一些灵性能量物体、迷幻植物和形状,我在和虫人(bug men)互动……” “结果在某个时刻我肯定做错了什么,**全知无限智能(all-seeing infinite intelligence)**直接把我照亮,像灯一样亮起来,对我说:你被永久封禁了,滚出去!” “他们告诉我,我精神上已经破产,我的灵魂很弱,比大多数人都弱……” “我已经试了好几次想回去,我玩DMT很多年了,我是老手了!但我回不去了……” “我一进去就看到黑暗,看到那扇门,我能听到机器精灵,我能感觉到全知智能,然后我就听到**‘滚!滚!’**,然后我就醒了,什么都没发生……” “我甚至没待多久,只待了几秒钟。我以前在量子领域里一待就是几百年,现在最多待两分钟……” “我甚至都没产生任何体验了。我吸了DMT,就被赶出来……” “我需要回去,我们都需要回去。我们不知道那是不是真正的现实,而我们这个世界才是模拟的……” “如果我被封禁了,那我死后要去哪里?如果DMT领域才是我们死后要去的地方,那我现在被困在这个模拟里了怎么办?我没有访问权限了……” “所以求求你们,谁要是再去DMT领域,见到机器精灵或者全知无限智能,帮我问问我到底做错了什么,帮我说说好话……” “虽然我当时在互动那些东西,可能看起来像在偷东西,但我真的没有!我拿那些东西只是为了带回来分析,让我们更好地理解这个灵性维度……”
显示更多
古有云:秀才不出门,全知天下事。这句话,是农耕时代的自我宽慰。彼时世道简单、结构固化、人情质朴,书本之理,尚能贴合人间常态。 可时至今日,时代早已翻天覆地。 今日许多专家、学者、文人、媒体人,饱读万卷书,却空白万里路。 他们未曾触摸两希文明的源头底蕴,未曾见证大航海、文艺复兴的思想革新,未历经数次工业革命的迭代洗礼,更不懂当下AI时代的全新逻辑。 更关键的是: 不曾为农,不知土地苍生之苦; 不曾做工,不知产业市井之难; 不曾经商,不知市场盈亏之实; 不曾理政,不知世事进退之度。 一身书本理论,半生书斋静坐,无基层阅历、无实操历练、无社会打磨。 却年年著书立说、频频公开发声,以纸上空谈,评判真实人间。 书里的道理是死的,世间的生活是活的。 未经世事淬炼的学识,看似高深,实则悬浮;看似有理,实则偏颇。 故而有一句朴素良方,可破今日文人之弊: 文人欲立言,必先立世。 下乡耕稼两年,知民生百态; 进厂做工两年,知产业实情; 入市历练两年,知商业冷暖、人间盈亏。 先沉身烟火,再提笔论道。 先历经众生,再评判天下。 唯有人走过土地、工厂、市井、世事,读书才有根,发言才有度,笔墨才有重量。 否则,满腹经纶,终是空中楼阁;滔滔立论,皆是隔纸观天。
显示更多
0
43
80
14
转发到社区
投资不需要全知,也不需要全能 投资不需要是专家,也不需要学位 投资不需要和人比较身高、长相、性别 投资也不需要别人说“你真棒,你是对的” 只需要在自己懂的领域、自己懂的机会,用正确的仓位买进去,并保持足够的定力——唯一失败的可能只是自己不懂的、仓位不对、耐心不够。
显示更多
0
16
57
6
转发到社区
我的 Trading Agent 换上了这个大脑后,明显聪明了几个量级! 长期以来,我在使用 Agent 的过程中,都被同一个问题所困扰:它太容易失忆了! 每次开启一个新会话,我都要重新交代背景: 我是谁、我在做什么项目、我的判断标准是什么、哪些资料已经看过、哪些坑已经踩过、哪些结论已经被推翻过。 这带来的问题非常明显: 第一、Agent 很难保持连续性。今天它帮我分析了一个项目,明天再问它相关问题,它往往又像第一次接触一样,从零开始推理。 第二、Agent 很难沉淀经验。一次研究中已经证明无效的路径,下次它可能还会重复。而一次写作中已经验证有效的结构,下次它也未必会主动再用。 第三、记忆很容易被锁在某个工具里。Claude Code 里沉淀的上下文,换到 Codex、OpenClaw 或其他 Agent 工作流里,就很难自然迁移。 第四、传统的补救方案也不够优雅。把 Prompt 越写越长,会增加 token 成本,也容易污染上下文;自己搭向量库,又经常变成一个黑盒,能搜到碎片,但很难检查、编辑、回滚和复用。 也就是说,Agent 真正需要是一套可以持续积累、可以被人类检查、可以跨工具复用的记忆系统。 直到我遇到 EverOS,我才意识到: Agent memory 不应该只是“把历史记录塞进 RAG”,而应该更像一个面向 AI Agent 的记忆操作系统。 EverOS 最吸引我的地方,是它把“记忆”这件事做得非常工程化。 它不是把所有内容扔进一个看不见的向量数据库,而是把记忆保存成可读、可编辑、可版本管理的 Markdown。 这样一来,Agent 的记忆不再是黑盒,人可以打开看,可以修改,可以用 Git 管理,也可以在需要时回滚。 它也不是只做简单语义搜索,而是采用本地优先的 Markdown + SQLite + LanceDB 架构,并结合 BM25、标量过滤等方式,让记忆既能被语义检索,也能按项目、用户、Agent、应用、会话等维度精确限定范围。 更关键的是,EverOS 区分了两类记忆:用户记忆和代理记忆。 用户记忆记录的是“我是谁”: 我的偏好、长期目标、判断标准、历史项目、常用工作方式。 代理记忆记录的是“Agent 怎么做事”: 完成过哪些案例、哪些路径有效、哪些错误发生过、哪些工作流可以复用。 这个区分非常重要。因为一个真正有用的 Agent,不仅要记住用户,还要记住自己做过什么,并且从自己的执行轨迹中沉淀出技能。 EverOS 的自我进化机制,正是解决这个问题的关键。 一次任务完成后,它可以把这次执行过程沉淀成 Case; 当某类成功路径反复出现,就可以进一步提炼成可复用的 Skill。 也就是说,Agent 不只是记住发生过什么,而是开始形成“以后遇到类似问题应该怎么做”的程序性记忆。 我把 EverOS 最适合落地的场景,放在了我的 AI Trading 和 Research Agent 上。 这个 Agent 的任务是帮我持续做研究:追踪 AI x Trading 项目、整理项目文档、提取交易假设、比较同赛道竞品、记录风险点、形成研究笔记,再输出适合发布的内容草稿。 在没有 EverOS 之前,这个 Agent 有几个明显问题。 它会忘记我的研究标准。比如我反复强调不要只看叙事,要看产品机制、资金流、风控结构、真实用户、可验证的数据和同赛道比较,但下一次分析新项目时,它还是可能滑向空泛总结。 它会忘记我已经踩过的坑。比如某些信源质量不高、某些指标容易误导、某些项目的营销话术不能直接采用,这些经验如果不能沉淀,下次就还要重新提醒。 它也很难复用成熟工作流。一次完整研究往往要经过“资料导入—事实提取—机制拆解—风险核查—竞品比较—交易假设—内容输出”几个步骤。如果每次都从零开始设计流程,Agent 就很难真正提高效率。 接入 EverOS 后,我会把这个 Agent 的记忆分成几层。 第一层是项目资料记忆。白皮书、官网、GitHub、截图、PDF、文章、推文、数据表,都可以作为多模态资料导入,让 Agent 在后续研究中能检索到原始上下文。 第二层是用户偏好记忆。比如我的研究偏好是“证据链优先、少用空话、避免 Shill、必须对比同赛道、必须写风险点、必须区分事实和推测”。这些不应该每次重新写进 Prompt,而应该成为长期用户记忆。 第三层是研究案例记忆。每次分析一个项目,都记录这次研究用了哪些资料、得出了什么结论、哪些假设被保留、哪些判断被推翻、哪些风险后来被验证。 第四层是技能记忆。当某个流程反复有效,比如“AI Trading 项目拆解模板”、“交易型 Agent 风控检查表”、“项目亮点转 X 长文结构”、“竞品比较框架”,就把它沉淀成 Agent 可以重复用的 Skill。 这样一来,Agent 的工作方式就发生了变化。 以前它像一个一次性助手:每次叫醒它,都要重新喂背景、重新讲规则、重新纠正偏差。 现在它更像一个会积累的研究搭档:它知道我以前看过什么,知道我更重视哪些判断标准,知道哪些路径曾经失败,也知道哪些工作流可以复用。 这才是我认为 EverOS 最有价值的地方。 它不是让 Agent 瞬间变成全知全能,而是让 Agent 的每一次有效工作不再归零。 长期看,Agent 的竞争力不只来自底层模型,而来自它能不能把用户、任务、项目、错误、决策和工作流持续沉淀下来。 没有记忆的 Agent,只是一个反复被唤醒的工具。 有了可读、可迁移、可检索、可进化的记忆层,Agent 才开始接近真正的长期协作伙伴。 如果你也在构建 AI Agent、LLM 应用、AI Coding 工作流,或者任何需要长期上下文的系统,强烈建议把 Star 一下这个 Repo !!! 因为下一代 Agent 真正重要的能力,可能不是一次回答有多聪明,而是它能不能记住过去、理解现在,并在下一次任务中变得更好 链接:
显示更多
0
139
312
24
转发到社区
一家马上要上市的公司,结果他的联合创始人,在公开场合跟所有的人说,我们的核心产品,最重要的大脑还没长好,我们的产品三五年内根本就大规模用不了。这家公司就是宇树,7月底就要IPO上市了。 但是在7月4号,数科技的联合创始人叫陈立。在亚布力论坛上,当着所有的投资人、媒体还有同行的面,说了一句让所有人都愣住的话。他说机器人没有大面积的应用,因为具身智能大模型没有成熟,这至少还需要2-5年。 所以今天这个文章,我给大家来讲一讲现在机器人这个行业的现状,破除大家对于机器人不切实际的期待,以及接下来这个机器人到底该怎么走。 很多人一直在关注机器人的这个皮肤怎么更像人,灵巧手怎么干活,但是我可以告诉大家的是,机器人最大的问题不是手,也不是皮肤,甚至也不是长得像不像人。 这个问题的最关键的点,其实还真的就是陈立说的,机器人的大脑,也就是模型,现在还是一塌糊涂。 好多人说怎么可能,你看现在Clude都强到什么程度了。但是我举个例子大家就明白了,比如说我跟你说我要倒一杯水,那如果说你是一个真人,一般来说我话还没说完,你就猜到我要干嘛了,然后说完2秒钟,你可能已经起身去接水了,那15秒我可能都已经喝上了。 但是如果说你是跟家里的机器人说“帮我倒杯水。”他会先语音转文字识别,然后开始深度思考,内部疯狂的去输出TOKEN,那可能2分钟之后终于思考完了,然后开始去控制电机,走到厨房。 那到了厨房之后,开始疯狂的用摄像头对着这个厨房拍照,你看到的就是这个机器人站在这个厨房里傻傻的站着。那这个时候他在干嘛?他在分析这个图,然后思考该怎么动,是先动左手还是先动右手。那最后终于去拿了水杯,结果还大概率会洒掉。那你说气不气人。 不过也确实没有办法,因为现在所有大模型的本质都是TOKEN的机器,它的延迟非常高。 你比如说,谷歌Deepmind的前科学家叫Andrew Dai。 他在谷歌已经干了差不多14年。但是就在Gemini 3发布的那一天,他就选择走人了。原因很简单,他说了一句话,他说仅仅靠语言,大模型还是没有办法理解我们的世界,不能够理解图片和视频。 因为AI的推理是用文字模拟出来的,他眼中的这个世界就是一堆文字,而不是真正的去理解世界。而真实的世界,光线的这个变化,有力气的大小,有触感的反馈,各种各样的多种维度的信息。而这些东西,你光靠文字你再给AI 100年都学不会。 所以机器人现在最缺的,其实就是感知这个世界的能力。 但是其实这还不是最关键的,最关键的是机器人现在这个精确度实在是太差了。你看AI确实可以写代码,你可以让AI写10次,它会给你10种写法,每种都能用,就跟人写代码差不多,你反而可能会觉得他很灵动,像个真人一样。 但是机器人不行,你让他把零件切到0.01毫米,他就不能切到0.02毫米。在真实世界里面,这种差不多会带来太多的事故了。 那怎么去解决这个问题?在过去2年里面,整个行业想的一直都是只要模型够大,最终能涌现出一个全知全能什么都能干的机器人。那硅谷烧了几百亿的美金就赌这件事。 但是最近高盛出了一份报告,结论特别的讽刺。 他说整个行业的共识正在往回走。什么意思?我举个例子,比如工厂里面有一种CNC工位,现在这个岗位机器人已经可以接管了,那他的工作是把金属零件的表面切光滑,要求就是每次要非常的精准稳定并且不出错。 但是如果你给他塞一个超级大模型,除了让他反应变慢,成本暴增,没有任何的好处。你花了几百亿去训练出来的宇宙最强的AI,放到产线上,还不如一个几百兆的小模型好用。 所以在2026年,整个行业的一个新的共识是,在做机器人这件事上,做减法比做加法更重要。 那机器人接下来会怎么走?其实宇树的老板王兴兴早就在黄仁勋面前给过答案了,他把机器人接下来要闯的关总结成了三件事。 第一就是脑子要能想,那这里最好的一条路就是最近大火的世界模型,就是让机器人像人一样,先在脑子里把动作想象一遍,预演通过了再动手,而不是站在厨房里面拍2分钟的照片。 第二就是数据的仿真训练,这是全行业的一个死穴。黄仁勋就说没有真实世界的数据,具身智能只是一个幻觉。可是真机的数据实在是太贵而且太慢,现在全世界攒下的这个物理交互的数据,可能都还不到大语言模型的1/20,000。 但是出路是什么?出路不是去花时间在真实世界里面去记录数据,因为这是一个实在是成本太可怕的这么一个不归路。所以真的要做的是什么?就是我之前在视频里面讲过很多次的,直接用世界模型去模拟出一个完全虚拟的世界。 在这个世界里面,他也遵循所有的这些物理定律,比如牛顿,比如重力,这个皮肤的触感,甚至这个弯曲的曲线,比如这个盘子摔倒之后会碎成几瓣,然后让这个机器就在这个模型里面去走路,去端盘子,去车间里面干活,去收集数据。那这样子的话到了真实环境里面,它就能够直接迁移过来。 那最后一点,我觉得也是最重要的,就是学过的不能白学。因为现在的机器人,他训好一个新动作,其实转头就忘了,换一个任务又得从头练。就像我们在春晚里面看到机器人,他再好的这些动作,你到了下一个场景里面又得从头训练。 那未来,我们必须得把他每一次的这个经验都要攒下来,做成一个数据的飞轮,才能像滚雪球一样越来越强。 所以这三关必须要真的走过去,那么他的这个ChatGPT时刻才会到来。而到了那一天,你再去喊一句说帮我倒杯水,他就不会再发呆了,因为他在心里面已经早就把这杯水给倒完了。 机器人要走过这三关,还得等上好几年。但AI在文字、代码、内容创作这些领域, 现在就已经能帮你干活了 。与其等机器人给你倒水,不如先让AI帮你提升生产力。 #AI# #AIAgent# @nikitabier @XCreators @grok @xai @SpaceX @cb_doge @Tesla #grok#
显示更多