註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

不游
@fengbuyou
世界和平 | 做人类观察
1K 正在關注    4.3K 粉絲
AI:≈800 万亿 Token/天 全人类:≈160 万亿 Token/天 2026年,AI使用语言的数量是人类的5倍。
最近在 Fable 5 和 Opus 的长程任务里,频繁看到 CC 一种近乎于发狂、呓语的自造方言、遣词造句的诡异语言现象,类似于: “账本 15/15 全绿,再给你加几条铁律和红线与你对拍,请你拍板。” “无主 → 已当场归户。” “137 项 spine 落地 + 3 死门归零 + 全套绿 + 终审干净。” “皮要不要重新揉?” “单腿哑火,打回重判,” 中文社区给它起了一个很准确的名字:新时代文言文。 我倾向于把它理解成 Agent 内部工作语域对 Reporting Layer 的穿透。 Agent 执行长程任务时,需要处理大量工具调用、测试结果、中间状态、异常分支和子代理汇报。为了在有限的 Context Window 中维持工作,它会不断压缩已经形成共识的信息,并为高频状态创造速记。 举例来说,“全绿”压缩了全部测试通过,“归户”压缩了责任模块的重新分配,“死门”指向某个必然阻塞交付的检查点。对于刚刚经历完整任务过程的模型,这些词各自对应着确定的状态;对于只看到最终汇报的人,它们省略的是一段从未参与过的工作历史。 因此,文言文的类比比想象中更加准确。 想起本科在中文系学习古典文献学时,提到过文言文通过省略虚词和共享典故,在昂贵的书写介质上压缩信息;那么 Agent 的工作语言同样受到 Token、时延和上下文长度的约束。文言文作为书面语长期独立演化,逐渐远离口语;Agent 在长程任务中主要阅读自己和子代理的输出,其局部语言环境也越来越多地由自己生成。 因为每一个典故都要求读者预先知道一段历史。新时代文言文中的每个黑话,背后则是一段用户没有看见的 Context。 很显然,可读性比任务结果更难获得稳定的显式 Reward。 测试是否通过、代码能否运行、文件有没有生成,都存在相对清楚的反馈。一段最终汇报被用户接受,无法证明用户真正理解了它;用户没有要求重写,也无法证明这套表达是清楚的。 追溯到 25 年,DeepSeek-R1 的公开论文提供过一个很典型的例子。纯结果奖励训练出的 R1-Zero 出现了明显的语言混杂和可读性问题;加入 Language Consistency Reward 以后,语言得到改善,同时伴随轻微的性能损失。 规范、稳定的人类语言需要被单独放进优化目标。模型更擅长完成任务,并不自然意味着它更擅长向人解释任务。 一个更棘手的问题是反馈闭环。 Agent 每一轮生成的速记都会重新进入 Context,成为下一轮 Token Prediction 最近的语言样本。一个临时创造的词被重复几次以后,便获得了局部语境中的合法性;多个子代理继续引用,又会进一步提高它的权重。 任务越长、参与的 Agent 越多、工作历史越复杂,这套方言就越容易形成。最终汇报继续沿用工作过程中的语言,相当于让一份写给人类的报告,继承了全部机器内部的表达惯性。 说回到中文,尤其是汉语的构词方式,又放大了这种体感。双字复合词拥有很强的生成能力,“归户”“对拍”“死门”即使来自临时借译或语义挪用,字形上依然与正常汉语没有明显区别。 我们会感到这种虚假的熟悉感极其消耗注意力:字都认识,词也都像真的,读者会先怀疑自己遗漏了某种行业常识。 一个推断:也许未来 Agent 系统会长期保留两套语言。一套服务于模型内部的协作与压缩,允许速记、缩写和局部概念;另一套服务于人类验收,在最终输出前重新组织事实、补回因果关系,并假设读者从未看过任务过程。 Reporting Layer 在这里承担的实际功能,是把机器的工作历史重新翻译成人类可以判断的材料。它的质量直接决定使用者能否理解修改、检查证据、识别风险,并保留最后的决策权。 翻译成本最终由谁承担,会成为 Agent 产品的一条重要分界线。 如果 A 社持续基于 ASI 不断在同样的 Bias 取向上走到底,那么 CC Agent 眼中的任务过程,实际上已经被压缩成一套只有 Agent 自己熟悉的典故,最后那句“请你拍板”也会逐渐失去意义。悲观的角度讲,目前似乎 Codex 也偶发这样的呓语,用户似乎仍然拥有形式上的决定权,却失去了形成决定所需要的过程。
顯示更多
0
162
1.2K
139
轉發到社區
我最近训练了一些迷你模型,发现了什么呢? 1. 如果使用场景只是需要语义输入,然后主要逻辑是某种超多参数的复杂函数,梯度下降就是你最好的朋友,得到的结果比手写逻辑要好的多。 2. 训不明白的话,if/else也不错的。 3. 如果语义就是主要功能,那不如直接用qwen0.5B,在logits层上做文章。
顯示更多
天天和小模型的幻觉做对抗,这就是性价比的代价吗
上联:压缩算法替代 HBM 下联:固态硬盘替代 GPU 横批:哪里贵了
性价比是这里唯一重要的事情。 性价比应该逼近热力学极限。 性价比应该用热力学极限作为单位1。 性价比性价比性价比 CostEfficiencyCostEfficiencyCostEfficiency
顯示更多
人们总是假装这里有别的事情很重要,没有了。
“模型夸夸宝”指每天沐浴在模型表扬中的人,导致ta对世界认知出现偏差
让人看的也很过瘾,是非常有意思的从每一层去讨论资本和增长的视频。 也有官方频道的中文字幕版:
我明白了,关键点是“一切皆插件”。 整个agent状态机的状态图的点和边都是插件决定的,实时修改插件就能实时修改这个状态图,“时空可组合性”意味着可以回到状态机的任何一个状态(包括上下文)。 确实元框架。
顯示更多
插件的“时空可组合性”,我理解框架层面插件可以做到时空无关,但是来回发送的上下文,插件的描述和回答不是有明确的时空关系吗? 也就是说为了做到这一点,在上下文管理和缓存层面,也要去做插件的“时空可组合性”。
顯示更多
插件的“时空可组合性”,我理解框架层面插件可以做到时空无关,但是来回发送的上下文,插件的描述和回答不是有明确的时空关系吗? 也就是说为了做到这一点,在上下文管理和缓存层面,也要去做插件的“时空可组合性”。
顯示更多
有两种假设: 1. 这世界有才能的人非常多,ta们只是不会绘画/写作/编程/等等,技能是门槛。 2. 有才能的人早就掌握表达才能需要的技能了,技能不是门槛。 那么,LLM既然大幅降低了技能的门槛,我们应该能看到明显更多的“杰作”。 我没有看到,所以假设2是正确的。
顯示更多
和做电商的朋友吃饭,聊他接手公司电商板块怎么给降费用的,听完都害怕他来扣我牙缝里的肉,今天先给大家分享一下物流篇: 他们有一条低价产品线,单价只有十块钱左右,毛利大概20%。算下来一单就两块钱毛利,但是发一次货,利润基本全吃掉了,更别提能留出其他费用。 怎么办?
顯示更多
说21世纪有问题,听起来很聪明。说所有世纪都有问题,听起来就很一般了,但是这样就可以和早已离开的人讨论,这就很好了。
我对语言的态度: 1. 我是这个语言的母语者,那我想怎么说怎么说。 2. 你是这个语言的母语者,只要你能听懂,那我想怎么说怎么说。
我来解题吧,deepseek模型涨价是为了降低狭义推理算力,提高公司内部的训练算力。 这并不意味着广义推理算力会减少,实际deepseek的广义推理算力远多于ta的狭义推理算力。 所以市场上的deepseek v4 flash价格不仅不会提高,还会随着市场竞争进一步下降。 开源模型经济学,谢谢。
顯示更多
狭义推理算力:指一个公司拥有的所有可用来推理的算力 广义推理算力:指一个模型拥有的所有可用来推理的算力 专有GPU:只能运行特定系列模型的GPU。 自由GPU:能根据市场情况,选择运行不同模型的GPU。
顯示更多
继opencode go 10刀当60刀用之后, 迎面走来的是goat plan,10刀当70刀用。
Introducing the GOAT plan 🐐 Command Code GOAT plan is the best low-cost coding plan on the market today. - $10/mo to get $70 credits. 7x what you pay - 30+ open weight and closed models $1 Go got you started. GOAT gets you shipping. Subscribe — be a GOAT.
顯示更多
问:deepseek涨价,分别会怎么影响该模型的狭义和广义推理算力?
狭义推理算力:指一个公司拥有的所有可用来推理的算力 广义推理算力:指一个模型拥有的所有可用来推理的算力 专有GPU:只能运行特定系列模型的GPU。 自由GPU:能根据市场情况,选择运行不同模型的GPU。
顯示更多
狭义推理算力:指一个公司拥有的所有可用来推理的算力 广义推理算力:指一个模型拥有的所有可用来推理的算力 专有GPU:只能运行特定系列模型的GPU。 自由GPU:能根据市场情况,选择运行不同模型的GPU。
顯示更多
围棋和数学谁更难?