这样做的话,
下周关于 Jev 综述论文就出来了,直接看综述吧🧐
Jev 最近火起来以后,我看到一个挺有意思的问题,它到底是一种新范式,还是把大模型隐藏的一部分能力单独拿出来了?
Arcturus Labs 最近写了一篇很有意思的分析。
Jev 最核心的特点,是不让模型生成一大段解释,而是直接输出结构化判断和概率。
模型路由、工具选择、安全判断,这些高频决策其实都可以转成分类问题。
作者有个判断我挺认同。大模型其实早就在做类似的事情。
Tool Calling 其实就是模型在判断下一步该调用什么、什么时候调用,以及怎么执行。
如果未来这种能力直接融合进模型内部,Agent 可能会多一个更强的决策层。它可以实时判断要不要切更大的模型、是否继续推理、哪些步骤值得执行,减少很多无效成本。
当然,Jev 最大的问题也很现实。
如果它的优势主要来自训练方法、合成数据和校准能力,这些可能会形成护城河。反过来,如果只是把大模型已有能力重新产品化,大厂也可能很快跟进。
我觉得这也是 Jev 现在最值得讨论的地方。
很多新方向的竞争,最后拼的可能并不是谁先发现这个能力,而是谁能把它做成稳定、低成本、可规模化的基础设施。
文章
顯示更多
好吧,Gemini 4 Pro 要来了,Kimi K3.1 也马上来了。
今天的信息量已经够大了。
我也洗洗睡了。😂
这个「鹈鹕骑单车」我是真的看傻了。
我现在只能说一句,Claude Opus 5.5 唯一真神。其他家先洗洗睡吧 😂
Opus 5.5 直接把一个看起来很抽象的 Prompt 做成了完整的实时 3D 小游戏。骑车动作、布料、海浪、昼夜循环、镜头切换,甚至抓鱼和各种交互都给你补齐了。网站本身还有多镜头、自动驾驶和实时合成音乐。
这种东西已经不太像写个前端 Demo了,更像模型自己把设计、动画、物理、交互和工程全串起来做了一遍。
我录了段实际运行视频,大家自己感受一下这个离谱程度。
大家也可以去这个网站试玩:
顯示更多
Agent 自我进化也会过拟合。
Harness 在同一批任务上反复修改,Benchmark 分数可能一路上涨;换到新任务后,刚学到的能力却很快失效。
Google Cloud AI Research 等团队这篇 RRSI,专门给 Harness Evolution 加了一套「正则化」。
它主要从两端限制自我改进:
Proposer 负责提出修改。前期允许一次尝试更多变化,后期逐渐收紧每轮能改的组件数量;同时参考历史进化轨迹,鼓励探索还没试过的方向,减少反复走同一条路。
Selector 决定哪些修改能留下。其中有两个关键角色:
Critic 会过滤明显针对 Benchmark 写死的技巧,避免 Harness 靠记题刷分;
Pruner 会删掉收益太小、token 成本太高,或者后续已经没有价值的改动,防止 Harness 越进化越臃肿。
所以它最终想保留的,是能跨任务复用的机制。
结果在普通 Harness Evolution 在训练任务上分数更高,但 OOD 平均只有 40.3;RRSI 达到 43.6,同时推理 token 还减少了约 30%。
有一个直接的感受是自我进化做到后面,难的是决定什么值得继承。
换了环境还能留下来的改动,才更有价值。
📎 arxiv:
顯示更多
Opus 5.5 这次真有点把我整不会了。
前两个月 Opus 5 写代码还经常让我血压上来,话多、乱扩 scope,小改动也能给你整成大工程,并且说黑话难懂。
结果今天拿 5.5 跑了半天,体感直接变了,现在是更听话、更克制,长任务也稳了很多,也能输出人话了😂。
看一些我比较在意的 benchmark 分数都涨了不少,虽然我现在不太 care 这个了。
我现在感觉开发主力都可以从 Fable 5.1 换到 Opus 5.5 了,Fable 5.1 还是太吃 token。
才两个月,这次模型的进步真是实打实的。
顯示更多
开放权重模型的竞争,已经不只是比谁 Benchmark 更高了。
Nathan Lambert 最新这篇文章,把能力、价格、下载量、真实调用和学术采用放到了一起看。
一个很明显的变化是,中国开放权重模型已经形成了自己的生态。
按他的统计,中国模型在 Hugging Face 的累计下载量约 32 亿,是美国的两倍;OpenRouter 上开放模型每周使用量已经从一年前约 1T Token 涨到 80T,其中中国模型占比超过 80%。
学术圈也很明显。Qwen 现在出现在约 30% 的 AI 论文里,中国开放权重模型整体已经超过 40%。
更关键的是,Lambert 估计最强的中国开放权重模型距离美国闭源前沿只差大约 2–5 个月。这当然是他的估计,但已经足够说明变化有多快。
所以我现在更在意的不是「开放模型能不能追上闭源」。
而是谁的模型会成为别人做研究、搭 Agent、做产品时默认踩着的那一层。
一旦形成这种习惯,影响的就是整个开发生态。
文章:
顯示更多
这个「鹈鹕骑单车」我是真的看傻了。
我现在只能说一句,Claude Opus 5.5 唯一真神。其他家先洗洗睡吧 😂
Opus 5.5 直接把一个看起来很抽象的 Prompt 做成了完整的实时 3D 小游戏。骑车动作、布料、海浪、昼夜循环、镜头切换,甚至抓鱼和各种交互都给你补齐了。网站本身还有多镜头、自动驾驶和实时合成音乐。
这种东西已经不太像写个前端 Demo了,更像模型自己把设计、动画、物理、交互和工程全串起来做了一遍。
我录了段实际运行视频,大家自己感受一下这个离谱程度。
大家也可以去这个网站试玩:
顯示更多
AI 自我进化还在探索,围绕它的数据和训练服务,已经开始落地了。
最近看了一些做 RSI 的团队,发现它们选择的切入口很具体:训练数据、供 AI 练习的环境,以及判断表现好坏的评估服务。
我觉得这条路挺务实。想让 AI 持续进步,总得先把练习和反馈的条件搭好。
不过,这也让我更好奇,「帮助 AI 进步」到「AI 更会改进自己」,中间还有多远?
模型成绩提高了,可能是教材更好、老师更强,也可能是多跑了几轮实验。要看清自我改进的作用,还需要把这些贡献分开。
比如,花同样的钱,始终用最初那套系统,和让升级后的系统继续探索,最后会差多少?
数据和训练服务的价值已经很具体。我更期待接下来的实验能告诉我们:上一轮积累的能力,是否真的让 AI 更擅长找到下一次改进的方法。
顯示更多
其他的不说, GPT-6 SOL 和 Claude Opus 5.5 用起来速度好快呀,也很省token呀。
OpenAI 已经开始提前给「AI 自己参与造下一代 AI」制定规则了。
最新这篇文章直接把 RSI 摆上台面。
OpenAI 提议建立跨国家的共同标准,去衡量 AI 到底参与了多少自动化研究、什么时候必须让人介入,以及出现异常行为后该怎么分级和报告。
其中有个点我挺在意的。
他们反复强调,决定 AI 怎么发展的人不能只剩几家 Frontier Lab,外部机构、研究者、政府以及开放模型社区都应该能看到一套共同的衡量标准。与此同时,这些标准也不应该变成模型发布许可证,或者顺手把新公司和开放权重模型挡在门外。
我感觉 AI 治理正在进入一个新阶段。
以前讨论的是「一个模型发布前安不安全」,以后可能要面对的是:
当 AI 已经开始参与设计下一代 AI,我们到底用什么标准判断这条自我加速的链条还在人类控制之内?
这个问题会越来越现实。
文章:
顯示更多
好的,诚意满满😋,是我疏忽了
One more thing: we’re increasing five-hour usage limits on Pro, Max, and Team plans. We’re also providing subscription users a rate limit reset, which you can save and use whenever you choose.
怎么中美模型都赶着中秋和国庆节之前放大招呀?
本来 Claude Opus 我都打算弃用了,是在太难用了,Opus 5.5 看着诚意满满,明天起来试试看咋样🧐
这不得 reset 庆祝一下?
顯示更多
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.
It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
Codex 又要进行重置啦。
我天天只用 Astra 去 review 代码,用量都顶不住😐,啥时候把用量提一提呀。
Ladies and gentlemen... start... your... ENGINES. We are almost Tuesday and I promised a reset for Tuesday. Among some other things. See you soon.
现在新模型出得这么快,每个人都应该有一套自己的 AI Benchmark。
Every 这家公司最近就在给每个员工做这件事。
方法其实很简单:把你平时最常交给 AI 的几个真实任务留下来,再把每次「这里不对」「这个我会改掉」慢慢变成可检查的规则。
久而久之,你就有了一套只属于自己的 Eval。
很有意思的是,他们内部测试里,GPT-5.6 Luna 在某些人的真实工作上,甚至比更强的模型表现更好。
我觉得这件事以后会很重要。
Benchmark 不应该只回答「哪个模型最强」,还应该回答「哪个模型最适合替我做这件事」。
甚至再往前一步,你每天修改 AI 的那些地方,其实都在暴露自己的判断标准。
如果能把这些判断慢慢沉淀成 Eval,AI 才真的开始学会「什么叫对你来说做得好」。
文章:
顯示更多
Jev 这两天刚火起来,TypeSafe CEO 紧接着又抛出了一个更有意思的问题:如果让 Jev 这种模型直接参与 Coding Agent 的「大脑调度」,会发生什么?
这份文档里,他们想动的其实是 Coding Agent 最底层的 Context 和 State。
现在很多 Agent 底层还是 while loop + Tools,再把越来越长的上下文一路往后传。Routing、Compaction、Subagent 很多麻烦,都卡在「下一步到底该带什么 Context」。
TypeSafe 想做得更细一点。
每一步都动态判断哪些 Context 值得保留、该调用哪个 Tool、该切哪个模型、要不要开 Subagent,甚至 AGENTS.md 都可以按任务加载。
这时候 Jev 这种又快又便宜的 typed decision model 就很有意思了。
它不一定负责写代码,反而可以负责 Agent 周围大量高频的小决策。
这样看起来,下一代 Coding Agent 拼的可能不只是主模型有多强,而是谁能把 Context、Routing 和 State 这套「神经系统」管得更细。
这条路值得我们持续地关注。
顯示更多
sharing some notes on typesafe 🤝 coding agents:
we likely will never have time (ever again) to play ourselves, but hope the that the community goes WILD (and makes me look like a naive idiot)
顯示更多
很推荐 Thorsten Ball 这篇关于「软件开发未来」的判断。
里面不少观点都很激进,我也不一定全部认同,但确实把 AI Coding 再往前推几年之后可能发生的变化想得很彻底。
英文内容比较多,我按原意压缩成中文:
• Code Review 会消失,单元测试也可能消失。人不会再逐行检查模型生成的代码,而是更多去 Review 整个系统。
• 「写代码」这门手艺会慢慢弱化,但「做软件」会更重要。真正值钱的是知道该解决什么问题、什么时候发布、怎么获得反馈。
• 大多数 Bug 可能会变成「你让 AI 做错了东西」,而不是代码本身写错了。
• Terminal、编辑器、CLI 这些工具也可能被 Agent 吞掉。人不需要再记命令和参数,只需要表达自己想做什么。
• PM、Design、Engineering 的传统分工会被重新打散。只负责传 Ticket、协调流程的人,价值可能会快速下降。
• 「好代码」的定义也会变。很多规范本来就是为了方便人类阅读和维护,如果未来大部分代码都由机器修改,这些标准未必还那么重要。
• Token 甚至可能成为新的生产力门槛。谁能调用更强的模型、拥有更多推理资源,谁的软件生产能力就可能更强。
• UI 也可能开始按需生成。很多菜单、设置页、Dashboard,本质上都是人在适应不会理解自然语言的软件。如果软件真的能理解意图,很多固定 UI 可能都不再需要。
我比较有感触的一点是:
软件开发的中心,可能会慢慢从「怎么把代码写出来」,转向「到底该让机器做什么,以及怎么判断它做对了」。
Code Review、单测、Terminal 会不会真的「死」,这些都可以争。
但如果 AI Coding 继续这样发展,很多今天看起来理所当然的软件工程习惯,可能都值得重新问一遍:
「为什么还需要它?」
顯示更多
很推荐 Thorsten Ball 这篇关于「软件开发未来」的判断。
里面不少观点都很激进,我也不一定全部认同,但确实把 AI Coding 再往前推几年之后可能发生的变化想得很彻底。
英文内容比较多,我按原意压缩成中文:
• Code Review 会消失,单元测试也可能消失。人不会再逐行检查模型生成的代码,而是更多去 Review 整个系统。
• 「写代码」这门手艺会慢慢弱化,但「做软件」会更重要。真正值钱的是知道该解决什么问题、什么时候发布、怎么获得反馈。
• 大多数 Bug 可能会变成「你让 AI 做错了东西」,而不是代码本身写错了。
• Terminal、编辑器、CLI 这些工具也可能被 Agent 吞掉。人不需要再记命令和参数,只需要表达自己想做什么。
• PM、Design、Engineering 的传统分工会被重新打散。只负责传 Ticket、协调流程的人,价值可能会快速下降。
• 「好代码」的定义也会变。很多规范本来就是为了方便人类阅读和维护,如果未来大部分代码都由机器修改,这些标准未必还那么重要。
• Token 甚至可能成为新的生产力门槛。谁能调用更强的模型、拥有更多推理资源,谁的软件生产能力就可能更强。
• UI 也可能开始按需生成。很多菜单、设置页、Dashboard,本质上都是人在适应不会理解自然语言的软件。如果软件真的能理解意图,很多固定 UI 可能都不再需要。
我比较有感触的一点是:
软件开发的中心,可能会慢慢从「怎么把代码写出来」,转向「到底该让机器做什么,以及怎么判断它做对了」。
Code Review、单测、Terminal 会不会真的「死」,这些都可以争。
但如果 AI Coding 继续这样发展,很多今天看起来理所当然的软件工程习惯,可能都值得重新问一遍:
「为什么还需要它?」
顯示更多