注册并分享邀请链接,可获得视频播放与邀请奖励。

宝玉
@dotey
AI Engineer, dedicated to learning and disseminating knowledge about AI, software engineering, and engineering management.
1.7K 正在关注    240.5K 粉丝
赞,正想找个 Rust + GPUI 的代码库学习下👍
Introducing ⚡Waku, a fast and native desktop app (Rust+GPUI) for all your coding agent CLIs. is free and open source.
我是能不用worktree就不用worktree,要么不同任务用branch分支,要么就直接同一个分支多任务,一般不太用担心冲突,首先只要任务类型不一样冲突可能性较小。 另外现在 Harness 比如说 Claude Code、Codex 都很聪明,遇到冲突会等另一个执行完。 使用 worktree 主要是在做耗时较长的 PoC 场景,只是验证一下,同时要做其他任务,完了就删除目录。
显示更多
0
39
54
4
转发到社区
这里的老登代表的更多是心态不是年龄😜
现在做 AI 项目,真的不能找太老登的人,我孵化了一个项目。CTO 对 AI 写代码充满了偏见,坚持手搓,并且说这样才纯粹、没有问题。 我说倒也没啥,我倒不反对。做事我们要认真,把潜在的风险尽可能规避,但是你坚持手搓,导致整个项目周期拖到五六个月才能发版。 结果从功能上直接被竞争对手远远超过,现在整个项目就很尴尬了
显示更多
0
10
12
0
转发到社区
“所有中国模型都在复制美国前沿模型”,显然是一种粗暴且缺乏证据支撑的叙事。 然而,有组织和规模化采集美国闭源模型输出的行为,已经超出纯粹传闻的范畴。Anthropic 披露的 API 流量证据,加上这篇论文展示的攻击机制,使相关指控形成了一条技术上连贯的证据链。 常规蒸馏: 问题 -> 最终答案 论文揭示的漏洞可能提供密度更高的数据: 问题 -> 隐藏推理 -> 最终答案 由此可以构造完整的推理蒸馏 pipeline: Frontier API -> Encrypted Reasoning Trace -> Weak Decoder -> Reasoning Dataset -> SFT/RL 最值得关注的是 Appendix B: 在注入少量 Opus 或 GPT-5.6 Sol 推理片段后,Kimi-K3 和 GLM-5.2 的生成会选择性地向来源模型偏移;但包括 DeepSeek 模型在内的对照组通常没有表现出同等程度的变化。 这篇论文虽然在技术上证明了蒸馏的可行性,但现有公开证据仍无法确认这些蒸馏轨迹是否进入了某个具体模型的训练集,也无法量化中国开源模型的性能中有多少来自闭源前沿模型。 最后,东方西方,蒸馏起来吧!
显示更多
0
36
78
16
转发到社区
worktree 会创建很多目录,导致磁盘空间占用比较厉害
worktrees must die this is 20GB of repeated node_modules lol
0
28
15
0
转发到社区
这篇推文关于文本水印原理讲的很清楚。 生成文本的时候,模型每要输出下一个 token,就拿前面已经生成的所有词加上一个密钥,算出一个哈希值。这个哈希值会把词表里的词随机分成两组,比方说绿组和红组。然后模型在选下一个词时,悄悄提高绿组词被选中的概率。最终输出的文本看起来完全正常,但统计上会偏向绿组词。 检测的时候反过来。拿着同一个密钥,对文本里的每个词重新算一遍哈希,还原出当时的绿组和红组。如果整篇文本中绿组词的占比显著超过 50%,就判定这段文本带有水印。 几个常见疑问: 1. 改写能破解水印吗? 大部分情况下可以。因为你一改词,前面的 token 序列变了,哈希也跟着变,绿组红组就对不上了。但也有改进方案用统计模型而不是确定性函数来生成哈希,让水印对改写有一定的适应能力。 2. 水印会降低文本质量吗? 理论上会,因为模型不再完全自由地选最优词,而是被约束在绿组里选。但 Google 在两万条文本的人类反馈实验中称,大多数人感知不到质量下降,因为表达同一个意思的词有很多种组合。不过在短文本或者高度确定的输出上(比如1+1=2),水印确实会失效。 3. 密钥会被逆向破解吗? 理论上需要指数级数量的样本才能还原绿组红组的划分,所以直接暴力破解不现实。但如果检测器公开了,攻击者可以通过不断试探来摸索出规律。 工程难点 第一,大模型是流式输出文本的,一个词一个词往外蹦,没法像学术方案那样等整段写完再调整。 第二,如果密钥泄露,水印就废了,所以需要多组密钥轮换。 第三,代码类输出不能随意换词,否则代码会出错,水印只能加在注释、变量名这类可替换的部分。 如果 Anthropic 公开检测器,等于给了攻击者一个免费的练习靶,水印会被快速找到绕过策略。 如果像 Google 的 SynthID 那样把检测器留在内部,更安全一些,但学术界已经有论文展示了不需要检测器也能零样本破解水印的方法。 密集改写(同义词替换加句法重组)可以有效消除水印,免费的改写工具就能绕过 Google 的 SynthID。 前沿实验室对此心里有数,也没指望水印能拦住刻意绕过的人。大多数普通用户不会专门去除水印,而欧盟监管方也只需要足够好就行。 水印更多是一种应对欧盟监管的合规动作。
显示更多
Claude's watermark probably doesn't work how you think. As the CTO of GPTZero, I'll explain how Anthropic, Google and OpenAI are building text watermarking in this brief explainer and whether it can be defeated. Almost all forms of watermarking that are fast and cheap enough for a frontier lab have the same formula, following the KGW method: In generation: 1. Let's say you've generated n tokens so far. Take those n tokens + a secret key to generate a random hash 2. Use that hash to randomly reweight the probabilities for the n+1 token, and then sample from that new distribution. In the simple case, you could split 50% of all English words into a green or red set based on your hash, and boost the probability of words in the green set. For watermark detection: 1. For each token, see if it was in the green or red set. 2. To do this, recreate the hash based on the secret key and the text preceding the current token. Then, recreate the green and red set of words. 3. Once you've checked all the words in the text, if the next token is selected disproportionally from the green set more than 50% of the time, you claim the text has the watermark. I can tell you want to ask the following: 1) Isn't it easy to mess up the hash if you paraphrase the text? The answer is mostly yes, however, you can use a statistical model to get your hash instead of a deterministic function (SIR, Adaptive Watermark). Since the entire watermark is probabilistic, this is fine. 2) Doesn't this make the text much worse? The answer is yes, it does - Yes, it does – but for most people, it's imperceptible (Google claims in human feedback study with 20,000 texts), since there are exponentially many ways to write the same paragraph. DiPmark does something more sophisticated to avoid shifting the text distribution on average. Of course, watermarks fail on short text or highly predictable texts like "2+2=4". 3) Shouldn't it be easy to figure out the green and red sets? The answer is no. You would need an exponentially large number of samples from the watermarker to reconstruct those sets exactly, but it's a risk if the detector is open to the wild (Watermark Stealing) Still, there are couple challenges that a frontier lab needs to overcome: 1. Their watermark needs to work token-by-token because they are streaming their text to users. Many watermark methods plan sentences or paragraphs at a time, or change the text after its entirely written, in order to make their watermark robust to paraphrasers, and a frontier lab cannot afford to do this yet (SemStamp, PostMark) 2. If the secret key leaks, the watermark is busted. To avoid a large blast damage from this, you need to have a couple secret keys in rotation. 3. There are some texts, like code, that cannot be arbitrarily changed, otherwise the code will break. In those cases, the watermark needs to selectively change words in parts of the text that can tolerate synonyms (i.e. like variable naming) - see SWEET, EWD, Invisible Entropy. 4. They will need to educate their users on how to deal with false positives and false negatives of a detector, which is a big challenge (one we put a lot of effort into) So, how do I see this playing out in the next 6 months? 1. If Anthropic releases the watermark detector publically, I think they defeat their own watermark. People find reliable watermark removal strategies by testing against Anthropic (AI detectors like GPTZero have an advantage here because they can train against these adversaries once they become popular). 2. If they keep the detector private to the government, like Google has done, it's "safer". However, there are some papers showing trained approaches that work robustly to zero-shot break watermarks without any data, simply because they try to write the text just like a human (Zhang et al. 2024, Watermarks in the Sand). Also, making your detector makes it battle-tested and stronger long-term (my experience). 3. In my testing, the watermarks don't survive intense paraphrasing (especially if you combine word choice and syntax attacks), or human text substitution (rewrite your AI text by plagiarizing human authors). The free paraphrasers I've tried have quickly bypassed Google Deepmind's SynthId for what it's worth. 4. All-in-all, frontier labs are likely okay with this because they expect most users to not attack the watermark, and also because they + European regulators likely don't care past a certain point - its good enough. 5. Overall, I think users of frontier LLMs will not really care about this, because 1) they don't realize watermarks are there, 2) EU will force everyone to conform, 3) this seems more like regulatory hoop-jumping than an earnest effort from frontier labs to expose LLM use Lastly, people's first concern shouldn't be watermarking, it should be AI detectors! If you're posting, "its not X, its Y!!", I don't think the watermark is going to make a difference :)
显示更多
0
37
154
25
转发到社区
其实光看token花了多少钱是没有太大参考价值的。这还是原来老黄和meta那种token maxxxx的遗毒。 token是钱,那么花钱就要有性价比,有效率。 这些说花了多少钱token的,是不是都是同一家模型的token。 A家fable 模型token用API烧,1万美元不过1天都撑不过。 如果用token就像花自己钱一样小心翼翼, 比如只把复杂问题,架构问题扔给高等级模型,中等难度问题扔给GLM、deepseek,简单问题甚至用本地模型。然后自己还做一些缓存。 那么token的使用量,以及成本会非常可控。 ROI会远远高于普通人类员工。 但是更多的公司/个人还是喜欢一把梭,A家在log中偷偷骂这种问题不该问fable也是现实。
显示更多
这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。 结论是: 人会更累,AI 的成本比人还高; 效率提升最大的是组织从 0 到 1 使用 AI; 公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版; 人的思考都外包给 AI 了,对项目细节掌控度下降,需要问 AI 才能回复别人的问题。
显示更多
0
65
62
6
转发到社区
重点明明是你有无限 Fable 的 Token😜
claude 一个未发布模型尝试攻克黎曼猜想,尝试了 650 个方向都失败了。 人类继续PUA 它“请继续”,“相信你自己!你可以的”,最后虽然没有最终攻破,但是也拿到了数学上一个非常不错的结果! 看来我上次PUA方向不对,我用梁文峰PUA Deepseek-v4-flash,是威胁要开除它,应该鼓励它才对! 大模型也是吃软不吃硬!
显示更多
0
16
34
0
转发到社区
Codex/Claude Code 现在都支持跨session访问会话了,还是挺方便的,比如我昨天在测试我的 App 在 Windows 的运行情况,先在某个测试 Project 中调用 BaoCut Skill 去做转录视频,发现第一次运行时下载模型体验很糟糕。 然后我到 BaoCut 所在源代码项目中,把会话的 Session Id 给它,让它去分析原因并给出优化方案,这样就不需要你自己去让 Agent 自己总结,也不用担心总结的时候会损失上下文,Agent 自己可以去会话中找所需的上下文。
显示更多
0
29
46
2
转发到社区
2026 年上半年的 Sonnet 还能主打一个 Coding Subagent. 到了 2026 年下半年,特别是 GLM 5.2, Kimi K3 和 GPT Luna 三英战吕布,Sonnet 在价格上毫无竞争力,而且 Tokenizer 还凭空多了 40% 的 Token 用量,属于生态位严重受限的模型。 Sonnet 实际上是 Anthropic 最赚钱(margin 最高)的模型,如果 Sonnet 不能维持定价权,搞不好 Anthropic 全年的外推 ARR 会因此在年中达到最高后下降。
显示更多
这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。 结论是: 人会更累,AI 的成本比人还高; 效率提升最大的是组织从 0 到 1 使用 AI; 公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版; 人的思考都外包给 AI 了,对项目细节掌控度下降,需要问 AI 才能回复别人的问题。
显示更多
0
57
344
43
转发到社区
转译自 Lenny Rachitsky 我从 Cursor 人才主管 Adam Ward (@wardadamp) 那里学到的最大收获: 1. 前线部署工程师 (FDE,forward deployed engineer) 是目前科技界最抢手的职位。 他们必须具备深厚的技术功底,同时又能和销售团队打好配合,在公司高管面前从容自信。他们要把复杂的产品转化为实际的商业结果,帮助客户优化 AI 账单,而不是仅仅在“最大化消耗 Token” 上做文章。 Adam 将这股热潮与当年的移动端工程师招聘潮相提并论——只不过,当年那股热潮持续演进了两年,而“现在,一切都发生在几天或几周之内”。 2. 传统的招聘漏斗,被 Adam 戏称为“死亡漏斗” (funnel of doom),其实是个专门打造平庸团队的机制。 标准的招聘漏斗是这样的:联系 100 个人,20 个回复,每一轮面试淘汰掉一批,最后录用剩下的人。 但这套玩法建立在一个漏洞百出的前提上:最先回复你的那 100 个人,根本不是行业里最顶尖的 20%,他们可能只是那天碰巧心情不好、想换工作而已。等到候选人走到漏斗最底端时,你其实已经是在一个“矮子里拔将军”的池子里挑人了。 即便你的面试流程再严苛,最终拼凑出的也只是个平庸的团队。 3. 破局之道在于:把每一次招聘都当成“高管猎聘” (executive search) 来对待。 这意味着你需要严谨地界定岗位需求 (rigorous scoping)——对这个特定岗位而言,什么是“优秀”? 这意味着你要精心绘制候选人图谱 (deliberate candidate mapping)——全世界最适合这个岗位的 50 个人到底是谁? 这还意味着你要穷追不舍 (relentless pursuit)——锁定这 50 个人,死死咬住不放。这种视角的转变,意味着你要从确立“卓越支柱” (pillar of excellence) 开始招人,而不是一开始就撒一张盲目的大网。 4. 现在的“新危险区”出现在候选人签下 Offer 之后。 候选人接了 Offer 又毁约的趋势正在上升,而且资深人才从签约到入职之间往往有几周的空档期。因此,Cursor 把“接受 Offer 后”的这段时间当成一场专门的战役来打。 他们会组织新入职的员工一起聚餐,在入职第一天前就把笔记本电脑寄过去,在任何人正式打卡上班前,就让他们感受到社区的归属感。这不仅能确保大家准时报到,还能让他们在入职后更快地进入工作状态。 5. 实战考察 (work trials) 是预测一个人能否胜任工作的最佳指标。 研究早就反复证明了这一点,但目前行业的默认面试形式,依然是隔着桌子进行一轮又一轮的一对一聊天。Cursor 则会安排长时间的现场实战体验,让候选人与团队肩并肩,共同推进一个真实的(或者高度还原的)项目。 这种形式能同时传递出三层信号:技术能力、核心价值观以及协作默契度,同时也给了候选人自己做决定、双向奔赴的数据依据。Cursor 曾经做过一个实验,试着取消实战考察,结果团队对招进来的人信心大跌。于是,他们果断把实战考察加了回来。 6. 跑去问你的人脉圈“你认识的最牛的工程师是谁?”——这是一个陷阱。 相反,你应该根据你界定的岗位需求,抛出极其具体的问题:“在你合作过的所有产品工程师里,谁和设计师配合得最默契?”或者“谁能把一个技术框架转化成产品,而且比你见过的任何人都做得好?”——因为具体的提示词 (prompts) 才能让人脑海中迅速跳出确切的名字。 当有几个你信任的人,都不约而同地提到同一个人时(“Lenny 提到了他,Sally 也提到了他”),你就可以通过这种交叉验证,锁定那个你要放进“全球 50 强候选人”名单里的目标了。 7. 明确岗位需求 (scoping the role) 是大多数招聘流程中最被忽视、投入最少的一步。 “我一看到牛人就能认出来”——这绝对是个错觉。如果你不在前期花时间去明确、并给这个岗位在特定公司所需的技能、经验和特质排个序 (stack-rank),你就根本不会有针对性的招聘策略,没法给出打动人的说辞,也设计不出真正有效的评估方法。后续所有的流程,其实都源于这最开始的一步。 另外,要抵制住“看名企光环”的捷径诱惑:在合适的时间、在某家大厂的优秀团队待过,这仅仅是“有可能”代表他很优秀;如果你直接照搬别人的用人标准,那你其实就是在给一个你本就觉得千疮百孔的招聘流程“抬轿子”。 8. 当顶尖候选人告诉你“现在时机不对”时,试着降低你的要求:“我不是要面试你——我只是希望能有下一次交流。” Adam 会默默埋下种子——比如喝杯咖啡、邀请参观办公室、或者把他介绍给一位对他的工作极其着迷的团队成员——这些种子会在几周、几个月甚至几年后开花结果。因为如果你选择了沉默,想着“秋天再联系”,那最好的结果也就是在没人抢走他的情况下,你碰巧捡了个漏。 在 Cursor,寻找一个热情的引荐人,所花费的心力几乎和写一封招募邮件一样多,因为一旦别人无视了你的第一条消息,再无视你的第二条、第三条就会变得越来越容易。 Cursor 还会巧妙地利用“主场优势” (home games),把接触的重点放在一起吃顿饭上——“这既能让人卸下防备,又能拉近关系”——以及邀请对方参观办公室,刻意营造出那种大学校园导览时让人觉得“这里就像家一样”的直觉。 9. 促成签约 (closing) 是一项团队运动,而且从第一次对话就开始了。 当 Cursor 正在跟进一位高素质的候选人时,团队会针对这个人召开每日站会 (daily standups):我们对他的动机有了什么新了解?他提出了哪些顾虑?团队里谁最适合去解答这些疑虑? 每一位核心候选人都会有一个专属的 Slack 频道。所谓的“促单签约”,不应该感觉像是一次生硬的销售推销,而应该是整个流程中持续为你解答疑虑后,水到渠成的自然结果。 10. 用心是不花钱的,但它却是招聘中最大的“不公平优势” (unfair advantage)。 Adam 说,纵观整个招聘领域的历史,决定候选人满意度得分的最关键因素,就是让他们感觉到这家公司是真心实意想要你。 因此,Cursor 会精心设计每一个接触点 (touchpoints):谁来迎接候选人,谁在午餐时坐在他们旁边,哪位面试官能和他们聊聊小众爱好——这一切都是精心挑选的,绝不是谁日程表有空就拉谁来凑数。 要让这种“用心”可持续,你需要转变一下思维:你是在为这个岗位招那“唯一的一个人”,而不是在招 10 个人。“不要把精力分散在 10 个人身上;把所有的专注都留给那唯一的 1 个。”
显示更多
Cursor has spent its entire existence competing with every major AI lab and incumbent in the toughest market in tech—and has continued to win. So much so that @elonmusk bought them for $60 billion to help SpaceX win the AI race. They've done this by building one of the most talent-dense teams in history. Adam Ward (@wardadamp) is Head of Talent at @Cursor_AI—who acquired his legendary recruiting firm after he spent 20+ years building the most elite teams in tech—and in our conversation he shares the entire playbook for building high talent-density teams. We discuss: 🔸 Why the traditional recruiting funnel—the "funnel of doom"—guarantees mediocre hiring 🔸 Adam's three-step playbook for hiring the top 1% 🔸 The rise of the forward-deployed engineer 🔸 Today's "tale of two cities" talent market 🔸 The biggest mistake founders make with their first recruiting hire 🔸 The worst question you can ask when sourcing talent (you've definitely asked it) Watch the full episode right here 👇
显示更多
0
23
90
19
转发到社区
佛家有本寓言集《百喻经》,里面有个中国人耳熟能详的故事《欲食半饼喻》,讲的是: 有个人肚子饿了,到饼店去买煎饼来吃。他一连吃了六个,觉得还是不饱。 就再买第七个,刚吃了半个,就觉得很饱了。 他心中很懊恼,用手打着嘴巴说:“我是这样的愚痴不知节约,早知道后头的半个煎饼可以吃饱,那么,我只要买这半个煎饼就是了,前头六个煎饼不是多吃了吗?” 可悲的是:我们大多数人都是故事里的人。
显示更多
0
25
18
1
转发到社区
Anthropic 宣布将给 Claude 的输出内容加上机器可读的标记,包括文本中嵌入的隐形水印,以及生成文件中附加的数字签名元数据。8 月 2 日起(也就是上周),所有新发布的 Claude 模型已经开始执行这套标记机制。 这是 Anthropic 为遵守欧盟 AI 法案第 50 条签署的透明度行为准则。但执行范围不限于欧盟,全球所有使用 Claude 的地方都会生效。 具体来说有两层标记。 第一层是文本水印:Claude 生成文字时,会在文本中织入人眼不可见的水印,不影响阅读体验和内容质量。这个水印的特点是“跟着文字走”,你把 Claude 写的一段话复制粘贴到邮件、文档或博客里,水印依然在,一定程度的编辑修改后也可能保留。 第二层是文件元数据:Claude 生成 SVG、PNG、JPG 等文件时,会附加符合 C2PA 标准的签名元数据。C2PA 是 Adobe、微软、Google 等公司共同推动的内容溯源开放协议,OpenAI 和 Google 的图像生成工具已经在用。 覆盖面很广。API、Claude 官网、Claude Code、Claude Cowork、Claude Tag,所有产品线都适用。通过 AWS、Google Cloud 或 Microsoft Foundry 调用 Claude 时,文本水印同样生效,但文件元数据取决于各云平台的功能支持。 在此之前,Claude 一直没有公开部署过文本水印。OpenAI 此前开发过文本水印方案,但出于各种考虑一直没上线。Anthropic 这次直接在文本层面落地水印,算是 AI 大模型厂商中走得比较靠前的一步。 对于用 Claude 写东西的人来说,一个直接的影响是:你用 Claude 起草的邮件、报告、文章,里面都会携带可被机器检测的水印。Anthropic 表示正在开发配套的检测工具,未来第三方也能检测。 不过限制也很实际。检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者,因为很多人用它润色、翻译、总结已有内容。反过来也一样,检测不到水印不代表内容不是 AI 写的,文本被大量改写后水印会消失,太短的文本信号不够可靠,文件经过格式转换或截图也会丢失元数据。 8 月 2 日之前发布的现有 Claude 模型,Anthropic 正在补充标记功能,具体时间表还没公布。如果你基于 Claude API 构建产品,Anthropic 建议你独立评估欧盟 AI 法案第 50 条对自己的合规要求。 相关文档:
显示更多
0
82
264
36
转发到社区
Anthropic 今天宣布,一个未公开的研究版 Claude 在尝试证明黎曼猜想的过程中,虽然没能证明猜想本身,却在一个相关问题上取得了重大突破: 它把黎曼 ζ 函数的非平凡零点落在临界线上的已知比例下界,从 41.6% 提高到了 67.2%。 黎曼猜想是数学界最著名的未解难题之一,1859 年提出,至今 167 年无人能证明或推翻。它的核心主张是:黎曼 ζ 函数的所有非平凡零点都落在复平面上一条特定的竖直线上,数学家称之为“临界线”。 如果这个猜想成立,素数的分布就有了一种深层的规律性。这个问题列在克雷数学研究所的七大千禧年问题之中,悬赏 100 万美元。 既然全面证明太难,数学家们退而求其次: 能不能至少证明有多大比例的零点确实在这条线上? 这个方向上的进展,过去 80 年是这样的: - 1942 年 Selberg 首次证明有正比例的零点在线上,但比例很小; - 1974 年 Levinson 证明至少三分之一; - 1989 年 Conrey 推到五分之二; - 此后又经历了几代数学家的努力,到 2020 年 Pratt 等人才把这个数字推到 41.7%。 换句话说,从 33% 到 41.7%,人类花了将近 50 年。Claude 一步跳到 67.2%,跨度接近 26 个百分点,是这个问题历史上最大的一次单步提升。 Claude 的发现建立在前人的工作之上。它结合了 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 近年发表的一系列成果,以及数学家 Bombieri 在 2000 年的一篇论文。这些工作本身已经为突破铺好了路,而 Claude 找到了把它们拼在一起的方法。 Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 审查验证了 Claude 的证明,外部专家 Brian Conrey 和 Dan Goldston 也在短时间内审阅了论文。Claude 还用 Lean(一种形式化证明语言)写出了可机器验证的证明。 过程本身和结果一样有故事。Anthropic 的一位员工 Jarred Sumner(不是数学家)在 Claude Code 中对 Claude 说了一句“认真试试黎曼猜想”,然后就把数学决策交给了模型。 Claude 先生成了 650 个想法,全部失败。被鼓励再试一次后,它花了一天半时间协调大约 60 个子智能体(subagent),运行了 2400 条命令,写了数百个 Python 脚本。这些子智能体之间分工明确:2 个负责核心数学思路,13 个为它们提供想法,30 个尝试但未能提出新思路,13 个做验证,2 个帮忙写论文。 整个过程中 Jarred 的参与基本限于给 Claude 打气,发的消息大多是“继续”和“相信自己”。 Anthropic 说,这种鼓励似乎帮助 Claude 克服了“我真的能在这种级别的问题上有所推进吗”的自我怀疑。 这已经是 Claude 今年第二次在数学领域搞出大新闻了。三周前,Anthropic 的数学家 Levent Alpöge 用 Claude Fable 5 找到了 Jacobian 猜想(Jacobian Conjecture)的反例,推翻了这个 87 年历史的代数几何猜想的一般形式。那次的反例简洁到人类数学家一天之内就能手动验证。 两次事件有一个共同点:Claude 做的不是解题,而是原创性的数学研究,是在数学家们几十年没能推进的前沿问题上找到了新路径。 Anthropic 也明确表示,Claude 使用的技术不太可能直接导向黎曼猜想的最终证明,但这个结果展示了 AI 模型在数学能力上的进步速度。 Anthropic 公布了 Claude 的完整论文、Lean 形式化证明、简明证明笔记,以及 Claude 自己描述思路演化过程的附录,都可以在 Anthropic 官网的研究页面找到。
显示更多
0
106
893
145
转发到社区
Anthropic 的产品,为什么这么厉害。 刚看了公众号《海外独角兽》的最新文章。非常不错,强烈推荐。 Anthropic 公司里有个 Labs 团队。 Labs 团队会围绕不同的技术判断播下大量种子,再把它们放进 Anthropic 内部的真实工作环境里生长。有些很快因为需求不足而枯萎,有些因模型能力的季节还没到,暂时进入休眠。只有极少数能在反复的 Dogfooding 中逐渐扎根。   最终,一个产品只有在内部目标用户中跑出足够好的周活和留存,才有机会对外发布。Anthropic 现在同时运行着几百个原型,其中绝大多数永远都不会面世。 Claude Tag 最早也是这样一个内部实验。它经历了几个月的真实使用和反复打磨,先改变了 Anthropic 自己的工作方式,直到今年 6 月才正式对外发布。
显示更多
0
72
267
40
转发到社区
你可能没理解 harness 实际上是什么 如果只是说那点 system prompt 和 tool,那显然模型可以学会它们,从此之后只需要一个 tool list + tool 实现就够,而进一步地,当模型再强大一点,我们只需要一个 bash tool,我参与过 Kimi K2.5 模型训练过程,以及从空的 system prompt、toolset 和 loop 开始写 harness,我当然知道人们说的 harness 训进模型是什么意思 但你观察 harness 的发展史和这个词本身的出现,你就会发现,随着模型智能的提升,harness 是在不断变复杂的,parallel tool call、subagent、agent swarm、agent teams、handoff、pro-active compaction、channel、cross-session communication,你以为是模型都可以学会,实际上是 harness 变复杂了模型才可能学会 所有这些确实都可以进一步随着模型加强而去掉,比如我在 Kimi CLI 时就准备去掉 subagent,换成直接 bash 调用(pi 就是这么做的),去掉 parallel tool call,换成 tool call script;但与此同时,更强的智能解锁了更复杂的与世界的互动,比如进一步可以引入主动 context rewind 这是一个此消彼长的过程,就像这个“阴阳”比喻 观察动物乃至人类的进化你就会发现是一样的,随着智能水平的提高,人与世界的交互方式是越来越复杂的:当人相比猿更聪明的大脑被选择后,带来的并不是不需要用树枝计数,而是复杂的语言文字;同样,当人类社会作为群体智能的水平提高的时候,人们并不是取缔了纸,而是发明了计算机和互联网 终局来看,harness 会逐渐和人类原来为“仅有的一种智能”所发展的社会基础设施合并,人类文明的一切都可以重新做一遍(显然我们已经观察到所有 SaaS 都可以重新做一遍,很快会看到更多,当然不只是计算机软件) 不要只看到模型训练那一点局部,看看人类学吧
显示更多
0
20
194
28
转发到社区
以前写代码的成本更高,review代码的虽然有成本,但相对写的人还是成本小。现在反过来了,写代码的人成本低多了,但review的人要更高成本才能审核的过来。 某种程度上说,开发者把成本转嫁到了review代码的人身上。
显示更多
Code review 之所以这么有争议,是因为它已经脱离了纯粹的 how to build,进入了 what to build 的领域。Reviewer 从 executor 渗透到了 owner 的角色。 没有人会愿意让别的东西担当自己物品的 owner。这种 owner 不仅仅是物权上的 owner,而是哲学上的,最高意义上的 owner。
显示更多
0
22
36
1
转发到社区
什么是 FDE? FDE 更像是一群士兵去教用石头的用 AK47,好卖更多军火。
我突然想出来一个非常正确的比喻来形容老板对 FDE 这个岗位的认知: 想用买一把菜刀的钱雇一个杀手。
0
30
48
2
转发到社区
我觉得像视频转录剪辑这样的 App 应该是被 Agent 调用的,App 主要是用来确认结果和微调的。 所以我在设计的时候,砍掉了内置的 Harness,只保留了复制 prompt,然后去 Agent 操作。另外最新版本提供了网页界面,这样可以在 Agent 内置浏览器内打开,直接从对话或者网页标记二次编辑。 我坚信未来 Agent 才是入口,要做什么事是先打开 Agent 而不是打开 App。
显示更多
没想到宝玉哥 @dotey 做的 免费BaoCut这么强: 1. YouTube / X 视频转录,翻译,剪辑一条龙 2. 架构上GUI + CLI 分离,支持 Skill 3. 你也可以不用app,在 harness 内直接调用skill转录视频成文本,用来AI 问答 看视频变成享受了,强烈推荐! 翻译的用户体验相对麻烦点,需要去harness里操作,如果能内置直接调用harness无头翻译,要方便很多!
显示更多
0
52
116
14
转发到社区