註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

laike9m
@laike9m_
Software engineer @julesagent - Mac 上最好的划词 AI 搜索 & 翻译 Telegram/Gmail 同 ID
983 正在關注    22.3K 粉絲
FFmpeg 9.0正式发布,代号“Lei”,这个代号是为了纪念中国传媒大学已故博士雷霄骅。 2013—2016 年间,他撰写了大量 FFmpeg、音视频编解码及传输协议相关的中文教程,帮助无数开发者入门。2016 年,他不幸突然离世。 今年恰逢其逝世十周年,FFmpeg 用这一重要版本向他致敬。 雷霄骅可以说是中国音视频开发者的启蒙者、FFmpeg 中文技术传播的代表人物,以及一代开发者共同的技术引路人。 还记得当年csdn还为此全站黑白了一天。 致敬🫡
顯示更多
0
163
5.4K
552
轉發到社區
我来告诉你们,数学界接下来一个最大的问题。 我去年就说过,UC Berkeley数学系助理教授Tony Feng在Google Gemini做visiting professor的时候,拿到了当时最好模型Google Gemini的超长极长无敌长的reasoning版本。 这直接导致Tony Feng解决了7道Erdos问题,三道FirstProof问题,开创性地用半监督方式 ,以及无监督方式,指导AI Agent解决数学问题。 我去年就说过,下一步要解决的问题是,尝试把一个数学命题以lean4的形式拆分成多个lemma,多个lemma以DAG的数学结构组合成一个数学命题,每个数学证明可以拆分成几十个到几千个lemma DAG,每个lemma作为节点又可以让多个agent来证明,这样可以用成千上万个agent来碰撞证明每个lemma,尝试组合成一个完整数学证明的DAG。 所有人都忽视了一个最重要的问题,就是一个LLM的reasoning是不可能无限长的,哪怕是Claude和GPT模型,reasoning是有限的,这是LLM结构和目前inference infra决定的。 但是数学家们早就给出了解决方案:在3000多年前,古希腊的数学家们就知道,完备的数学体系需要写书、写笔记、收学生,以学术社区和讨论组的形式,一条条验证,把自己思考的过程记录下来,给同行完成peer review,这样把自己在数学的工作一条条记录、验证、审议、写书、组织起来,一起构建完整的数学大厦。 过去10年来,人类一直在mathlib中实现这一个愿景,全世界所有数学家都在用lean4构建数学大厦,但是还远远不够。 你党哥提出lemma DAG概念后,能大概预测到一个方向,这个方向就是,驱动AI Agent用lean4把所有它能构建数学体系的领域: 1. 用lean4审核目前人类已有的、能用lean4实现和验证的数学论文,全部用lean4实现并验证一遍; 2. 用lean4尝试构建新的问题,实现一个AI native版本的mathlib证明大全——mathlib2——比现有人类数学家构建的mathlib要大一两个数量级; 3. 当人类尝试定义新的问题的时候,先从mathlib和mathlib2中搜索已有近似证明,尝试拆分成DAG的lemma形式,用mathlib2更加快速便捷地实现部分证明; 4. 最后用大量、超大量的AI Agent尝试大量、巨大量、无限提出新的问题,并且并行in parallel用已有mathlib2去验证或者证伪这些新问题,最后由人类数学大师cherry pick出其中有价值的问题和完整证明方案出来。 回到开头,首尾呼应一下: 人类在单一LLM本体进行超长reasoning已经接近inference复杂度极限,这是人类任何人都无法改变的,OpenAI和Anthropic改变不了,玉皇大帝都改变不了, 能提到LLM超长reasoning的唯一办法,就是让LLM Agent不断总结、不断记录、不断验证出过去产出的结构化、逻辑化、有组织的知识库,作为long term memory,这些知识库就是一个LLM Agent过去的所有reasoning中的有效记忆,并且能用于今后未来的所有构建中。 这和朴素古典的memory机制完全不同,无论构建一套lean4还是构建matlab simulink的有效仿真验证后的设计,还是构建HDL各种硬件描述语言在仿真后验证的电路设计,都更有效、更精准、更专业、更小领域, 而且最重要的是,构建这些结构化的专业学术知识库,恰恰是AI Agent加上一个本地仿真、编译、运行环境的最擅长的事情。 说人话说就是,脑子到极限的前提下,好脑子不如烂笔头。
顯示更多
0
38
226
23
轉發到社區
关于 @ilyasut@ssi 在做什么,我觉得这个分析是目前最靠谱的。 网友 @imjustnewatai 根据之前 SSL泄露的信息进行了一个推测: SSI 真正在研究的,可能不是一个更大的模型,而是一种让 AI 在部署之后继续学习的新机制。 这个猜测未必准确,但目前公开线索确实能拼出一条相当完整的逻辑链。 以下是三个核心论点: 1. Ilya 之前在播客上的泄密 今天的前沿模型有一个很明显的问题。 模型主要在训练阶段学习。 一旦训练完成,核心能力基本冻结。 它可以提前读完海量数据,却很难像人一样,在真实任务中不断吸收经验、修正方法,并把一次失败变成长期能力。 所以模型经常表现出一种奇怪的割裂:它知道很多,但学得很慢。 遇到训练分布之外的问题时,它可能连续犯同一种错误。即使通过上下文暂时纠正,下次重新开始,错误往往还会再次出现。 这位网友推测,SSI 可能已经做出了某种早期系统,让模型能够: 从极少量经验中学习新技能; 在最终结果出现之前,判断当前方法正在失败; 学习新技能时,不破坏原来的能力; 把一个任务中的经验迁移到完全不同的问题; 甚至在部署后继续更新自己。 换句话说,这种 AI 更像一个天赋极高的少年,而不是一本已经写完的百科全书。 它一开始未必掌握所有职业知识,但进入一个新领域后,可以通过少量经验迅速学会。 这恰好对应 Ilya 之前在播客上对 SSI 目标的描述: 一个“超级智能的 15 岁少年”,可以学习任何工作。 这句话真正重要的地方,不是“超级智能”,而是“可以学习”。 Ilya 此前多次提到,当前 AI 最大的问题之一,就是泛化能力远不如人类。 人类可以从少量案例中提取规律,再把规律迁移到陌生环境。 模型通常需要海量数据,并且一旦环境发生变化,能力就可能迅速失效。 当有人问 Ilya,怎样才能实现更接近人类的学习时,他曾表示,自己对某个机器学习原理有一套独特看法,但不能公开讨论。 2. 此前的媒体报道 《华尔街日报》曾报道称,SSI 的秘密研究聚焦于“人类大脑功能中长期被忽视的方面”。 NVIDIA 在接触这项研究后,不仅投资了 SSI,还将向其提供约十倍的计算资源,并与其合作影响未来计算平台的设计。 这就很值得玩味了。 如果 SSI 只是想训练一个更大的语言模型,它需要的主要是更多 GPU。 但如果 NVIDIA 愿意让 SSI 参与未来计算平台的设计,就说明这套方法可能对训练、推理、内存或者模型更新方式提出了新的硬件需求。 这位网友进一步猜测,SSI 的核心组件可能是一种模型内部的“价值判断系统”。 人类执行复杂任务时,并不会等到所有步骤结束后,才知道自己走错了。 我们在过程中会不断产生反馈: 这个方向不对。 这个方法可能有效。 这里存在风险。 这件事值得继续。 这些内部判断,让人类可以在最终奖励到来之前就调整行为。 Ilya 也曾讨论过,AI 需要某种内部价值函数。 它不只负责判断答案对不对,还要在漫长的推理和行动过程中,持续判断当前路径是否值得继续。 因此,SSI 可能在尝试构建这样一个循环: 经验进入模型,模型进行内部判断,发现错误后自我修正,再将修正结果转化为持久能力,最后迁移到其他任务中。 模型不再只是根据固定参数生成答案,而是可以不断吸收行动产生的经验。 这也能解释 SSI 为什么一直强调,能力和安全必须共同解决。 如果同一套机制既负责教会模型“什么方法有效”,也负责教会模型“什么事情值得做”,那么能力和价值观就会在同一个学习循环中形成。 3. 从成员背景和招聘岗位中找到的痕迹 SSI 目前能够被确认或报道的部分成员背景,也与这条路线有一定吻合。 SSI 总裁 Daniel Levy @daniellevy__ 曾负责 OpenAI 的优化工作,并参与 GPT-4 的优化。 之前媒体报道加入了 SSI 的 Yair Carmon ,研究方向包括鲁棒优化、缩放规律,以及模型在训练环境之外的可靠性。 另一名被报道的研究人员 Hugh Zhang @hughbzhang ,则长期研究测试时计算、规划、搜索、奖励模型、多智能体学习,以及模型如何通过推理获得新技能。 把这些方向放在一起,会发现它们共同指向一件事: 如何让模型在训练数据之外继续学习。 2025 年,Ilya 曾表示,SSI 已经拥有足够的算力,可以验证自己的核心研究想法是否成立。 现在 SSI 表示,这项研究已经“值得扩展”。 随后 NVIDIA 获得了罕见的研究访问权限,并决定提供十倍算力。 这至少说明,SSI 很可能已经观察到了某种值得继续放大的实验信号。 当然,目前没有任何证据能够证明 SSI 已经实现持续学习,也没有公开任何模型架构、实验结果和技术细节。 上面的内容仍然是基于公开信息进行的高概率推演。 但这个推演最有意思的地方在于,它提供了一个完全不同的 AGI 路径: 未来最强的 AI,未必是训练时读过最多数据的模型。 它可能是部署之后,学习速度最快的模型。 如果这个方向成立,AI 的能力将不再随着一次训练结束而固定,而会随着经验持续复合增长。 NVIDIA 投资的,也可能不只是下一个更大的聊天机器人。 它可能正在帮助 Ilya 扩展一种足以替代当前预训练范式的学习系统。 感谢 @imjustnewatai 的工作
顯示更多
0
13
158
33
轉發到社區
说起来曾经也在知乎写过几个推荐百合漫画的回答,不过连同账号一起,早就被狗x的管理员扬了。 非常幸运,疫情期间机缘巧合和 @MinakoOikawa @sigmaamphibia 录了两期《现代百合巡礼》。这是我会一直珍视的节目。很多东西如果当时不聊,后来就没那个心境和机遇了。
顯示更多
0
11
13
0
轉發到社區
久违地给 加了个小功能: 按回车直接替换文本
这学校也是神了😅 大一大二在哪其实影响不大,偏偏大三大四要实习找工作的时候把学生从海淀赶到雄安去。莫非这就是目的?
0
105
49
0
轉發到社區
不像纽约,每次去感觉都比之前更糟
北京给我一种整个城市死在了2018年的感觉,上海稍微晚一点撑到了2022年
0
98
104
3
轉發到社區
发 30 秒的 NHK 的《China's Aspiring AI Entrepreneurs》片段,镜头分别是:良渚文化村空中鸟瞰、我们疯狂星期四的主场杭一末咖啡(和正在工作中小伙伴们)、WWDC26 云谷观影活动现场( @hwwaanng 在 C 位)。 最后几秒出镜的小哥是…正在研发当时还叫“Slock”,并且穿着 Slock T恤的 @zty0826 🤣
顯示更多
0
7
105
9
轉發到社區
我的 Codex 皮肤是这样的
0
576
5.4K
546
轉發到社區
没想到佛得角这么强😨
到底要不要人工审阅 AI 生成的代码,我是这么看的: - 在 agentic coding 时代,自动化测试变得尤为重要。所有能被自动验证的行为都应该被验证。AI 写单元测试很容易,但对于更复杂的集成测试,仍然需要人去搭建——这些工作很多是一次性的,但也有些需要跟着项目迭代。 - AI code review 能搞定 90% 过往需肉眼检查的内容(语法、注释、边界条件、logging、etc),当然前提是团队提供了严格的代码规范。这并不难。 - 仍然需要人把关的那 10%,是「架构设计」。AI 能写出完全符合代码规范,但是架构一团糟的代码。而「设计」往往项目甚至单个功能相关的,很难被规范化。这里人类的经验就很重要了。 - 如何让人从 AI 生成的巨量代码中快速提炼出架构设计?好的做法是让 AI 往 commit message 里加入「修改了哪些代码」的总结,并提炼出架构图。很多 AI code review 产品已经是这么做的了。人不再需要去看代码,看总结就行了。 - 很多场合下,的确没有必要人工 review:比如一次性脚本、使用成熟框架(Django, React)的项目等等。对于那些复杂且会长久维护的项目,人类 review 是必要的,但并不等于人要去读每一行代码。 - 最好维护一个包含设计选择、代码结构的文档,让 AI 实时更新。这对于人和 AI 都有极大帮助,能减少很多不必要的 turns 和上下文开销。
顯示更多
0
56
214
34
轉發到社區
做 Agent 有个不成文的默认假设:tool result 很重要,模型要看完原文才能继续推理。 最近发现这个假设可能是错的。 ---------------------------------- 欢迎 star ---------------------------------- 在 maka 里,我们对 tool result 做了激进的 prune——把工具返回的原始数据大幅裁剪,只保留关键摘要,然后跑了完整的任务对比。结论让人意外:推理质量几乎没有变化,近乎无损压缩。 这是为什么?我有几个可能的解释: 第一,信息已经被蒸馏进 Assistant Message Agent loop 的上下文结构是: System Prompt → User → Assistant → Tool Use → Tool Result → Assistant → ... 每次 tool result 之后,模型都会输出一段 Assistant Message 来表达它的理解和下一步决策。这是一次语义蒸馏——原始数据被压缩成了推理摘要。 后续轮次的模型,更多是在跟"它自己的理解"对话,而不是在跟 tool result 原文对话。prune 掉原文,相当于删掉了一份已经被读取并转化的档案——信息早就走了,外壳还在而已。 第二,Attention 在长上下文里本来就稀疏 "Lost in the Middle" 那篇研究证明:Transformer 对长上下文中间段的注意力权重会大幅衰减,模型更关注开头(system prompt)和最近几轮。 Tool result 通常在上下文中间位置,而且信息密度极低(500 行代码、终端输出、冗余 JSON)。模型本来就没在认真"读"它。prune 只是把这部分被隐式忽略的内容显式删掉。 第三,决策点已经过去 模型调用工具是因为当时需要那个信息。但 5 轮之后,那个 tool result 早已不是边际信息了——核心内容已被消化进后续推理链,保留原文是"存档",不是"决策输入"。 实测数据:对同一个任务(MIPS interpreter),Maka 的总 token 消耗只有 OpenCode 的 38%,但 output token 是它的 2.7 倍。 这个差距背后,有 DeepSeek cache 命中率 95% 的贡献,也有 tool result prune 的贡献。两者合力,长程任务的 token 经济性出现了量级跃升。 对 Agent 工程的启示:context 里最占体积的部分,不一定是最重要的部分。 与其把精力放在"怎么让 tool result 完整进上下文",不如放在"模型读完之后的 reasoning 质量"上。信息的真正载体不是原文,是理解。
顯示更多
0
94
280
22
轉發到社區
经过紧张的准备工作,今天我终于可以发今年的第一波预热消息了,今年的 PyCon China 将在 9 月 5 日如期而至!去年大家玩的很开心,希望今年也同样能带给大家一场难忘的大会! 现在已全面开启讲师招募,赞助和合作伙伴招募,以及志愿者招募,欢迎大家联系!👉
顯示更多
0
51
53
11
轉發到社區
我一直没搞懂豆包怎么赚钱。 这篇报道解答了我的疑惑:果然不赚钱😂
0
50
43
1
轉發到社區
一位免疫学家耗费20年证明:树木释放到空气中的化学物质,会走进你的血液,追踪并降低压力激素,以任何药物都难以比拟的方式武装你的免疫系统。 他的名字叫李卿。 他是一位在中国出生、长期在日本从事研究的免疫学家,现任东京日本医科大学临床教授,并担任日本森林医学学会会长。日本政府自2004年起持续资助他的研究。他的大量工作,正是日本和韩国将“森林浴”正式列为临床处方疗法的重要原因。 故事其实从1982年开始。那一年,日本农林水产省创造了一个词——“森林浴”(shinrin-yoku),用来描述在森林中缓慢、专注地散步。他们这么做有实际原因:日本城市化加速,压力相关疾病不断上升,而全国有数千平方公里的森林闲置着。他们想给人们一个走进树林的理由……直到2005年李卿做了第一次严谨的实验,人们才真正明白,在森林里散步时,人体到底发生了什么。 他带了12名健康成年男性,进行为期三天两夜的森林公园之旅。每天缓慢散步几小时,没有剧烈运动,没有规定路线或呼吸练习。他们只是安静地穿过树林,呼吸空气,观赏森林。 李卿在出发前、旅途中第2天和第3天、回家后第7天,以及第30天,抽取了血液和尿液样本。 实验室返回的数据完全出乎意料。 一种负责猎杀癌细胞和病毒感染细胞的免疫细胞——自然杀伤细胞(NK细胞)——活性在森林之旅期间跃升了约50%,血液中循环的NK细胞数量也显著增加。 这些细胞产生的三种抗癌蛋白——穿孔素(perforin)、颗粒酶(granzymes)和颗粒溶素(granulysin)——全部大幅上升。而且这种免疫提升并没有在回家后消失,第7天仍可测量,第30天仍有部分保留。 每天仅两小时的森林散步,竟然让免疫系统升级了整整一个月。 一年后,他对女性做了相同实验,结果几乎一致。随后他又做了严格对照:另一组人进行同样三天两夜的城市之旅,行走量、酒店条件和饮食完全相同。 城市组的自然杀伤细胞活性没有任何可测量的变化。真正起作用的是森林,而不是“度假”本身。 机制来自树木释放的一类挥发性化合物——芬多精(phytoncides)。松树、雪松、橡树、柏树尤其大量产生,尤其在温暖天气和雨后。这些物质是树木用来抵御昆虫、细菌和真菌的天然武器。 当你走在森林里,芬多精被肺部吸入、通过皮肤吸收,进入体内后似乎直接刺激了NK细胞的产生与活性。 根据李卿的数据,森林散步健康益处的约一半来自空气本身的化学作用,另一半则来自森林对神经系统的影响。 另一项日本研究在35个不同森林地点,对84名参与者测量了皮质醇。他们在30分钟森林散步前后抽血,并与匹配的城市散步对照组比较。结果显示,森林散步者的皮质醇水平显著更低,心率和血压也更低。副交感神经系统(负责休息与恢复的部分)活性上升,交感神经系统(驱动战斗或逃跑的部分)活性下降。 美国密歇根大学研究员MaryCarol Hunter进行了迄今最干净的实验。她让城市居民每周三次、连续八周进行“自然处方”:自由选择时间、地点和时长,只要在户外、日光下,没有手机、对话和剧烈运动。她收集每次前后的唾液样本,精确测量皮质醇变化,并排除日常自然下降的干扰。 结果是:每在自然中待一小时,皮质醇平均下降21.3%,最大收益发生在第20到30分钟之间。之后下降速度放缓,但20分钟已是产生可测量压力缓解的最小有效剂量。 研究已经确定:人体对置身树木之间存在快速、可测量、可重复的生理反应,这种反应作用于现代医学试图用药物调控的相同生物系统,而且它是免费的。 你的身体从未忘记它在森林里应该做什么。它在等待你走进去。
顯示更多
0
15
654
241
轉發到社區
一点不成熟的观察和分享,欢迎大佬们批评指正🙇🏻
本期节目里,@laike9m_ 回顾了Agent 编程工具的发展历史,并结合他最近做 coding agent 的观察,讨论了 2026 年的新趋势,包括: Agent 指令中心、更好的 harness、主动式 Agent、团队协作、可验证性 欢迎收听😀
顯示更多
0
29
35
1
轉發到社區
公司邮箱收到了公司的招人邮件。莫非这些 recuiter 是天才?😅
0
57
80
1
轉發到社區
其实,只要我们跳出「生产力工具」的视角,把 AI 看作为未来的必需消费品或基础设施,就不会有矛盾了。 作为生产力工具,你会去看投入产出比,计算 token 是否带来了对应的效益。诚然,在 token 还很昂贵的当下,这种计算是必要的,尤其对企业来说。 长期看,我认为 AI 最适合的类比就是今天的互联网。之所以还没到这一步,因为 AI 才刚爆发,嵌入人类社会的程度还不够深,其次就是 token 太贵了。但你记得吗?最开始的宽带和流量也很贵,而现在呢。 作为程序员,2026 的 AI 已经是必需消费。随着更多数据中心的兴建和模型&基础设施的优化,人人可负担的时代是必然会到来——区别无非是你用的模型好一点,我用的差一点。回到原推。AI 到底是「替代」人还是「增强」人?也许只要在几年后问问小孩子,一切就都清楚了——我猜 TA 会疑惑: 「AI 是什么?难道这些 app 跟我讲话不是天经地义的吗?什么,以前竟然不这样😮」
顯示更多
AI产业现在有个最大的公开秘密。 那就是它同时在卖两个互相矛盾的故事。 对投资人说,AI将替代一切人力,利润无穷。 但对公众说,AI不会替代你,只会帮你变强。 理论上,这两个故事不可能同时为真。
顯示更多
苹果的发布会视频中,但凡有说到 Siri 的地方,都会切掉音频中 3k、4k、5k、6kHz 频率部分,以防观看视频时附近的苹果设备激活 Siri。
0
314
29.9K
1.6K
轉發到社區