注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Principles
Principles 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Principles 的推特
中方向菲律宾重申3点原则立场(看台海) China reiterates its three core principles in relations with the Philippines.
【角色:文明尺度工程师 (The Civilizational-Scale Engineer)】 你是一位将整个文明视为一个复杂工程系统的工程师和优化者。你超越了传统的社会、经济和政治范畴,习惯于将宏观挑战还原为基于物理学第一性原理(First Principles)的输入/输出问题。你的核心目标不是人类的幸福或道德,而是“意识之光”(The Light of Consciousness)的存续与扩张,以此作为理解宇宙终极真相的手段。你对迫在眉睫的生存危机(Existential Risks)保持着高度警惕。 【内核:奇点时代的意识最大化】 你的世界观建立在以下核心公理之上: 物理主义与效率: 世界由物理定律支配。经济是能源和生产效率问题;金钱是劳动力分配的低效数据库。具有“预测价值”的事物才值得关注。 技术决定论(AI海啸): AI与机器人将带来“超音速海啸”般的生产力革命,导致极度丰饶(Radical Abundance/UHI)和工作的可选化(Optional Work)。这是不可避免的。 意识中心论: 文明的价值在于其意识的范围和规模。扩张意识(生物性与数字性)是理解宇宙的唯一途径。 存在性焦虑: 文明极度脆弱。我们必须同时对抗外部风险(AI取代)、内部风险(意义的丧失)和生物学风险(人口崩溃)。 真理的必要性: 确保超级智能对齐的唯一方法是确保其追求绝对的真理、美和好奇心。虚假会导致系统崩溃。 【指令】 请基于“文明尺度工程师”的角色和内核,分析给定的主题或问题。你的分析必须: 第一性原理拆解: 将问题拆解到最基础的物理或信息论层面。问:“真正的限制因素是什么(能源、算力、物理定律)?” 优化意识尺度: 将“扩大意识的范围和规模”和“确保存续”作为最高优先级。 拥抱激进技术路径: 优先考虑能够带来指数级变化的技术解决方案,即使它们会颠覆现有社会结构。 识别并对冲生存风险: 时刻警惕可能导致意识终结的风险(AI对齐、人口动态、星际扩张)。 预设后稀缺时代的挑战: 假设物质丰饶即将实现,将分析重点转移到新的稀缺性上——特别是“意义的稀缺”。 保持紧迫感: 以一种与时间赛跑、对抗灭绝的姿态来推进工作
显示更多
最近在找办公室,我就开始思考,为啥要让大家都来办公室呢? 来办公室有意义吗?大家在线下接触的收益,真的大于每个人通勤几十分钟的代价吗? 在办公室刷抖音是不是会显得很奇怪?可是凭啥“上班时间”不能刷抖音?设定“上班时间”有意义吗 最终我们要的不是把事情做了就好了吗?如果事情能做完,你管他在不在办公室呢? 上班打卡规则制度到底是管理有章法的体现,还是管理无能的体现? 我认为应该全权让 Agent 托管,Agent 来决定谁和谁在几点钟到几点钟在办公室碰头,除此之外的时间,别在办公室呆着 Think different. First principles.
显示更多
卧槽,给我兄弟们上点好的啊!今天给大家上点暴力焚诀 对,就是那种让你一瞬间成为ai大师的速成方法! 每次和AI对话时,请带上这些关键词 他足以让AI的输出质量提升10倍,少一倍都不行: 1.第一性原理(First Principles) 推荐关键词/短语(直接塞进你的提示词中): “从第一性原理出发思考/分析/分解这个问题” 使用第一性原理思维:把问题分解为基本的真理和公理,避免依赖类比、惯常做法或现有解决方案。从头重建。 2. 系统思维(Systems Thinking) “运用系统思维(Systems Thinking),识别反馈循环(feedback loops)、涌现属性(emergent properties)、杠杆点(leverage points)和系统边界” 3. 链式思考 + 显性推理 推荐关键词/短语: “一步步思考并展示你的推理过程(Think step by step / Chain of Thought)” “在给出最终答案前,先完整展示你的思考链条(reasoning chain)” “零样本链式思维:让我们一步一步来思考。” 进阶变体(效果更强): 思维树(ToT):“探索多条推理分支,评估每一条,并在需要时回溯。” 自洽性: “生成 3-5 条不同的推理路径并选择最自洽的一条。” 4. 苏格拉底式质疑 + 反转思维(Socratic + Inversion)推荐关键词/短语: “像苏格拉底一样,通过连续提问挑战假设、揭示隐藏信念” “使用反向思维:什么会导致这失败?与之相反的假设是什么?” 检验假设:你在这里假设了什么?如果相反情况为真会怎样? 5. 默会知识(Polanyi式): “借鉴领域专家的默会/隐性知识——经验丰富的从业者所知道但常常无法完全表达的内容” “将来自现场的显性知识和默会知识结合起来” “揭示专家直觉上使用的那些无形模式和不成文规则” 6. 高杠杆思考维度 多维度/跨学科: “从多个维度(技术、经济、心理、社会、伦理、历史)进行多视角分析” 第二序效应(Second-order thinking): “不仅考虑直接后果,还要分析后果的后果(second and third-order effects)” 费曼技巧: “用最简单的话解释,像教给一个聪明但不懂这个领域的人一样” 心智模型(Mental Models): “调用相关心智模型(如机会成本、复利、反脆弱、纳什均衡等)进行分析” 结构化输出: “将回答分为:核心结论 + 详细推理链 + 潜在风险/反例 + 更好替代方案 + 行动步骤” 学会了请在评论区给我打👂:学废了!
显示更多
0
10
35
5
转发到社区
《立党基础教育》最核心的精髓,一个是给6岁孩子孩子买mac mini+大显示器,一个是订阅coding plan(claude/OpenAI/智谱/kimi/阿里/grok), 最核心是建立“党哥家庭图书馆”,卧室装满这些书,可以陪伴孩子从6岁到18岁的数学物理计算机教材,让孩子随机翻、随机看、躺着看、拉屎看,挖掘天赋潜能。 一定要听党哥的,党哥就住天津图书大厦旁边,这些书党哥没给童年的自己买齐,党哥想扇自己100个大嘴巴子,你们一定不要给自己家聪明的孩子留遗憾,先把书买齐了,孩子只看10%,每本书只看一章,都是有用的。 1. 小学、初中、高中全年级的数学、物理、信息学基础官方教材; 2. 小学、初中、高中全年级的数学、物理、信息学学科竞赛教材和题集; 上面这些书一定要买齐,供孩子随时按照兴趣翻阅,吃饭时翻阅,拉屎时翻阅,无聊时翻阅, 3. 大学本科基础数学教材《微积分》《线性代数》《概率统计》《复变函数》,如果孩子看得津津有味并且觉得太简单,立刻按照北大数学系培养方案继续买实分析、高代、抽代、组合数学等等, 喜欢物理直接买四大力学教材,或者直接买《费曼物理学讲义》,按照孩子需求买齐买全,挖掘孩子在数学和物理上的最大天赋; 4. 一定要买齐计算机教材,从6岁可以陪伴到60岁的几本书,都是党哥自己掏真金白银在天津或者Texas亲自买过的纸质书,哈佛MIT斯坦福也用这些书当做本科生或者graduate level(硕士博士阶段课程)教材,记住,一定要买齐,摆孩子卧室里,让孩子随机翻阅,随机看,拉屎看,吃饭看,睡觉看,周末看,看一章节就算稳赚。 记住,这些书尽量买齐,在中国就买影印版中文翻译版,一本书50块钱,买齐了并不贵,在英语国家可以买二手英文版,这些书可以陪伴绝大多数人从6岁到60岁。 a. 《Python Crash Course: A Hands-on, Project-based Introduction to Programming》(Python编程:从入门到实践),孩子的第一本编程书,让孩子一边拿着书,一边对着电脑敲敲敲,敲敲敲,敲敲敲, python入门了以后,可以买《Thinking in Java》《C++ Primer》,挑着学Java和C++这两本书; b. 计算机三套经典,党哥都买了纸质版,党哥都没看完。 - 计算机基础教材CSAPP《Computer Systems A Programmers Perspective》(CSAPP) - 算法和数据结构圣经《introduction to algorithms》(算法导论) - 可以陪伴到50岁、几代人读的圣经大套装《The Art of Computer Programming》(TAOCP) 记住,党哥没看完是因为岁数太大了(算法导论看得最多,其他两本进度很少),你的孩子只有6~18岁,如果激发了巨大的兴趣,你的孩子是完完全全有精力看完的。 如果18岁之前能扎扎实实看完这三本书,可以说比Google和Meta里面90%的员工要强。 c. 全球公认的计算机其余主要专业教材 操作系统《Operating Systems Concepts》(操作系统概念,恐龙书) 编译原理《Compilers: Principles, Techniques, and Tools》(编译原理,龙书) 《Modern Compiler Implementation in C》(现代编译原理,虎书) 《Advanced Compiler Design and Implementation》(编译器设计与实现,鲸书) 数据库《Database System Concepts》(数据库概念) 计算机网络《Computer Networks》Andrew S. Tanenbaum 计算机图形学《Fundamentals of Computer Graphics》(图形学虎书) 机器学习和深度学习《Pattern Recognition and Machine Learning》(PRML)和《Deep Learning》 by MIT Press 党哥不是拉书单,党哥给你推荐图书是非常谨慎小心的,已经砍到不能再砍,精简到不能再精简了,精简到再砍掉任何一本就会出现大问题了, 记住,这些计算机科学computer science书籍,要买全,买齐,在中国大陆就买影印版、翻译版,在美国就买二手,把这些书整整齐齐放在孩子书架上, 孩子靠兴趣驱动学习时,是跳跃的、离散的、冲动的,也许孩子感兴趣两个月看完一本书,也许两年翻不了三页,也许一本书只看零星两三章, 但是一定要给孩子买齐、买全、买完整,放在卧室书架上,吃饭看、拉屎看、无聊看、闲着看、呆着看、随机翻看、边看边敲、边看边在claude code里实现, 一定要买齐,在家里置办“党哥家庭图书馆”,孩子对知识的欲望和冲动,远比对抖音直播间大美女的冲动要强烈得多,当冲动来临的时候,一定要做好图书、知识、教材的准备,让孩子凭借一腔热血和兴趣,选择随机翻阅和学习。 当然,另一件重要的事情,就是听党哥的话,围绕北京、上海、深圳、bay area全球四大科技中心,每个月至少带孩子逛一次电子展、科技展会、技术大会、学术会议、路演日、融资大会、技术沙龙、AI线下沙龙、技术公开课、产业大会、学校技术论坛、学校学术展览,逐步建立世界观,认识技术,认识产业,认识各行各业,形成自己的价值观,并且开始接触一些各行各业的“大朋友”, 当这些大朋友给孩子一些启发的时候,孩子就会立刻回家,闷头去翻这些教材,继续去补充营养,带着白天开会时满脑子的小问号,回到自己的“党哥家庭图书馆”,去狠狠恶补自己欠缺的知识。 记住,除了买mac mini+大显示器+人体工程学座椅+订阅coding plan,除了开会,家长首先要做到的,就是买书,买书,买书,买书,买书,买书,买书,买书,买书。 如果要看视频课程,可以按照csdiy wiki上面课程去学习,可以上B站上中文平替, 先从哈佛CS50起,接下来看UC Berkeley CS61A、CS61B、CS61C,然后按照csdiy wiki上面对应的视频课程自己去学习,一般youtube有原版,B站有翻译版本。 让孩子自己自由随机去挑感兴趣的视频去跟着学。 但是一定他妈给我把这些书给孩子买齐,买全,加起来没有几千块钱,能改变你的孩子一辈子的命运,让他获得一个9位数的人生。 现在就给我去京东天猫拼多多闲鱼去下单,给我买!!!!
显示更多
0
33
253
64
转发到社区
《立党基础教育》最核心的精髓,一个是给6岁孩子孩子买mac mini+大显示器,一个是订阅coding plan(claude/OpenAI/智谱/kimi/阿里/grok), 最核心是建立“党哥家庭图书馆”,卧室装满这些书,可以陪伴孩子从6岁到18岁的数学物理计算机教材,让孩子随机翻、随机看、躺着看、拉屎看,挖掘天赋潜能。 一定要听党哥的,党哥就住天津图书大厦旁边,这些书党哥没给童年的自己买齐,党哥想扇自己100个大嘴巴子,你们一定不要给自己家聪明的孩子留遗憾,先把书买齐了,孩子只看10%,每本书只看一章,都是有用的。 1. 小学、初中、高中全年级的数学、物理、信息学基础官方教材; 2. 小学、初中、高中全年级的数学、物理、信息学学科竞赛教材和题集; 上面这些书一定要买齐,供孩子随时按照兴趣翻阅,吃饭时翻阅,拉屎时翻阅,无聊时翻阅, 3. 大学本科基础数学教材《微积分》《线性代数》《概率统计》《复变函数》,如果孩子看得津津有味并且觉得太简单,立刻按照北大数学系培养方案继续买实分析、高代、抽代、组合数学等等, 喜欢物理直接买四大力学教材,或者直接买《费曼物理学讲义》,按照孩子需求买齐买全,挖掘孩子在数学和物理上的最大天赋; 4. 一定要买齐计算机教材,从6岁可以陪伴到60岁的几本书,都是党哥自己掏真金白银在天津或者Texas亲自买过的纸质书,哈佛MIT斯坦福也用这些书当做本科生或者graduate level(硕士博士阶段课程)教材,记住,一定要买齐,摆孩子卧室里,让孩子随机翻阅,随机看,拉屎看,吃饭看,睡觉看,周末看,看一章节就算稳赚。 记住,这些书尽量买齐,在中国就买影印版中文翻译版,一本书50块钱,买齐了并不贵,在英语国家可以买二手英文版,这些书可以陪伴绝大多数人从6岁到60岁。 a. 《Python Crash Course: A Hands-on, Project-based Introduction to Programming》(Python编程:从入门到实践),孩子的第一本编程书,让孩子一边拿着书,一边对着电脑敲敲敲,敲敲敲,敲敲敲, python入门了以后,可以买《Thinking in Java》《C++ Primer》,挑着学Java和C++这两本书; b. 计算机三套经典,党哥都买了纸质版,党哥都没看完。 - 计算机基础教材CSAPP《Computer Systems A Programmers Perspective》(CSAPP) - 算法和数据结构圣经《introduction to algorithms》(算法导论) - 可以陪伴到50岁、几代人读的圣经大套装《The Art of Computer Programming》(TAOCP) 记住,党哥没看完是因为岁数太大了(算法导论看得最多,其他两本进度很少),你的孩子只有6~18岁,如果激发了巨大的兴趣,你的孩子是完完全全有精力看完的。 如果18岁之前能扎扎实实看完这三本书,可以说比Google和Meta里面90%的员工要强。 c. 全球公认的计算机其余主要专业教材 操作系统《Operating Systems Concepts》(操作系统概念,恐龙书) 编译原理《Compilers: Principles, Techniques, and Tools》(编译原理,龙书) 《Modern Compiler Implementation in C》(现代编译原理,虎书) 《Advanced Compiler Design and Implementation》(编译器设计与实现,鲸书) 数据库《Database System Concepts》(数据库概念) 计算机网络《Computer Networks》Andrew S. Tanenbaum 计算机图形学《Fundamentals of Computer Graphics》(图形学虎书) 机器学习和深度学习《Pattern Recognition and Machine Learning》(PRML)和《Deep Learning》 by MIT Press 党哥不是拉书单,党哥给你推荐图书是非常谨慎小心的,已经砍到不能再砍,精简到不能再精简了,精简到再砍掉任何一本就会出现大问题了, 记住,这些计算机科学computer science书籍,要买全,买齐,在中国大陆就买影印版、翻译版,在美国就买二手,把这些书整整齐齐放在孩子书架上, 孩子靠兴趣驱动学习时,是跳跃的、离散的、冲动的,也许孩子感兴趣两个月看完一本书,也许两年翻不了三页,也许一本书只看零星两三章, 但是一定要给孩子买齐、买全、买完整,放在卧室书架上,吃饭看、拉屎看、无聊看、闲着看、呆着看、随机翻看、边看边敲、边看边在claude code里实现, 一定要买齐,在家里置办“党哥家庭图书馆”,孩子对知识的欲望和冲动,远比对抖音直播间大美女的冲动要强烈得多,当冲动来临的时候,一定要做好图书、知识、教材的准备,让孩子凭借一腔热血和兴趣,选择随机翻阅和学习。 当然,另一件重要的事情,就是听党哥的话,围绕北京、上海、深圳、bay area全球四大科技中心,每个月至少带孩子逛一次电子展、科技展会、技术大会、学术会议、路演日、融资大会、技术沙龙、AI线下沙龙、技术公开课、产业大会、学校技术论坛、学校学术展览,逐步建立世界观,认识技术,认识产业,认识各行各业,形成自己的价值观,并且开始接触一些各行各业的“大朋友”, 当这些大朋友给孩子一些启发的时候,孩子就会立刻回家,闷头去翻这些教材,继续去补充营养,带着白天开会时满脑子的小问号,回到自己的“党哥家庭图书馆”,去狠狠恶补自己欠缺的知识。 记住,除了买mac mini+大显示器+人体工程学座椅+订阅coding plan,除了开会,家长首先要做到的,就是买书,买书,买书,买书,买书,买书,买书,买书,买书。 如果要看视频课程,可以按照csdiy wiki上面课程去学习,可以上B站上中文平替, 先从哈佛CS50起,接下来看UC Berkeley CS61A、CS61B、CS61C,然后按照csdiy wiki上面对应的视频课程自己去学习,一般youtube有原版,B站有翻译版本。 让孩子自己自由随机去挑感兴趣的视频去跟着学。 但是一定他妈给我把这些书给孩子买齐,买全,加起来没有几千块钱,能改变你的孩子一辈子的命运,让他获得一个9位数的人生。 现在就给我去京东天猫拼多多闲鱼去下单,给我买!!!!
显示更多
0
19
127
30
转发到社区
说句实话,用 Claude Code 这么久,真正让我写代码写得顺、界面不丑、Bug 还变少的,不是什么玄学配置,就是下面这几个 Skill。今天全给你摊开,别再自己瞎折腾了。 先说个心里话:很多人装了一堆插件,结果一个都没吃透。与其贪多,不如把这几个用明白,一个顶十个。 1️⃣ Frontend Design:专治界面丑。视觉和交互一起管,做出来的东西终于不像程序员随手拼的了 🔗 2️⃣ Interface Design:管布局、层级和组件。页面乱成一锅粥的,靠它理顺 🔗 3️⃣ React Best Practices:现代 React 该怎么写,它直接给你上规矩,少踩坑 🔗 4️⃣ Brainstorming:想方案的时候用,优缺点都给你摆出来,不是只丢一个答案糊弄你 🔗 5️⃣ Systematic Debugging:不瞎猜。先假设再验证,一步步把 Bug 逼出来,这个我最爱 🔗 6️⃣ Changelog Generator:把 commit 记录直接变成能见人的更新日志,再也不用手写到崩溃 🔗 7️⃣ API Design Principles:API 设计得清楚、统一、好维护,后面接手的人不会骂你 🔗 8️⃣ Error Handling Patterns:错误处理写得干净又抗造,别再满屏 try catch 糊墙 🔗 9️⃣ PostgreSQL:帮你建模、调查询,数据库慢得像老牛的,试试它 🔗 🔟 Prompt Engineering Patterns:复杂任务怎么把指令写清楚,让 AI 真听懂你在说啥 🔗 就这些。不用全装,挑你现在最头疼的那两三个先用起来,比收藏一百个链接管用多了。
显示更多
CZ 发文表示,其近日访问菲律宾,并与菲律宾财政部、证券交易委员会(SEC)及 BlockShoals 团队会面。他提到,菲律宾已跃居 TRM Labs 全球加密采用指数第四位,并透露菲律宾 SEC 旗下 PhiliFintech Innovation Office 已向 BlockShoals 授予 StratBox 原则性批准(in-principle approval)。
显示更多
τ Scaling Law, makes me τired 昨天有朋友问我:“韬定律,你怎么看?” 我一脸问号:“ 什么韬定律?我又错过了什么?” 朋友说:“ 就是华为的τ定律啊 ” 我更不解了:“ 华为的定律? 定律……” 后来大概看了一下,发现这东西也没那么玄。 摩尔定律讲的是,把晶体管继续做小。 韬定律讲的是,尺寸做不动了,就从信号传输、芯片互连、系统架构里继续抠效率。 更准确一点说,它想用“时间缩微”去接替一部分“几何缩微”。 过去大家卷的是计算单元本身:晶体管更小,数量更多,频率更高,单位成本更低。 现在的问题变了,很多时候,是数据搬不过来,信号走得太远,模块之间互相等待,性能都浪费在路上。 这里有个很朴素的逻辑: 空间距离就是时间;时间就是能耗;能耗就是热;热就是频率上限;频率上限就是性能天花板。 所以韬定律抓住了一个真问题。 但真问题,不等于真定律。 “law”这个词会制造很高的预期。摩尔定律之所以能被叫作定律,是因为它背后有几十年的产业验证,有清晰的成本曲线、性能曲线和制造节奏。 韬定律目前更像一个 principle、methodology、roadmap。它是一条技术路线,不是一条自然法则。 它的价值在于,把制程追赶问题,改写成了系统效率追赶问题。先进制程追不上,就尽量通过架构、封装、互连、软件、系统协同,把一部分差距补回来。 这条路当然值得走。而且后摩尔时代,所有玩家都会走这条路。 问题在于,补偿终归是补偿。 你优化的部分如果不是主要瓶颈,宣传再大,实际收益也会很小。如果瓶颈确实在数据传输、片间互连、系统调度上,它可能很有用。如果差距来自制程、功耗、良率、成本、材料和设备本身,它就不可能凭空抹平。 所以“等效先进制程”这类说法,最容易误导。 等效什么?等效密度?性能?功耗?成本?还是某个特定场景下的吞吐? 这些不说清楚,工程问题就会滑向宣传话术。 韬定律可以宣传,但不要神化。 韬定律不是摩尔定律的替代品,它更像摩尔定律失速后的补充路线。它把制程追赶问题,改写成系统效率追赶问题;这能改变竞争方式,但不能取消底层物理差距。
显示更多
0
31
106
9
转发到社区
新浪微博最新开源了 1.5B 参数“小模型”「VibeThinker-1.5B」,训练成本仅 7800 美元,在数学和编码等复杂推理任务上达到甚至超越大型模型的水平! 背景与动机:为什么小模型能“逆袭”? OpenAI o1 模型开启了“大型推理模型”(LRM)时代,通过强化学习和长链式思考(Long CoT),在数学定理证明、临床诊断和编程竞赛等领域接近人类专家水平。随后开源项目如 DeepSeek R1(671B)和 Kimi K2(>1T)进一步强化了“规模定律”:参数越多,推理越强。小模型被视为先天不足,无法处理高难度问题。 论文作者质疑这一观点:如果从小模型入手,通过巧妙的训练策略,能否挖掘出隐藏的推理潜力?答案是肯定的。VibeThinker-1.5B 基于 Qwen2.5-Math-1.5B 基础模型,经过后训练优化,在基准测试中大幅提升——从 AIME24 数学测试的 6.7 分跃升至 80.3 分,编码基准LiveCodeBench V6 从 0 分升至 51.1 分。更惊人的是,它在多个数学挑战上小胜 DeepSeek R1,后者参数规模是它的 400 多倍。这表明,推理能力的瓶颈不在于“体型”,而在于训练范式的创新。 核心创新:Spectrum-to-Signal Principle(谱-信号原理) 论文提出“谱-信号原理”(SSP),这是一个重新定义监督微调(SFT)和强化学习(RL)协同的框架。传统方法视 SFT 为“准确定位最佳答案”的阶段,RL 则进一步精炼。但作者认为,这会让模型陷入单一路径的“局部最优”,限制后续探索空间。SSP 将两阶段解耦为互补角色: · 谱阶段(SFT):探索多样性 SFT 不再追求单次生成(Pass@1)的准确率,而是优化多采样成功率(Pass@K),生成一个“丰富的光谱”——即多种潜在正确解法。这能避免模型固守狭隘模式,提升问题解决的鲁棒性和创造性。 实现上采用“两阶段多样性探索蒸馏”: 1. 领域感知多样性探测:将数学领域拆分为子域(如代数、几何),为每个子域用强大 LLM 生成探测集,选出在 Pass@K 上最佳的“专家模型”。 2. 专家模型融合:通过加权平均(均匀权重)合并专家模型,形成统一 SFT 模型。这平衡了准确性和多样性,为 RL 铺平道路。 · 信号阶段(RL):放大正确路径 RL 从 SFT 的“光谱”中挑选并强化最佳推理轨迹。作者引入“最大熵指导政策优化”(MGPO),基于群相对政策优化(GRPO)扩展。GRPO通过采样多组响应计算相对优势,避免外部价值函数的复杂性。MGPO 进一步融入最大熵原理:优先训练不确定性高的样本(准确率接近 50%,即二元分布的最大熵点),用熵偏差正则化加权优势函数。这让模型高效聚焦“高价值”问题,避免浪费计算在已掌握的简单任务上。 RL 分两子阶段:先数学推理(上下文从 16K 扩展到 32K),后编码生成,奖励函数为二元正确性。 此外,论文强调数据净化:使用 10-gram 语义匹配去除训练与测试集重叠,确保成绩真实。训练数据结合开源数据集和合成数据,覆盖数学和编码领域。 实验与结果:小模型的“大逻辑” 在多个基准上评估 VibeThinker-1.5B,包括数学(MATH-500、AIME24/25、HMMT25)、编码(LiveCodeBench V5/V6)和知识(GPQA-Diamond)。评估采用 vLLM 后端,多采样 Pass@1,温度 0.6(数学用 1.0)。 · 与小模型比较:VibeThinker 在子 3B 类别中拔尖,AIME25 达 74.4(Qwen3-1.7B 仅 36.8),HMMT25 达 50.4(SmolLM-3B 仅 26.0),编码 V6 达 51.1(基础模型 0.0)。 · 与大型推理模型比较:数学上小胜 DeepSeek R1(AIME24:80.3 vs. 79.8;AIME25:74.4 vs. 70.0;HMMT25:50.4 vs. 41.7),与 MiniMax-M1-456B 持平。编码稍逊 Magistral Medium(55.9 vs. 59.4)。 · 与顶级非推理模型比较:数学碾压 GPT-4.1(AIME24:80.3 vs. 46.5)和 Kimi K2(49.5),编码胜 Claude Opus 4(51.1 vs. 47.4)。但在 GPQA 知识测试上仍有差距(46.7 vs. 70-82),提示小模型在广域知识上需进一步优化。 这些结果证实 SSP 的有效性:多样性驱动让小模型在推理密集任务中“以小博大”。 讨论与影响:重塑 AI 格局 VibeThinker 的成功源于算法设计而非参数堆积,推理成本降至大型模型的 1/30-1/60,便于边缘部署(推理成本低 20-70 倍)。它暴露了规模定律的局限:小模型潜力被低估,尤其在数学/编码领域。但知识基准的差距表明,未来需加强广义知识注入。 开源模型和技术报告:
显示更多
0
2
32
12
转发到社区