註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 pretraining
pretraining 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 pretraining 的搜尋結果
Vizuara AI Labs 联合创始人、MIT 博士 Raj Dandekar 花 252 美元租一张 H200,从零预训练了一个迷你版 Kimi,把官方代码训不动的坑也一条条写进日志。 《预训练一个迷你 Kimi K3》 《Pretraining a Mini Kimi K3》是一本免费电子书,作者 Dr. Raj Dandekar 是 Vizuara AI Labs 的联合创始人,专门教人从第一性原理构建 LLM。全书是一份完整的预训练工作日志:单张 H200 上花 252.35 美元、喂 50 亿 token,从零预训练出一个 10.2 亿参数的 Kimi K3 复刻版(激活参数 1.45 亿)。 全书 30 个章节、179 张图,约 5 小时读完。开篇把 Moonshot 官方 K3 的配置逐行拆解,再讲缩小的算术:怎么把一个 2.8 万亿参数的模型缩到一张卡能训,而不缩成另一个模型。注意力堆栈(9 层 KDA + 3 层 MLA)、top-6 路由的 MoE、参数计数都单独成章。 数据部分也不省:1048 亿 token、六个来源的语料,训练前用 13-gram 匹配对 8 个 benchmark 做去污染,shard 格式支持中断后从断点续训。 最值钱的是它记录失败。Moonshot 发布的代码有 4 个未文档化的问题,直接跑不起来,作者写了一个绕开它们的训练循环;MoE 的 router 到第 20 步已经杀掉了 94.5% 的专家;跨卡训练还有 3 个不崩溃但悄悄出错的分布式 bug。 提速部分像一份实验笔记:16 次提高 MFU 的尝试只有 3 次成功,失败的那 13 次也原样写下,包括两个反直觉的结果——FP8 和换更大的 GPU 得分反而更差(0.19x)。 全程有数字:loss 从 12.10 降到 2.62,24 次跨训练过程的 benchmark 评测,最后一章直接回答"252 美元到底买到什么"。 适合想自己预训练 MoE 模型、或想弄懂 K3 / DeepSeek 这类架构的人。免费在线阅读,无需付费: 原文: #KimiK3# #MoE# #Pretraining#
顯示更多
0
45
763
168
轉發到社區
AI的本质就是数学,AI时代最吃香的永远是数学好的人。 上周北京有个大模型分享会,说阿里字节deepseek内部发现,很多高考700分的清华计算机系本科生,因为本科没学过数学,数学功底差,大模型pretraining里面全是一道道数学题,清华CS本校本硕博根本做不出来。 后来他们去211数学系抢人, 很多高考600多分的孩子们, 大学选了数学系,数学功底特别扎实,被阿里字节deepseek大模型组全抢走了。 据说字节内部有50多个搞大模型的清华博士,天天研究一个大模型的核心算法题,这道题就写在字节办公楼最前面的大黑板上。 结果50多个清华博士死活解不出来,每天急得大眼瞪小眼,一堆人在黑板面前干瞪眼,天天急得像热锅上的蚂蚁。 字节高层甚至放下豪言壮志,说字节上下几万名员工,谁要解决了这个问题,直接把张一鸣最大的办公室腾出来给他用,结果过去半年多,一个能解出来的都没有。 后来字节无意间招进来一个大连理工数学系的本科生,这个小孩从来不碰编程、不碰deep learning,天天只会研究数学,最大的爱好就是刷吉米多维奇,数学功底特别扎实。 他入职后发现,字节每天有50个计算机专业的大博士,从早到晚围着黑板愁眉苦脸,他也很好奇,凑上去才明白,黑板上写着一道卡死字节一年多的数学难题,整个字节上下几万人的业务和工作都被他卡死在这里。 他想了30分钟,当场提出了一个全新的数学模型,于是在黑板旁边一步步推导公式,最终花了三天三夜,一步步在黑板上把这个问题彻底解决了,把50多个清华博士当场看傻了,立刻全掏出手机咔咔拍照,为他鼓掌祝贺。 两周之后,字节最新大模型直接发布,字节内部全场鼓掌,祝贺大连理工这个本科生,当场给他提拔了三级,张一鸣也亲自把办公室腾出来,亲自站在门口邀请他入驻顶楼最大的总裁办公室。 所以张雪峰老师说得对,AI的本质就是数学建模,计算机专业只会教你写代码,AI自己就会写代码,只要把数学学好了,大模型公司全都抢着要,数学是AI时代最硬核的技能,只要你学懂了数学,就能学懂AI。
顯示更多
0
84
228
14
轉發到社區
很多人觉得 AI 的护城河是数据、GPU、模型,但越来越觉得不是 真正的护城河可能变成是 Research Culture + Research Leadership 大厂们频繁抢人背后是深深的焦虑 John Jumper(AlphaFold 核心负责人,2024 诺奖得主)离开 Google DeepMind 加入 Anthropic Noam Shazeer(transformer 作者之一,Gemini 核心负责人)离开 Google 加入 OpemAI Jonas Adler(Gemini Coding)和 Alexander Pritzel(Gemini Training)预计加入 Anthropic 因为 Frontier AI 已经进入下一个阶段,目前也不一定可以做出来,有 GPU 也不一定知道怎么训练。 真正稀缺的是那些踩过无数坑,又知道 scaling law 在哪里失效、知道 RL、pretraining、post training 每一步怎么调的人 就很像 NBA,球员(研究员)比球队(公司)更值钱
顯示更多
我几乎这些年一直在反复纠正,这一波大模型完全应该叫做open weight(开放权重)而不叫open source(开放代码)。 开源的最本质特征是,网络上形成社区,社区对整个项目贡献,社区进行参与,社区进行设计——哪怕社区成员绝大多数来自同一家大厂,至少社区成员在对项目贡献上是平权的,theoratically。 开权大模型open weight LLM最大的特点,就是绝大多数普通的互联网网民,对于所谓的开放大模型,既无法上手pretraining,也无法上手fine tuning,最多下载到本地直接inference。 在这个大前提下,无论技术还是知识上都完全无法做到平权,整个LLM training的infra和training dataset也根本没有开源出来,任何人都无法replicate, 这种东西从本质上完完全全、彻彻底底、毋庸置疑地背叛了“open source(开源)”的定义,因为你压根就没有任何source code给大家,只丢给了大家a big chunk of weights。 这种东西从根源上就不应该叫做开源,只能叫做开权。
顯示更多
0
18
77
5
轉發到社區
翁家翌新 blog:超越梯度的学习 昨天看到翁家翌(前 OpenAI 研究员)新写了一篇 blog《Learning Beyond Gradients》,挺有意思的,分享一些我读下来的感受。 原文较长且偏技术,下面这版做了不少删减和重组,建议感兴趣的同学直接读原文 · · · 翁家翌:超越梯度的学习 持续学习(Continual Learning)之所以一直很难,很大程度上是因为神经网络的顽疾:灾难性遗忘。那如果我们不只盯着权重更新这一条路呢? 随着 LLM agent 越来越强,写代码这件事变得又快又好。但翁家翌注意到一个更有趣的现象:agent 可以反复读取失败信息、修改策略代码、添加测试、回放录像,让整套程序在不动任何网络权重的情况下持续变强。 · · · 这个视角让他重新审视了一个老朋友:heuristic,也就是手写规则和程序化策略。之前很多 heuristic 不是没用,而是维护太贵了,而coding agent 改变的正是这条维护曲线。那些曾经用完就扔的一次性补丁,开始变得值得长期拥有。 凡是能被持续迭代的东西,都开始变得更可解,这也恰恰是持续学习一直追求的目标。 它有没有可能成为继 pretraining → RLHF → 大规模 RL/RLVR 之后的下一个范式? · · · 翁家翌用 Codex(gpt-5.4)做了实验,纯写规则版本,完全不碰神经网络。结果超出预期: — Atari Breakout 的打砖块分数从 387 一路升到 864,达到理论最高分; — MuJoCo 四足和跑步机器人任务中,纯 Python 策略也跑进了常见 Deep RL 结果的量级,HalfCheetah 五轮均值 11836.7; — 跑完 Atari 全部 57 个游戏后,在相同的环境交互步数下,中位数得分已经远高于 PPO 这类标准算法。 这里被更新的对象早就不是单纯的策略函数了,而是一整套带着记忆、反馈入口和回归机制的软件系统。翁家翌把它叫作 Heuristic Learning(HL,启发式学习)。 (我自己也做过 evolve,但不训练神经网络,纯靠规则约束,感觉系统怎么都智能不起来。其实不管 RL 还是 HL,能不能跑起来都是看一件事,优化结果的评分能不能清晰定义。) · · · Heuristic Learning(HL) 是什么?HL 怎么持续学习? HL 的核心是用 coding agent 维护一个 Heuristic System(HS)。 和 Deep RL 的差异: — 反馈来源:不是 loss 函数,而是测试结果、环境奖励、日志、视频、失败模式分析; — 更新方式:不走反向传播,agent 直接改 policy、状态检测器、测试、配置或记忆结构; — 维护对象:不止一个 trace(黄金轨迹)、环境 wrapper 等。 以前怎么没人搞?专家系统 70 年代就有,但人维护起来是噩梦:加一条规则修好 case A,case B 崩了;规则堆到几百条后,除了原作者没人看得懂。 而 coding agent 不怕堆规则。它能同时读所有代码、跑全量测试、对比日志,把维护成本打下来。用翁的比喻说,就像纺纱机改变纺线成本曲线一样:手工纺贵得要死,机器一上来就塌掉了。 · · · Heuristic Learning 怎么做 Continual Learning 神经网络把经验压进权重,忘没忘、怎么忘的都是黑箱。HL 的历史则是显式的:版本 diff、回归测试、replay、视频、golden trace 全透明。新增能力前先固化旧能力:跑回归测试、跑固定种子回放。如果新规则破坏旧 case,agent 能直接定位到哪行代码引入的 regression。 但规则叠太多、agent 自己都维护不动的时候,就需要"历史压缩",把一堆 case-specific 的补丁合并成更通用的逻辑,否则系统迟早变成没人敢碰的代码泥球。 · · · 当然,HL 不是万能药。因为 Heuristic Learning 并不能做所有神经网络能做的事情。它的上限卡在代码的表达能力:比如复杂感知和长程泛化。翁家翌也坦率地说,他想不出有哪个 agent 能纯靠 Python、不用网络去搞定 ImageNet。 所以真正的问题变成了:怎么把神经网络和 HL 结合起来,同时搞定在线学习和持续学习? 最有希望的方向是:用 HL 快速处理在线数据,把在线经验变成可训练、可回归、可筛选的数据,再周期性地更新神经网络。以机器人为例,借用 System 1 / System 2 的说法,一种可能的分工是: — 专用浅层 NN 作为 System 1 的一部分:快、便宜,负责感知、分类、物体状态估计; — HL 也可以当做 System 1 的一部分:负责最新数据处理、规则、测试、回放、memory、安全边界、局部恢复; — LLM agent 作为 System 2:负责给 HL 提供反馈、改进数据,并周期性把 HL 生成的数据拿过来更新自己。 · · · Agentic coding 改变的不仅是写代码的速度,更改变了"哪些代码值得被长期拥有"。过去很多 heuristic 看上去没前途,不是它们太弱,而是维护不起。 coding agent 改变的就是这条维护成本曲线。 规则、测试、日志、记忆和补丁,原来只是散落的工程材料,现在开始能组成一个持续进化的 Heuristic System,去解决在线学习和持续学习一直没搞定的事。 欢迎来到下一个范式。 · so,skills + instruction following = AGI?
顯示更多
0
1
171
41
轉發到社區
这行情拿到融资不容易,郡主 @0xsexybanana 的机器人项目 @axisrobotics 有积分系统,大概率未来是有激励。 反正这行情没啥做的,没成本的可以试试。 ·注册 ·每日 Pre-Training 任务 Bitrobot × Axis 独家活动(需要邀请码,盯着官方推特、郡主推特、DC不定期发邀请码)
顯示更多
0
15
21
5
轉發到社區
最近很多朋友问我,怎么从 SDE(Software Engineer)转到做 AI Infra 和大模型相关的工作? 或者普通人想做 Pro 级别的 AI 投资者,零基础怎么扫盲,怎么搞懂这么多术语?给大家推荐两个免费的入门友好的 AI 相关学习网站(课) 如果你要做基本的 AI 投资,看完第一个 Stanford CS336 课程也就差不多了。如果想专攻某个领域,可以看看第二个的公开课? 1. Stanford s开课 Stanford CS336 Language Modeling from Scratch 2. @AndrewYNg 创办的学习平台, 里面的课程非常多,点开你就使劲学吧,从 pre-training 到 post-training,从训练到推理,全都涵盖 链接⬇️ 不知道我的 follower 中有多少对这些感兴趣的。可能和投资不直接相关,但我觉得都是很好的认知提升课程。 有时间还是要多看教程、多看课、多读书,武装自己的大脑 如果有朋友感兴趣,我后续可以分享更多
顯示更多
0
48
610
111
轉發到社區
最近有跟很多人聊 AI,发现很多人其实分不清推理和训练是什么。 1️⃣ 推理(inference):模型答题 你每天用的 ChatGPT、Claude,基本都停在推理这一层,说白了就是你向一个已经训练好的模型发请求、它给你回复的过程。 模型的权重早就在训练阶段固定死了,你输入一段 prompt 进去,它做一次前向计算,吐出结果。可以直接把它当成一个服务端,请求和请求之间互不通信、互不影响。 2️⃣ 预训练(pre-training):从零造一个大脑 这是整个大模型诞生里最重、也最关键的一步。一般会拿几十 TB 的数据喂给一个随机初始化的网络,让它反复学预测下一个词,一次训练动辄几个月,烧掉巨量的 GPU 卡和电费,最后产出一个基座模型(base model)。 它对硬件的要求很变态,几千张顶级 GPU 得物理上挤在同一个机房,用 InfiniBand 高速互联连成一台超级计算机,因为每次训练都要同步梯度,这也是为什么HBM贵的原因。 预训练造出来的模型其实还很难用,它只能保证闷头续写(输出token),你问它一个问题,它可能给你顺手反问三个类似的问题出来。 3️⃣ 后训练(post-training):把大脑调教成助手 从只会续写的基座模型,需要通过后训练才能变成好好跟你聊天、帮你完成任务的助手。 它是一个很长的工序,把预训练之后所有继续改权重的工序都装进去,主要有以下几种方式: 1.SFT:监督微调,喂人工写好的问题和好答案,教它按指令回答 2.RLHF / DPO:用人类偏好数据对齐,让它知道哪种回答更受欢迎、更安全,Anthropic 那套 Constitutional AI 就是这一支的变体 3.推理训练 RLVR:拿数学对不对、代码跑不跑得通这种能验证的奖励,专门练它的推理链。后训练的数据量和成本比预训练小好几个数量级,但一个模型好不好用、听不听话、安不安全,主要是这一层练出来的,不是靠参数量堆出来的,比如gpt风格明显就更加严谨、claude会更发散。 同样是训练,预训练拼的是算力和资本,后训练拼的是数据质量和调教手艺。 4️⃣ 微调(fine-tune):特定化调整 这是普通公司和个人唯一玩得起的训练。微调就是拿一个已经预训练好的模型,用你自己私有小规模的特定数据再补一补,让它适配某个行业、某类任务、某种风格。上面说的 SFT 其实就是微调的一种,只不过大家平时说微调,更多指自己拿开源模型 Llama、Qwen 在自家的私有数据上接着训。 早期微调要动全部参数,成本还是挺高的,个人和小公司玩不起。后来有了 LoRA 这类参数高效微调,把原模型冻住,只训一小撮新增的低秩参数,便宜到一张显卡、几十块钱电费就能跑一次。 所以你听到某公司说我们训了个垂直领域的大模型,先别急着膜拜,大概率是在这一层 LoRA 了一下。
顯示更多
Axis @axisrobotics 最近又把任务机制往前推进了一步。 截至 8 月底,平台已经积累了 470 万条有效 Trajectories。 当数据积累达到这个规模后,下一阶段的核心挑战已经不只是持续扩大数据量,而是如何筛选和管理高价值数据。 尤其是那些复杂、高难度、容易失败的任务,应该由具备稳定能力的贡献者来完成,才能保证采集到的数据真正具备训练价值。 Axis 给出的解决方案,就是 Challenger Program。 简单理解,就是把一部分高难机器人任务单独锁起来,只开放给历史表现更稳定的贡献者。 每周会从过去的贡献记录里筛一批白名单,开放大约 20—50 个高难任务。 这部分奖励也更高: 完成一个 Challenger 任务,可以拿普通任务 2—3 倍 Axis Points。 但这个白名单不是看你某一天突然爆肝了多少。 Axis 看的是更长期的表现: 做过多少种不同任务、Pre-training 和 Post-training 有没有持续参与、验证通过率稳不稳,以及同一个任务里能不能长期保持在表现更好的一批里面。 所以一直刷最简单的任务,或者偶尔跑出一次高分,未必有用。 我个人还是挺喜欢这个机制的。 因为机器人训练数据真正有价值的,从来不只是数量。 尤其高难任务,如果全部扔进公共池,最后很容易收回来一堆数量很好看、但训练时不敢直接用的数据。 现在 Axis 相当于开始把贡献者也分层: 普通任务继续开放,让新人熟悉;真正值钱的难题,交给已经证明过自己的人。 这其实也说明,Axis 正从“全民采数据”慢慢走向更细的 数据质量管理。 白名单是每周刷新。如果 Portfolio 里的 Seek the Unseen 徽章亮了,就代表已经进入 Challenger。 高难任务每周一 16:00 SGT 放出,数量有限,先到先得。 UU们,快来和我一起参与吧: @KaitoAI #kaito#
顯示更多
0
112
54
0
轉發到社區
终于等到了国模一哥智谱的财报。 今年上半年收入同比增长接近 400%。我看有人觉得总收入没有预期高,我倒觉得还好。因为国模真正开始大规模商业化,其实也就是最近几个月。 大家可以想想,自己真正觉得国产模型已经可以和 OpenAI、Anthropic 交替着用,大概是什么时候?至少我的感受很明显,就是今年 3 月之后。 所以这轮国产模型能力提升,真正完整反映到收入里,应该是下半年。从 ARR 也能看出来,智谱在财报会上解释,16 亿美元 ARR 是用 8 月单月收入乘以 12 算出来的。 倒推下来,8 月单月收入已经达到 1.33 亿美元,折合人民币大约 9 亿多。 刚刚把智谱财报会听完了,信息量挺大的。我快速写下自己的理解。 1、按照智谱管理层的说法,GLM-5.3 的提升全部来自后续训练。他们扩大了任务环境,把训练内容从普通 Coding 任务,扩展到更加接近专家真实工作的完整任务。 在基础架构、参数等保持一致的情况下,仅仅扩大后训练规模,端到端任务完成率提高超过 50%。 他们认为,决定模型上限的是四个因素的组合:基座规模、有效深度、训练深度、任务环境。 这四个维度的边际收益会不断变化。某个阶段后训练的空间最大,就先把后训练做深。如果后训练吃得差不多了,就再回过头扩大基座参数。 基座继续做大以后,还要考虑激活参数和有效深度之间的平衡,既不能让激活量太大拖慢推理,又要想办法增加每个 Token 实际经历的计算深度。 对于 GLM-5.3,他们的逻辑是,后训练和任务环境还有很大空间,所以先把同一个 Base 榨得更彻底。等这部分收益开始见顶,再考虑回来迭代 Base 模型。 2、所以智谱现在的节奏,并不是每发一个版本就重新训练一次 Base。 像 GLM-5.1、5.2、5.3,都建立在同一个大基座上。智谱会先通过中训练、后训练和任务环境,把这个 Base 的能力尽可能往上推。等这一轮的边际收益开始下降,再切到下一代更大的基座。 现在,他们判断 GLM-5 这一代的后训练已经吃掉了很大一部分空间,所以下一步会重新回到 Base Scaling。 但下一代也绝对不只是简单把总参数继续往上堆。他们想同时做三件事: 第一,把模型的总规模继续做大,抬高能力上限。 第二,控制每次推理真正激活的参数量。因为几 T 的模型如果每个 Token 都激活大量参数,那推理速度肯定会明显下降。 第三,提高有效计算深度。尝试 Loop Transformer 一类的思路,让同一批激活参数经过更多轮计算。这样不需要简单增加激活参数,也可以增加每个 Token 实际经历的计算量。 3、智谱判断,接下来模型可能会出现两条价格曲线。 第一条是,同等智能水平的模型,价格会持续下降。GLM-5.3 Flash 就是在走这条路,用更低的成本提供接近甚至超过上一代旗舰模型的能力。 第二条是,真正能打开新任务边界、明显提高任务成功率的前沿模型,仍然会有溢价,甚至价格还有继续上涨的空间。 所以,现在他们对于模型的定位非常清楚。GLM 5.3 继续探索智能的上限,主要覆盖复杂 Coding、Agent 和高价值任务。GLM-5.3 Flash 则是主打性价比,负责高频、大规模调用。 4、还听到一个有意思的指标叫算力乘数。 简单理解,就是每投入 1 元算力,最后能换回来多少 API 收入。当然,这个算力包括训练和推理两部分。 今年上半年,智谱的算力乘数同比提升了 14 倍。为什么能提高?一方面因为模型变强了,每个 Token 能承担更复杂、更高价值的任务。另一方面 Infra 效率也在提升,完成同样任务需要的成本更低。 感觉这个指标可以一针见血的表达大模型公司的竞争的第一性原理。 5、和国产芯片的结合。GLM-5.3 Flash 上线时,背后已经大规模使用国产芯片集群,6 天跑了 60 多万亿 Token。 接下来更难的是效率和成本。智谱过去半年也明显把更多精力放到了 Infra 上,重新做推理引擎和服务栈,又做了 PD 分离、量化、Layer Split、缓存和通信优化。 同样的国产硬件,端到端服务性能相比最初基线提升了 3 倍,单位 Token 推理成本相比年初下降 80%。 6、智谱也毫不避讳的谈到了中国模型公司的算力约束。 他们的思路是尽量从数据、后训练、任务环境和工程效率中弥补差距。 其实这也是前两天硅谷风投 Dimension 总结的,芯片的出口管制反而逼出了国内极强的工程效率文化。 算力有限的时候,可以先 Scale 数据、后训练和任务环境。推理太贵,就继续做架构和 Infra 优化。等这些方向的收益开始下降,再回头扩大基座。 本质上仍然是刚才说的,同样的算力,怎么尽可能换来更多模型能力。 7、另外,智谱也正面回应了大模型怎么商品化的问题。 他们承认,单次 SOTA 本身很难形成长期定价权。今天 Benchmark 第一,可能几周以后就会被追上。在基础的任务上,模型之间已经没什么差距了。 但同时,模型也不会因此完全变成没有差异的商品。真正能拉开差距的,是模型迭代速度、真实任务完成率、单位智能成本,以及能不能进入客户更深的工作流。 尤其任务越长,模型之间的差距反而越容易被放大。回答一道题可能只差几分,但连续跑几个小时的软件工程任务,中间要调用工具、处理失败、重新规划,最后能不能把任务做完,差距会非常明显。 而且模型一旦进入客户的代码库、工具链和内部工作流,周围还会积累 Prompt、Agent Workflow、权限体系、评测标准和各种工程适配。这个时候换模型,也不只是换一个 API 地址,迁移成本会越来越高。 所以智谱的判断是,简单能力会越来越商品化,但真正能完成复杂任务、进入真实工作流的前沿模型,依然会有很强的差异化和定价权。 8、智谱下一步想做的,是让模型开始参与下一代模型的训练。 现在已经能看到一些早期迹象。比如通过 Model vs Model 自动生成、筛选数据,用 Agent 收集任务、搭训练环境、生成 Verifier,甚至直接参与推理系统的优化。 这些能力目前还散落在不同环节里,但方向已经非常明确。过去需要大量人工完成的数据生产、环境搭建和 Infra 优化,未来都可能逐渐交给模型。 唐杰提到,他们希望进一步把这件事贯穿整个训练流程,从 Pre-training、Mid-training 到 Post-training,都让模型参与进来。他把这个方向叫 Fully Self-training,其实就是 OpenAI 提到的 RSI。 以上,希望对大家有启发。有时间的话,大家还是全部过一次智谱的财报电话会,还是很有启发的。
顯示更多
0
76
34
3
轉發到社區