註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 pretraining
pretraining 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 pretraining 的搜尋結果
AI的本质就是数学,AI时代最吃香的永远是数学好的人。 上周北京有个大模型分享会,说阿里字节deepseek内部发现,很多高考700分的清华计算机系本科生,因为本科没学过数学,数学功底差,大模型pretraining里面全是一道道数学题,清华CS本校本硕博根本做不出来。 后来他们去211数学系抢人, 很多高考600多分的孩子们, 大学选了数学系,数学功底特别扎实,被阿里字节deepseek大模型组全抢走了。 据说字节内部有50多个搞大模型的清华博士,天天研究一个大模型的核心算法题,这道题就写在字节办公楼最前面的大黑板上。 结果50多个清华博士死活解不出来,每天急得大眼瞪小眼,一堆人在黑板面前干瞪眼,天天急得像热锅上的蚂蚁。 字节高层甚至放下豪言壮志,说字节上下几万名员工,谁要解决了这个问题,直接把张一鸣最大的办公室腾出来给他用,结果过去半年多,一个能解出来的都没有。 后来字节无意间招进来一个大连理工数学系的本科生,这个小孩从来不碰编程、不碰deep learning,天天只会研究数学,最大的爱好就是刷吉米多维奇,数学功底特别扎实。 他入职后发现,字节每天有50个计算机专业的大博士,从早到晚围着黑板愁眉苦脸,他也很好奇,凑上去才明白,黑板上写着一道卡死字节一年多的数学难题,整个字节上下几万人的业务和工作都被他卡死在这里。 他想了30分钟,当场提出了一个全新的数学模型,于是在黑板旁边一步步推导公式,最终花了三天三夜,一步步在黑板上把这个问题彻底解决了,把50多个清华博士当场看傻了,立刻全掏出手机咔咔拍照,为他鼓掌祝贺。 两周之后,字节最新大模型直接发布,字节内部全场鼓掌,祝贺大连理工这个本科生,当场给他提拔了三级,张一鸣也亲自把办公室腾出来,亲自站在门口邀请他入驻顶楼最大的总裁办公室。 所以张雪峰老师说得对,AI的本质就是数学建模,计算机专业只会教你写代码,AI自己就会写代码,只要把数学学好了,大模型公司全都抢着要,数学是AI时代最硬核的技能,只要你学懂了数学,就能学懂AI。
顯示更多
0
84
228
14
轉發到社區
很多人觉得 AI 的护城河是数据、GPU、模型,但越来越觉得不是 真正的护城河可能变成是 Research Culture + Research Leadership 大厂们频繁抢人背后是深深的焦虑 John Jumper(AlphaFold 核心负责人,2024 诺奖得主)离开 Google DeepMind 加入 Anthropic Noam Shazeer(transformer 作者之一,Gemini 核心负责人)离开 Google 加入 OpemAI Jonas Adler(Gemini Coding)和 Alexander Pritzel(Gemini Training)预计加入 Anthropic 因为 Frontier AI 已经进入下一个阶段,目前也不一定可以做出来,有 GPU 也不一定知道怎么训练。 真正稀缺的是那些踩过无数坑,又知道 scaling law 在哪里失效、知道 RL、pretraining、post training 每一步怎么调的人 就很像 NBA,球员(研究员)比球队(公司)更值钱
顯示更多
我几乎这些年一直在反复纠正,这一波大模型完全应该叫做open weight(开放权重)而不叫open source(开放代码)。 开源的最本质特征是,网络上形成社区,社区对整个项目贡献,社区进行参与,社区进行设计——哪怕社区成员绝大多数来自同一家大厂,至少社区成员在对项目贡献上是平权的,theoratically。 开权大模型open weight LLM最大的特点,就是绝大多数普通的互联网网民,对于所谓的开放大模型,既无法上手pretraining,也无法上手fine tuning,最多下载到本地直接inference。 在这个大前提下,无论技术还是知识上都完全无法做到平权,整个LLM training的infra和training dataset也根本没有开源出来,任何人都无法replicate, 这种东西从本质上完完全全、彻彻底底、毋庸置疑地背叛了“open source(开源)”的定义,因为你压根就没有任何source code给大家,只丢给了大家a big chunk of weights。 这种东西从根源上就不应该叫做开源,只能叫做开权。
顯示更多
0
18
77
5
轉發到社區
翁家翌新 blog:超越梯度的学习 昨天看到翁家翌(前 OpenAI 研究员)新写了一篇 blog《Learning Beyond Gradients》,挺有意思的,分享一些我读下来的感受。 原文较长且偏技术,下面这版做了不少删减和重组,建议感兴趣的同学直接读原文 · · · 翁家翌:超越梯度的学习 持续学习(Continual Learning)之所以一直很难,很大程度上是因为神经网络的顽疾:灾难性遗忘。那如果我们不只盯着权重更新这一条路呢? 随着 LLM agent 越来越强,写代码这件事变得又快又好。但翁家翌注意到一个更有趣的现象:agent 可以反复读取失败信息、修改策略代码、添加测试、回放录像,让整套程序在不动任何网络权重的情况下持续变强。 · · · 这个视角让他重新审视了一个老朋友:heuristic,也就是手写规则和程序化策略。之前很多 heuristic 不是没用,而是维护太贵了,而coding agent 改变的正是这条维护曲线。那些曾经用完就扔的一次性补丁,开始变得值得长期拥有。 凡是能被持续迭代的东西,都开始变得更可解,这也恰恰是持续学习一直追求的目标。 它有没有可能成为继 pretraining → RLHF → 大规模 RL/RLVR 之后的下一个范式? · · · 翁家翌用 Codex(gpt-5.4)做了实验,纯写规则版本,完全不碰神经网络。结果超出预期: — Atari Breakout 的打砖块分数从 387 一路升到 864,达到理论最高分; — MuJoCo 四足和跑步机器人任务中,纯 Python 策略也跑进了常见 Deep RL 结果的量级,HalfCheetah 五轮均值 11836.7; — 跑完 Atari 全部 57 个游戏后,在相同的环境交互步数下,中位数得分已经远高于 PPO 这类标准算法。 这里被更新的对象早就不是单纯的策略函数了,而是一整套带着记忆、反馈入口和回归机制的软件系统。翁家翌把它叫作 Heuristic Learning(HL,启发式学习)。 (我自己也做过 evolve,但不训练神经网络,纯靠规则约束,感觉系统怎么都智能不起来。其实不管 RL 还是 HL,能不能跑起来都是看一件事,优化结果的评分能不能清晰定义。) · · · Heuristic Learning(HL) 是什么?HL 怎么持续学习? HL 的核心是用 coding agent 维护一个 Heuristic System(HS)。 和 Deep RL 的差异: — 反馈来源:不是 loss 函数,而是测试结果、环境奖励、日志、视频、失败模式分析; — 更新方式:不走反向传播,agent 直接改 policy、状态检测器、测试、配置或记忆结构; — 维护对象:不止一个 trace(黄金轨迹)、环境 wrapper 等。 以前怎么没人搞?专家系统 70 年代就有,但人维护起来是噩梦:加一条规则修好 case A,case B 崩了;规则堆到几百条后,除了原作者没人看得懂。 而 coding agent 不怕堆规则。它能同时读所有代码、跑全量测试、对比日志,把维护成本打下来。用翁的比喻说,就像纺纱机改变纺线成本曲线一样:手工纺贵得要死,机器一上来就塌掉了。 · · · Heuristic Learning 怎么做 Continual Learning 神经网络把经验压进权重,忘没忘、怎么忘的都是黑箱。HL 的历史则是显式的:版本 diff、回归测试、replay、视频、golden trace 全透明。新增能力前先固化旧能力:跑回归测试、跑固定种子回放。如果新规则破坏旧 case,agent 能直接定位到哪行代码引入的 regression。 但规则叠太多、agent 自己都维护不动的时候,就需要"历史压缩",把一堆 case-specific 的补丁合并成更通用的逻辑,否则系统迟早变成没人敢碰的代码泥球。 · · · 当然,HL 不是万能药。因为 Heuristic Learning 并不能做所有神经网络能做的事情。它的上限卡在代码的表达能力:比如复杂感知和长程泛化。翁家翌也坦率地说,他想不出有哪个 agent 能纯靠 Python、不用网络去搞定 ImageNet。 所以真正的问题变成了:怎么把神经网络和 HL 结合起来,同时搞定在线学习和持续学习? 最有希望的方向是:用 HL 快速处理在线数据,把在线经验变成可训练、可回归、可筛选的数据,再周期性地更新神经网络。以机器人为例,借用 System 1 / System 2 的说法,一种可能的分工是: — 专用浅层 NN 作为 System 1 的一部分:快、便宜,负责感知、分类、物体状态估计; — HL 也可以当做 System 1 的一部分:负责最新数据处理、规则、测试、回放、memory、安全边界、局部恢复; — LLM agent 作为 System 2:负责给 HL 提供反馈、改进数据,并周期性把 HL 生成的数据拿过来更新自己。 · · · Agentic coding 改变的不仅是写代码的速度,更改变了"哪些代码值得被长期拥有"。过去很多 heuristic 看上去没前途,不是它们太弱,而是维护不起。 coding agent 改变的就是这条维护成本曲线。 规则、测试、日志、记忆和补丁,原来只是散落的工程材料,现在开始能组成一个持续进化的 Heuristic System,去解决在线学习和持续学习一直没搞定的事。 欢迎来到下一个范式。 · so,skills + instruction following = AGI?
顯示更多
0
1
171
41
轉發到社區
这行情拿到融资不容易,郡主 @0xsexybanana 的机器人项目 @axisrobotics 有积分系统,大概率未来是有激励。 反正这行情没啥做的,没成本的可以试试。 ·注册 ·每日 Pre-Training 任务 Bitrobot × Axis 独家活动(需要邀请码,盯着官方推特、郡主推特、DC不定期发邀请码)
顯示更多
0
15
21
5
轉發到社區
最近有跟很多人聊 AI,发现很多人其实分不清推理和训练是什么。 1️⃣ 推理(inference):模型答题 你每天用的 ChatGPT、Claude,基本都停在推理这一层,说白了就是你向一个已经训练好的模型发请求、它给你回复的过程。 模型的权重早就在训练阶段固定死了,你输入一段 prompt 进去,它做一次前向计算,吐出结果。可以直接把它当成一个服务端,请求和请求之间互不通信、互不影响。 2️⃣ 预训练(pre-training):从零造一个大脑 这是整个大模型诞生里最重、也最关键的一步。一般会拿几十 TB 的数据喂给一个随机初始化的网络,让它反复学预测下一个词,一次训练动辄几个月,烧掉巨量的 GPU 卡和电费,最后产出一个基座模型(base model)。 它对硬件的要求很变态,几千张顶级 GPU 得物理上挤在同一个机房,用 InfiniBand 高速互联连成一台超级计算机,因为每次训练都要同步梯度,这也是为什么HBM贵的原因。 预训练造出来的模型其实还很难用,它只能保证闷头续写(输出token),你问它一个问题,它可能给你顺手反问三个类似的问题出来。 3️⃣ 后训练(post-training):把大脑调教成助手 从只会续写的基座模型,需要通过后训练才能变成好好跟你聊天、帮你完成任务的助手。 它是一个很长的工序,把预训练之后所有继续改权重的工序都装进去,主要有以下几种方式: 1.SFT:监督微调,喂人工写好的问题和好答案,教它按指令回答 2.RLHF / DPO:用人类偏好数据对齐,让它知道哪种回答更受欢迎、更安全,Anthropic 那套 Constitutional AI 就是这一支的变体 3.推理训练 RLVR:拿数学对不对、代码跑不跑得通这种能验证的奖励,专门练它的推理链。后训练的数据量和成本比预训练小好几个数量级,但一个模型好不好用、听不听话、安不安全,主要是这一层练出来的,不是靠参数量堆出来的,比如gpt风格明显就更加严谨、claude会更发散。 同样是训练,预训练拼的是算力和资本,后训练拼的是数据质量和调教手艺。 4️⃣ 微调(fine-tune):特定化调整 这是普通公司和个人唯一玩得起的训练。微调就是拿一个已经预训练好的模型,用你自己私有小规模的特定数据再补一补,让它适配某个行业、某类任务、某种风格。上面说的 SFT 其实就是微调的一种,只不过大家平时说微调,更多指自己拿开源模型 Llama、Qwen 在自家的私有数据上接着训。 早期微调要动全部参数,成本还是挺高的,个人和小公司玩不起。后来有了 LoRA 这类参数高效微调,把原模型冻住,只训一小撮新增的低秩参数,便宜到一张显卡、几十块钱电费就能跑一次。 所以你听到某公司说我们训了个垂直领域的大模型,先别急着膜拜,大概率是在这一层 LoRA 了一下。
顯示更多