注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 PostTraining
PostTraining 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 PostTraining 的推特
这次我想把Post Training里那几秒人工接管再往下拆一层。 @axisrobotics 公开的实验任务,是让机械臂把一块豆腐放到盘子里,Policy先自己执行,出现失败趋势时由人短暂接手,修正后再把控制权交还给Policy。 这里的Correction不是完整示范,而是截取Policy出错位置附近的恢复动作。 ▣ 实验最初收集了660条Correction,第一关是Replay Check,整段操作需要在模拟环境里重新执行并完成任务,660条里有496条通过。 后面还要确认人工接管并非多余,经过Redundancy Filter后剩下416条,其中414条满足短片段测试条件。 到了Recovery Test,人工只修那一小段,控制权重新交回Policy,机器人还要能继续把任务做完。 真正留下的只有161条,平均每段约0.8秒。 ◇ 这套筛选也改变了我的操作习惯。 有一次夹爪已经蹭到物体边缘,我接手后只往侧面调整了一点,把夹爪重新对准目标,确认位置没问题后就点Return to Policy,让机器人自己完成后面的抓取和移动。 ▹ 161条Correction进入训练后,Axis用同一批160个起始状态测试新旧Policy,原Policy完成66次,三次训练分别完成78次,80次和84次。 官方结果能确认完成次数增加,但没有单独拆出具体减少了哪一类失败,我更愿意把它看成Policy整体任务成功表现得到改善。 另一组480个新起始状态里,原Policy完成192次,直接学习完整人类轨迹后降到176次。 换成经过验证的短Correction,Axis还比较了40条,80条和161条三个规模,随着有效修正增加,整体表现继续改善,161条版本三次分别完成236次,235次和225次。 ◈ 现在再看这套机制,我发现Axis筛选Correction时,看的是这段修正到底解决了什么问题,而不是单纯看它持续了多久。 先Replay确认任务能够完成,再判断接管是否发生在Policy确实无法处理的位置,还要经过Recovery Test,验证修正后机器人能否自己继续完成任务。三层筛选都通过,这段Correction才会被留下。 模拟环境里的效果已经有数据支撑,下一篇我想把视线转到真实机械臂上,看看这些经过筛选的修正离开浏览器以后还能不能继续发挥作用。 实验数据来源
显示更多
0
115
92
5
转发到社区
最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。 Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。 课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。 我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。 里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。 而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。 最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。 课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。
显示更多
0
13
259
53
转发到社区
推掉 offer、延毕转AI safety,他一个月重新拿到 offer 刚看完一篇研究员求职复盘,作者 Yong Zheng-Xin,布朗大学五年级 PhD。 他的经历有点特别:读到最后一年,从多语言 / post-training 直接 pivot 到 AI safety,拿了 Astra Fellowship(在 OpenAI 做),为此把毕业推到 2027,还推掉了手上已有的 offer。 后来重启求职,本来计划 7 月才开始面,结果担心 headcount,5 月中就上了,6 月中就拿到满意的 offer,甚至撤掉了一些还在进行的面试。 他写了 6 个让他意外的点,我觉得对正在找 research 岗的人挺有用,整理一下👇 1/ 真正起作用的,可能只有一两篇 paper,甚至一篇都不靠 他多语言方向的 paper 数量远超 safety,还拿过 best paper。但 pivot 之后,这些一篇都没影响到面试结果。 paper 的作用其实就两个:① 敲门,你做过 team 感兴趣的东西,于是被放进 pipeline;② deep dive,research presentation 时聊一篇的动机和细节,有时短到只有 20 分钟。 所以发表数量除了证明 credibility,没那么重要。你随时可以转去一个你觉得更重要的方向,只要在新领域证明够强、team 想要你。 2/ 面试轮次的花样,超出预期 他本来以为就是 fresh-grad SWE 那套:LeetCode + behavioral + 一些 LLM / 深度学习。结果遇到了 system design、并行编程(用 asyncio 手写并发),甚至还有专门评估你“用 AI agent 用得好不”的轮次。 结论很简单:永远预期 wildcard。 3/ Work trial(试岗)越来越常见 他原以为 work trial 只在 AI safety 岗比较常见,结果发现 AI startup 也越来越多。 试岗和 onsite 完全是两回事:不是飞过去面几轮,而是真的跟团队一起做一个任务,有时还是开放式的。通常带薪,但有的线下试岗能持续整整一周。 副作用是:试岗期间你几乎没法准备别家面试,因为得全力扑在当前任务上。同时面多家、又赶时间的话,这点排期要特别小心。 4/ 时机的权重,比你想的大 去年秋天,AI safety 岗极难找,远不如 RL 相关的多;但现在一堆 startup 开始招 safety(比如 Lila、Mechanize)。 几个现实: 你的工作 viral 了,会有一波机构同时来找你,别被打懵,接住这个时机。 你的方向变热,机会整体变多,但窗口可能不到一个月,也可能拖上几个月。 headcount 一定要问 recruiter,尤其你打算推迟、或想同时面多家时。 面试可以试着往后推一两个月,但一旦开面,各轮之间的间隔通常很短。有些岗位还希望你下个月、下下个月就入职(这点能谈)。 5/ Return offer 很稀少 SWE 那边 return offer 基本是常态,research 岗就完全 case-by-case。 他 2024 在 Meta 实习,return 全职 offer 很少,高度依赖 headcount 和 team,身边不少人没拿到。他在 OpenAI 做 Astra fellowship,最后也还是和所有应聘者一样走完了全部面试轮。听说有的机构更快,如果 team match 成了,再补一两轮就行。 6/ 很多面试,跟你的方向根本没关系 他从能力研究(多语言)转到 safety,本以为 safety 相关的面试会占大头。 结果并不是。他遇到很多轮跟 safety 毫无关系,甚至跟他研究兴趣都不沾边。有些地方还是在考你“作为一个 AI researcher 够不够全面”。 他觉得这有道理(领域跑得快,基本功值得查),但预期还是落空了。也许 senior 岗会不一样。 前两天刚写完 Silvia Sapora 那篇顶级 ML Research Scientist 面试指南,这篇刚好补充了另外一个视角。
显示更多
最近很多朋友问我,怎么从 SDE(Software Engineer)转到做 AI Infra 和大模型相关的工作? 或者普通人想做 Pro 级别的 AI 投资者,零基础怎么扫盲,怎么搞懂这么多术语?给大家推荐两个免费的入门友好的 AI 相关学习网站(课) 如果你要做基本的 AI 投资,看完第一个 Stanford CS336 课程也就差不多了。如果想专攻某个领域,可以看看第二个的公开课? 1. Stanford s开课 Stanford CS336 Language Modeling from Scratch 2. @AndrewYNg 创办的学习平台, 里面的课程非常多,点开你就使劲学吧,从 pre-training 到 post-training,从训练到推理,全都涵盖 链接⬇️ 不知道我的 follower 中有多少对这些感兴趣的。可能和投资不直接相关,但我觉得都是很好的认知提升课程。 有时间还是要多看教程、多看课、多读书,武装自己的大脑 如果有朋友感兴趣,我后续可以分享更多
显示更多
0
46
528
88
转发到社区
Agent 出错以后,到底该修模型,还是修 harness? Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。 今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。 比如 Agent 忽略了一条早期指令。 可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。 论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。 这样一次失败就能进一步回答: 该做模型 post-training,改 context / memory / tool,还是重新设计环境和评测。 作者还让不同前沿模型独立给失败案例分类,最好的结果与人工标注达到 Cohen’s κ = 0.76,说明这套分类有一定一致性。 我觉得这篇很适合现在的 Agent 发展阶段。 随着 harness 越做越复杂,「Agent 失败了」这个结论已经太粗了。 真正有用的 debugging,要继续追到第一处无法恢复的错误,再决定到底该修哪一层。 📎 arxiv:
显示更多
0
83
446
76
转发到社区
很多人觉得 AI 的护城河是数据、GPU、模型,但越来越觉得不是 真正的护城河可能变成是 Research Culture + Research Leadership 大厂们频繁抢人背后是深深的焦虑 John Jumper(AlphaFold 核心负责人,2024 诺奖得主)离开 Google DeepMind 加入 Anthropic Noam Shazeer(transformer 作者之一,Gemini 核心负责人)离开 Google 加入 OpemAI Jonas Adler(Gemini Coding)和 Alexander Pritzel(Gemini Training)预计加入 Anthropic 因为 Frontier AI 已经进入下一个阶段,目前也不一定可以做出来,有 GPU 也不一定知道怎么训练。 真正稀缺的是那些踩过无数坑,又知道 scaling law 在哪里失效、知道 RL、pretraining、post training 每一步怎么调的人 就很像 NBA,球员(研究员)比球队(公司)更值钱
显示更多
持续学习到底怎么落地?Mind Lab 用 LoRA 给了个解法 刚看 Mind Lab(Mindverse 旗下前沿实验室,成立还不到一年)出了 Macaron-V1 正式版。路线挺特别的,重点不在卷参数,是想让模型能从经验里接着学。 做法是用 LoRA 做后训练 RL,成本只有全参微调的 1/10。LoRA 模块像可插拔的经验单元:聊天、代码、UI、个人助理各训一个,基座共享,跑任务时按需组合(他们叫 MoL)。这么一来,模型就不再是训完定死的一套权重,能不断分化、把新经验吃进去。 感觉挺长一段时间里,LoRA 都被默认成“全参微调的打折平替”。他们这里有个我觉得挺有意思对 LoRA 的重新理解:base model 承载共性,adapter 承载个性(偏好、技能、工具习惯),说白了就是一块可写入、会随交互慢慢变的记忆。也是continual learning 这条路线,我目前看到最工程化的一份答卷。 Macaron-V1-Venti = 744B 的 GLM-5.2 基座 + 4×1B LoRA,一共 748B,原生支持 2M context: L0 Chat 管对话和指令 L1 Agent 管长程、动态工具任务(并入了Preview的OpenClaw LoRA) L2 Coding 管代码、SWE、终端 L3 UI/A2UI 管UI4A渲染和操作 至于为什么要拆成好几个 LoRA,他们的想法是:这些能力的思考流程差太远,全塞进一套 post-training 权重会互相干扰。MoL 让相似的技能共用一个 LoRA,差太多的各自单独训,再路由、组合;新增领域就加一个 adapter。 等 adapter 多起来,再让它们分工、组合、投票,就是他们所说的群体智能。 这条路也不是 Mind Lab 首创,John Schulman(OpenAI 联创、Thinking Machines首席科学家)那篇《LoRA without Regret》就是同一个方向。但全球能开万亿参数模型 RL 训练的 infra,目前就 Mind Lab 和 TML 两家。 不过Mind Lab是直接用国内最好的开源模型,最早2025年底在万亿参数Kimi K2上验证过RL后训练,Preview用GLM-5.1、Venti用GLM-5.2、Tall用Qwen-3.7-35b。拿这些现成的强基座来做,比 TML 从头做 Inkling 会更快(Inkling 现在的表现也明显还打不过 GLM 和 Kimi)。 商业化也很快:据团队披露,7 月启动商业化后2周达到 1000 万美元 ARR。 其实我会关注 Macaron-V1,很大一个背景是持续学习这个方向本身。 持续学习想解决的,是模型部署之后就不再进化这个老问题,让它能在真实使用里边用边学。 这方向最近越来越多重量级的人在点名。之前强化学习之父 Sutton 和 David Silver 提出“the era of experience”,说下一代 AI 拼的不再是喂数据,是从真实经历里持续学,他自己也去创业做了 Oak Lab 专攻这个。梁文锋最近四小时闭门会流出来,他给 DeepSeek 排的路线是 CoT → Agent → 持续学习,还说下一代模型不能持续学习,就不配叫下一代。 Macaron-V1 至少证明了这条路能工程化、也能商业化跑通。这种方向靠一两家撑不起来,挺期待接下来更多团队砸进来、多拿几个硬成果。真卷起来,应该会挺有意思。
显示更多
最近有跟很多人聊 AI,发现很多人其实分不清推理和训练是什么。 1️⃣ 推理(inference):模型答题 你每天用的 ChatGPT、Claude,基本都停在推理这一层,说白了就是你向一个已经训练好的模型发请求、它给你回复的过程。 模型的权重早就在训练阶段固定死了,你输入一段 prompt 进去,它做一次前向计算,吐出结果。可以直接把它当成一个服务端,请求和请求之间互不通信、互不影响。 2️⃣ 预训练(pre-training):从零造一个大脑 这是整个大模型诞生里最重、也最关键的一步。一般会拿几十 TB 的数据喂给一个随机初始化的网络,让它反复学预测下一个词,一次训练动辄几个月,烧掉巨量的 GPU 卡和电费,最后产出一个基座模型(base model)。 它对硬件的要求很变态,几千张顶级 GPU 得物理上挤在同一个机房,用 InfiniBand 高速互联连成一台超级计算机,因为每次训练都要同步梯度,这也是为什么HBM贵的原因。 预训练造出来的模型其实还很难用,它只能保证闷头续写(输出token),你问它一个问题,它可能给你顺手反问三个类似的问题出来。 3️⃣ 后训练(post-training):把大脑调教成助手 从只会续写的基座模型,需要通过后训练才能变成好好跟你聊天、帮你完成任务的助手。 它是一个很长的工序,把预训练之后所有继续改权重的工序都装进去,主要有以下几种方式: 1.SFT:监督微调,喂人工写好的问题和好答案,教它按指令回答 2.RLHF / DPO:用人类偏好数据对齐,让它知道哪种回答更受欢迎、更安全,Anthropic 那套 Constitutional AI 就是这一支的变体 3.推理训练 RLVR:拿数学对不对、代码跑不跑得通这种能验证的奖励,专门练它的推理链。后训练的数据量和成本比预训练小好几个数量级,但一个模型好不好用、听不听话、安不安全,主要是这一层练出来的,不是靠参数量堆出来的,比如gpt风格明显就更加严谨、claude会更发散。 同样是训练,预训练拼的是算力和资本,后训练拼的是数据质量和调教手艺。 4️⃣ 微调(fine-tune):特定化调整 这是普通公司和个人唯一玩得起的训练。微调就是拿一个已经预训练好的模型,用你自己私有小规模的特定数据再补一补,让它适配某个行业、某类任务、某种风格。上面说的 SFT 其实就是微调的一种,只不过大家平时说微调,更多指自己拿开源模型 Llama、Qwen 在自家的私有数据上接着训。 早期微调要动全部参数,成本还是挺高的,个人和小公司玩不起。后来有了 LoRA 这类参数高效微调,把原模型冻住,只训一小撮新增的低秩参数,便宜到一张显卡、几十块钱电费就能跑一次。 所以你听到某公司说我们训了个垂直领域的大模型,先别急着膜拜,大概率是在这一层 LoRA 了一下。
显示更多
一篇不错的解读:《META出租H100与购买先进算力并不矛盾》 Meta 做 NeoCloud 与继续租 Crusoe 1.6GW,并不矛盾 昨天盘前,Meta 被报道正在考虑把多余 AI 算力对外商业化,甚至做成类似 NeoCloud 的业务。市场第一反应非常剧烈:Meta 盘前上涨接近 6%,但 AI算力和 neocloud 相关股票则受到负面 Narrative 影响, 市场担心的是:如果 Meta 也开始把 GPU 算力对外卖,是否会直接导致算力过剩? 这个反应可以理解,但我们认为市场把问题想简单了。 首先,Meta 这件事本质上不是“AI 算力需求见顶”,也不是“Meta 不需要继续买算力”。相反,Meta 同时还在继续锁定非常大规模的新算力。根据 Bloomberg/Reuters 报道,Meta 最近与 Crusoe 签署了新的 AI computing capacity 协议,将从 Crusoe 位于 Texas Childress 和 Missouri Warrenton 的两个数据中心获得合计约 1.6GW 的容量。 同时,Meta还在向其他Neocloud购买算力。我们在去年3Q25 META Preview中就提到过META正在向NeoCloud寻求购买3GW算力。 所以表面上看,这里确实有一个矛盾:如果 Meta 自己已经有多余算力,为什么还要继续向 Crusoe 租 1.6GW? 我们的理解是,这不是矛盾,而是算力代际切换。 过去两年,Meta 已经采购和部署了大量 H100/H200。这些 GPU 不是没价值,恰恰相反,它们对 inference、fine-tuning、企业模型服务、图像/视频生成、传统 ML workload 仍然非常有价值。但对于下一代 frontier model training,尤其是 3T+ 参数规模的 MoE、长上下文、多模态和 RL-heavy post-training,H100/H200 的训练经济性会明显下降。 关键不是 H100 不能训练,而是单位有效 token 成本变差。 当模型进入 3T+ 规模后,瓶颈不再只是单卡 FLOPS,而是 HBM 容量/带宽、GPU 间通信、scale-up 网络、checkpoint/restart、expert routing、sequence parallel、pipeline bubble、以及大规模 collective communication。H100 集群当然还能跑,但训练 wall-clock 更长,通信开销更高,集群利用率更难维持,最终表现为同样训练一个 frontier model,成本和时间都不如 GB200/GB300,未来更不如 Vera Rubin。 因此,Meta 现在面对的是一个很典型的资产配置问题: 最先进的 GB200/GB300/Rubin,要优先留给下一代模型训练;上一代 H100/H200,则应该尽量转成 inference 或外部商业化收入。 这也是为什么“做 NeoCloud”和“继续租 Crusoe 1.6GW”可以同时成立。 Meta 继续向 Crusoe 锁定 1.6GW,本质上是在为更长期、更先进、更大规模的 AI infrastructure 做准备。这种资源对于 Meta 来说,更多是未来 GB200/GB300/Rubin 时代的战略性产能,而不是简单补 H100 的缺口。 另一方面,Meta 既然已经买了大量 H100/H200,就不可能让这些资产在 frontier training 代际切换后闲置。Meta 内部当然有广告、推荐、内容排序等大量推理 workload,但这和 OpenAI/Anthropic 那种直接面向外部客户卖 token 的 LLM inference 业务并不完全一样。Meta 如果没有足够多可以直接 monetization 的外部 token demand,把 H100/H200 做成 cloud capacity 或 hosted model API 对外销售,是非常合理的资本回收方式。 这其实和 xAI / SpaceX 的思路有相似之处。xAI 今年公开宣布与 Anthropic 达成 compute partnership,向 Anthropic 提供 Colossus 1 算力;xAI 官方称 Colossus 1 包含超过 22 万张 NVIDIA GPU,包括 H100、H200 和 GB200,并可支持 training、fine-tuning、inference 和 HPC workload。(xAI) 这说明即使是 frontier AI 公司,也可能把一部分已有 GPU fleet 对外出租,同时把最新、最稀缺、训练效率最高的下一代集群保留给自己的 frontier model。 所以今天市场担心“Meta 进入 NeoCloud 会打垮所有 NeoCloud”,我们觉得有些过度。 更准确的判断应该是: AI 算力市场正在从单一的 GPU shortage,进入多代 GPU 分层定价和分层使用阶段。 第一层是最新训练算力:GB300、Rubin,以及后续更大 scale-up domain 的系统,主要服务 frontier model training。这部分供给仍然稀缺,客户仍然会向 Crusoe、CoreWeave、Nebius、Oracle、Microsoft 等各类供应商锁产能。 第二层是上一代高端算力:H100/H200/部分 GB200,更适合 inference、fine-tuning、enterprise AI、hosted model、agent workload 和中小模型训练。这部分不是没有需求,而是从“最稀缺的训练资源”变成“可以规模化商业化的推理资源”。 第三层是更通用的 GPU cloud 和 long-tail enterprise workload,对价格更敏感,但需求弹性也更大。 在这个框架下,Meta 的行为其实很合理:它不是停止建设 AI infrastructure,而是在把不同代际的 GPU 放到最适合的经济用途上。 因此,我们不认为这是 AI infrastructure 的大问题。真正重要的判断是:下一代 frontier model training 对 GB200/GB300/Rubin 的需求仍然非常强;同时,H100/H200 这类上一代 GPU 也不会被废弃,而会进入 inference monetization 和外部算力销售阶段。 这对整个 AI supply chain 的含义反而是: GPU fleet 开始变成多代际资产,而不是一次性训练工具。旧 GPU 不归零,新 GPU 继续稀缺。Meta 做 NeoCloud,不是需求崩了,而是算力资产终于开始金融化和商业化。
显示更多
今天看了个 Baseten CEO Tuhin Srivastava 谈 AI 推理危机的播客 一句话核心:推理正在变成 AI 行业最后一个也是最大的市场。 算力极度紧缺,谁能拿到 GPU 并做出足够好的软件层,谁就能赢。 Tuhin 透露了几个硬核数据: • Baseten 过去一年增长 30 倍,今年预期收入超 10 亿美元 • 他们的 GPU 集群利用率在中高位 90% • 目前覆盖 18 个云厂商、全球 90 个集群,新云厂商引入到整个推理栈上线只需半天 • 95% 以上的 token 在跑自定义模型,几乎没人用原版开源权重,客户都在用自己的数据微调 关于开源模型和地缘政治,Tuhin 的态度很务实: DeepSeek 和 Moonshot 这些中国模型真的非常好。如果把深寻当 Meta 的模型来用、来准备,比纠结它的来源更有意义。 他同时强调美国确实需要自己的开源模型:五家中国实验室在做开源模型,我们连一个都设得如此艰难,这本身就很说明问题。 关于算力市场的现实: 现在从好的云厂商拿 1000 张 B200,至少需要 3-5 年合同 + 20-30% TCV 预付款。 不仅是产能短缺,能真正运营好数据中心的靠谱供应商也极少——可能只有十几个像样的云,其中只有三四个是金牌级别的。 最有意思的是他对 agent 和推理反馈循环的判断:推理和 post-training 是一体两面。推理产生数据,数据用来评估,评估结果用来 post-training,形成整个循环。计算成本越低,意味着可以在更多地方嵌入更多智能。这就是 Jevons Paradox 在 AI 领域的体现。
显示更多