注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 reinforcement
reinforcement 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 reinforcement 的推特
最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。 Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。 课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。 我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。 里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。 而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。 最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。 课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。
显示更多
0
13
259
53
转发到社区
想学强化学习,看论文太硬核,看博客又太碎片,找一份系统又不劝退的入门资料不容易。 《The Little Book of Reinforcement Learning》这本开源书籍,篇幅不长,从基础概念讲到常用算法。 附带全套 PyTorch 代码,书里讲到的每个算法都有可运行的实现,边读边练。 GitHub: 还有一份动态规划的详细推导作为补充,想深入数学细节的可以对照看。 对强化学习感兴趣、想从零入门的朋友,这本小书适合当起点。
显示更多
这两张照片是2024年 @Kimi_Moonshot 邀请我去北京他们办公室时我随手拍的。 当时他们内部邀请了一些朋友去参观他们当时最新的 K0-Math模型。 非常意外的是,那天是杨植麟亲自来给我们分享。 当时杨植麟站在会议室里,没有讲产品,没有讲商业。 他讲的是下一代 Scaling Law。 PPT 上只有一句话: Next-Token Prediction → Reinforcement Learning Scaling 放在2024年,这更像一种判断。 放在2026年,它已经变成了整个行业。 OpenAI、DeepSeek、Anthropic、Kimi,几乎所有前沿模型,都走到了这条路上。 很多人觉得Kimi K3突然变强了。 我倒觉得,它只是兑现了一家公司两年前就做出的技术判断。 还有一个细节。 他不像很多创业者,更不像一个独角兽公司的 CEO,反而特别像个还在实验室里的PhD。 聊商业、聊融资、聊市场,他都很平静。 但一聊到架构、训练方法、数据细节,整个人一下子就兴奋起来了,眼睛都是亮的,能一直不停地讲。 后来我们去他们办公室转了一圈,我特意看了一眼他的工位。 没有独立办公室,没有估值百亿美金AI 独角兽CEO的痕迹,就是一个特别普通的位置,和周围的人没什么区别,桌上放着一些日常用品,但也不多。 那个画面我记到现在。 昨天Kimi发布了K3,轰动了整个海外AI界都,我认识的大部分朋友都在讨论K3具体的参数、架构、榜单。 但我第一反应想到的还是那天坐在会议室里,那个技术讲到停不下来的那个“PhD”。 我始终认为,一家公司最后做出来的东西,往往都会带着创始人的性格。 有些公司擅长讲故事,有些公司擅长做增长,有些公司擅长包装产品。 Kimi有时候会慢,有时候会让外界看不懂,但它一直在啃真正难的技术问题。 从长上下文、数学推理,到今天Kimi在长程任务和Agent上的进展,这条线其实一直没有变过。 很多公司是在追下一波浪潮。 杨植麟更像是很早就选了一条路,然后一直往下挖。 真正厉害的创始人,不是天天预测未来。 而是很多年以后,你发现他一直在建设那个未来。 这个时代每天有很多公司发布模型。 只有少数公司,是在兑现两年前写在PPT上的路线图。 真正的领先,从来不是 Benchmark 第一。 而是两年前没人相信的时候,你就在往那个方向烧钱了。 K3今天取得的伟大成就并不是突然发生的。 两年前,答案其实已经写在那张PPT上了。 祝贺@Kimi_Moonshot ,祝贺杨植麟🎉
显示更多
0
41
595
36
转发到社区
一个中国 crypto trader,在 TikTok 上发了一段 neural network visualization 结果疑似不小心把系统正在 Polymarket 实时交易的画面露出来了 画面里全是蓝色连接线 hidden layers 纵向堆叠 neurons 在屏幕上不断触发 大多数人第一次看时,都忽略了中间一个很小的标签: “Bitcoin XVIII” 他把这条视频包装成一个普通 AI experiment 虚拟水族馆模拟 reinforcement learning “教神经网络学习生存行为。” 这是视频标题 但暂停在 0:16,细节就不对了 Profile: 模型似乎并不是在学习鱼的行为 hidden layer 里的标签,几乎和实时 Bitcoin prediction markets 对上了: price windows directional probabilities volatility ranges 这些信息被直接映射到 neural network 的 nodes 上,而所谓“模拟”还在后台继续运行 然后大家找到了这个 wallet 30 天 profit:$367,385 1,988 predictions 最大单笔 win:$183,000 几乎所有 active positions,都和 Bitcoin range markets 有关 entry price 集中在 94-98¢ 这正是自动化系统最喜欢 farm 的那类低波动 spreads: 赔率很高 空间很小 但可以持续重复 而且不需要人工一直盯着 1 小时内,评论区直接变成 detective board 有人把 TikTok 调到 0.25x 逐帧拼接 neural network 画面 然后把 hidden layer labels 和这个 Polymarket wallet 的 active positions 一一对比 时间点匹配得太精准 观众以为自己在看 AI visualization 但后台看起来更像是一个模型正在实时分类 market conditions,并根据 BTC 短线波动,把交易自动分配到不同 probability buckets 原 TikTok 只有 11,000 views。 但那条曝光 wallet 的 repost,一夜之间超过 600,000 views。 第二天早上,已经有人开始 clone 这个 interface,重建 network layout,并试图弄清楚: 为什么这个账户几乎所有 positions 都集中在 96-99¢,而且投入金额异常高。 最有意思的是: 原作者没有删除任何内容。 Wallet 也仍然 active。 问题是: 这类 Polymarket bot 的 edge,来自预测 BTC,还是来自把实时市场状态映射成可自动执行的概率分组?
显示更多
机器人圈也被 AI 的 scaling 卷麻了 截图是 ICRA 2026 一个数据统计,感觉蛮有意思的,分享一下。比如论文关键词的分布,中美加起来占一半以上的江山。 投稿 4947 篇,接收 1882 篇,接收率 38.04%。2021 年时候投稿量大概 4000 篇左右,机器人圈也在被 AI 的 scaling 卷麻。 Hot topics 是 Manipulation、Planning、Mapping/Perception 3D,SLAM/Localization,Object Detection/ Tracking。 author keyword top 是:Deep Learning for Visual Perception、Reinforcement Learning、Motion and Path Planning、Imitation Learning。 btw,这个数据不是 ICRA 官方做的,是韩国 DGIST 一个助理教授 Giseop Kim 做的,现在vibecoding一个东西变得无比容易。just do it… 想起来去年还写过一场 ICRA 2025 的 keynote 辩论,当时议题是“Data will solve robotics: True or false?” 转眼一年过去了……大家觉得这一年机器人领域的进展快吗?现在关于Data will solve robotics的争论,大家觉得有答案了吗🐶
显示更多
每个人都应该了解的AI 术语名词,你都认识吗? 搞懂这些名词 并了解其实现方式和原理。你基本就入门了。 AGI(类人AI):类似人类思维的AI。 CoT(链式思维):AI一步步思考。 AI Agents(AI代理):自动化决策的程序。 AI Wrapper:简化与AI模型的互动。 AI Alignment(AI对齐):确保AI遵循人类价值观。 Fine-tuning(微调):使用特定训练数据来改进AI。 Hallucination(幻觉):AI编造的信息。 AI Model(AI模型):用于任务的训练AI。 Chatbot(聊天机器人):模拟人类对话的AI。 Compute(计算):AI模型的处理能力。 Computer Vision(计算机视觉):AI理解图像和视频的能力。 Context(上下文):AI为更好响应保留的信息。 Deep Learning(深度学习):通过多层神经网络学习的AI。 Embedding(嵌入):AI的词汇数字化表示。 Explainability(可解释性):理解AI决策背后的逻辑。 Foundation Model(基础模型):可适应任务的大型AI模型。 Generative AI(生成式AI):创建文本、图像等内容。 GPU(图形处理单元):用于快速AI处理的硬件。 Ground Truth(真实数据):AI学习的验证数据。 Inference(推理):AI对新数据做出的预测。 LLM(大型语言模型):用大量文本数据训练的AI。 Machine Learning(机器学习):AI通过数据经验改进。 MCP(模型上下文协议):AI内部数据访问的标准。 NLP(自然语言处理):AI理解人类语言。 Neural Network(神经网络):受大脑启发的AI模型。 Parameters(参数):AI学习的内部变量。 Prompt Engineering(提示工程):创建输入以指导AI输出。 Reasoning Model(推理模型):有逻辑推理能力的AI。 Reinforcement Learning(强化学习):AI通过奖励与惩罚学习。 RAG(检索增强生成):结合搜索与生成的AI。 Supervised Learning(监督学习):在标记数据上训练的AI。 TPU(张量处理单元):AI处理专用芯片。 Tokenization(分词):将文本分割成词片。 Training(训练):通过调整参数教AI。 Transformer(变换器):用于语言理解的AI架构。 Unsupervised Learning(无监督学习):AI在无标签数据上发现模式。 Vibe Coding(情绪编码):通过语言捕捉情绪并预测输出。 Weights(权重):影响AI学习的值。 #AI# #AIAgent#
显示更多
The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。 他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。 GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。 在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。 那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。 后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。 但是 O1 之后,整个行业都发现了 RL 的重要性。 大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。 我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。 这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。 Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。 举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。 但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。 这些就是 Atomic Skills。 进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。 所以,如果 Base Model 的目标变了,预训练的数据自然也会变。 前面说过,GPT-3 时代网页文本占了训练数据的 85%。而现在一些新模型里,这个比例已经降到了 15% 左右,代码反而成了占比最大的数据来源。 背后的逻辑其实很好理解。 现在模型公司已经非常清楚模型需要的关键能力,诸如 Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。 所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近 Agent 任务的数据,也开始提前进入预训练。 这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。 比如我们已经知道,未来模型需要很强的 Coding、Reasoning 和 Agent 能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。 原来只是一段代码,现在可以把它变成找 Bug、修改代码、调用工具、连续完成任务的训练样本。 这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。 模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。 这些变化,也催生了现在经常听到的 Mid-training。 原因也很好理解。 预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对 Reasoning Trace、Agent 交互记录、多轮工具调用、长上下文任务。 前后两个阶段的数据分布差别可能非常大。 如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。 对 MoE 模型来说,这个问题会更加明显,因为预训练过程中不同 Expert 已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。 所以 Mid-training 可以理解成一个过渡阶段。 在正式进入后训练之前,提前让模型适应更长的 Context、更接近 Reasoning 和 Agent 的数据,以及未来真正会遇到的任务分布。 这样 Pre-training 和 Post-training 之间就不会切得那么生硬。 所以整体来看,Pre-training、Mid-training、Post-training、RL 这几个阶段之间的界限,确实已经越来越模糊了。 或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning 和 Reinforcement Learning。 前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。 回到开头那个标题。The Base Model Is Dead 当然是个有点夸张的说法。 Base Model 没有死,真正变化的是它在整个模型训练体系里的角色。 过去我们希望 Base Model 尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为 Reasoning 和 Agent 准备的底子。 先把 Atomic Skills 准备好,再把更多复杂能力留给后面的 RL。 Base Model 依然重要,只是它越来越像一个起点。
显示更多
0
31
38
4
转发到社区