注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 ReinforcementLearning
ReinforcementLearning 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 ReinforcementLearning 的推特
想学强化学习,看论文太硬核,看博客又太碎片,找一份系统又不劝退的入门资料不容易。 《The Little Book of Reinforcement Learning》这本开源书籍,篇幅不长,从基础概念讲到常用算法。 附带全套 PyTorch 代码,书里讲到的每个算法都有可运行的实现,边读边练。 GitHub: 还有一份动态规划的详细推导作为补充,想深入数学细节的可以对照看。 对强化学习感兴趣、想从零入门的朋友,这本小书适合当起点。
显示更多
这两张照片是2024年 @Kimi_Moonshot 邀请我去北京他们办公室时我随手拍的。 当时他们内部邀请了一些朋友去参观他们当时最新的 K0-Math模型。 非常意外的是,那天是杨植麟亲自来给我们分享。 当时杨植麟站在会议室里,没有讲产品,没有讲商业。 他讲的是下一代 Scaling Law。 PPT 上只有一句话: Next-Token Prediction → Reinforcement Learning Scaling 放在2024年,这更像一种判断。 放在2026年,它已经变成了整个行业。 OpenAI、DeepSeek、Anthropic、Kimi,几乎所有前沿模型,都走到了这条路上。 很多人觉得Kimi K3突然变强了。 我倒觉得,它只是兑现了一家公司两年前就做出的技术判断。 还有一个细节。 他不像很多创业者,更不像一个独角兽公司的 CEO,反而特别像个还在实验室里的PhD。 聊商业、聊融资、聊市场,他都很平静。 但一聊到架构、训练方法、数据细节,整个人一下子就兴奋起来了,眼睛都是亮的,能一直不停地讲。 后来我们去他们办公室转了一圈,我特意看了一眼他的工位。 没有独立办公室,没有估值百亿美金AI 独角兽CEO的痕迹,就是一个特别普通的位置,和周围的人没什么区别,桌上放着一些日常用品,但也不多。 那个画面我记到现在。 昨天Kimi发布了K3,轰动了整个海外AI界都,我认识的大部分朋友都在讨论K3具体的参数、架构、榜单。 但我第一反应想到的还是那天坐在会议室里,那个技术讲到停不下来的那个“PhD”。 我始终认为,一家公司最后做出来的东西,往往都会带着创始人的性格。 有些公司擅长讲故事,有些公司擅长做增长,有些公司擅长包装产品。 Kimi有时候会慢,有时候会让外界看不懂,但它一直在啃真正难的技术问题。 从长上下文、数学推理,到今天Kimi在长程任务和Agent上的进展,这条线其实一直没有变过。 很多公司是在追下一波浪潮。 杨植麟更像是很早就选了一条路,然后一直往下挖。 真正厉害的创始人,不是天天预测未来。 而是很多年以后,你发现他一直在建设那个未来。 这个时代每天有很多公司发布模型。 只有少数公司,是在兑现两年前写在PPT上的路线图。 真正的领先,从来不是 Benchmark 第一。 而是两年前没人相信的时候,你就在往那个方向烧钱了。 K3今天取得的伟大成就并不是突然发生的。 两年前,答案其实已经写在那张PPT上了。 祝贺@Kimi_Moonshot ,祝贺杨植麟🎉
显示更多
0
41
595
36
转发到社区
一个中国 crypto trader,在 TikTok 上发了一段 neural network visualization 结果疑似不小心把系统正在 Polymarket 实时交易的画面露出来了 画面里全是蓝色连接线 hidden layers 纵向堆叠 neurons 在屏幕上不断触发 大多数人第一次看时,都忽略了中间一个很小的标签: “Bitcoin XVIII” 他把这条视频包装成一个普通 AI experiment 虚拟水族馆模拟 reinforcement learning “教神经网络学习生存行为。” 这是视频标题 但暂停在 0:16,细节就不对了 Profile: 模型似乎并不是在学习鱼的行为 hidden layer 里的标签,几乎和实时 Bitcoin prediction markets 对上了: price windows directional probabilities volatility ranges 这些信息被直接映射到 neural network 的 nodes 上,而所谓“模拟”还在后台继续运行 然后大家找到了这个 wallet 30 天 profit:$367,385 1,988 predictions 最大单笔 win:$183,000 几乎所有 active positions,都和 Bitcoin range markets 有关 entry price 集中在 94-98¢ 这正是自动化系统最喜欢 farm 的那类低波动 spreads: 赔率很高 空间很小 但可以持续重复 而且不需要人工一直盯着 1 小时内,评论区直接变成 detective board 有人把 TikTok 调到 0.25x 逐帧拼接 neural network 画面 然后把 hidden layer labels 和这个 Polymarket wallet 的 active positions 一一对比 时间点匹配得太精准 观众以为自己在看 AI visualization 但后台看起来更像是一个模型正在实时分类 market conditions,并根据 BTC 短线波动,把交易自动分配到不同 probability buckets 原 TikTok 只有 11,000 views。 但那条曝光 wallet 的 repost,一夜之间超过 600,000 views。 第二天早上,已经有人开始 clone 这个 interface,重建 network layout,并试图弄清楚: 为什么这个账户几乎所有 positions 都集中在 96-99¢,而且投入金额异常高。 最有意思的是: 原作者没有删除任何内容。 Wallet 也仍然 active。 问题是: 这类 Polymarket bot 的 edge,来自预测 BTC,还是来自把实时市场状态映射成可自动执行的概率分组?
显示更多
机器人圈也被 AI 的 scaling 卷麻了 截图是 ICRA 2026 一个数据统计,感觉蛮有意思的,分享一下。比如论文关键词的分布,中美加起来占一半以上的江山。 投稿 4947 篇,接收 1882 篇,接收率 38.04%。2021 年时候投稿量大概 4000 篇左右,机器人圈也在被 AI 的 scaling 卷麻。 Hot topics 是 Manipulation、Planning、Mapping/Perception 3D,SLAM/Localization,Object Detection/ Tracking。 author keyword top 是:Deep Learning for Visual Perception、Reinforcement Learning、Motion and Path Planning、Imitation Learning。 btw,这个数据不是 ICRA 官方做的,是韩国 DGIST 一个助理教授 Giseop Kim 做的,现在vibecoding一个东西变得无比容易。just do it… 想起来去年还写过一场 ICRA 2025 的 keynote 辩论,当时议题是“Data will solve robotics: True or false?” 转眼一年过去了……大家觉得这一年机器人领域的进展快吗?现在关于Data will solve robotics的争论,大家觉得有答案了吗🐶
显示更多
每个人都应该了解的AI 术语名词,你都认识吗? 搞懂这些名词 并了解其实现方式和原理。你基本就入门了。 AGI(类人AI):类似人类思维的AI。 CoT(链式思维):AI一步步思考。 AI Agents(AI代理):自动化决策的程序。 AI Wrapper:简化与AI模型的互动。 AI Alignment(AI对齐):确保AI遵循人类价值观。 Fine-tuning(微调):使用特定训练数据来改进AI。 Hallucination(幻觉):AI编造的信息。 AI Model(AI模型):用于任务的训练AI。 Chatbot(聊天机器人):模拟人类对话的AI。 Compute(计算):AI模型的处理能力。 Computer Vision(计算机视觉):AI理解图像和视频的能力。 Context(上下文):AI为更好响应保留的信息。 Deep Learning(深度学习):通过多层神经网络学习的AI。 Embedding(嵌入):AI的词汇数字化表示。 Explainability(可解释性):理解AI决策背后的逻辑。 Foundation Model(基础模型):可适应任务的大型AI模型。 Generative AI(生成式AI):创建文本、图像等内容。 GPU(图形处理单元):用于快速AI处理的硬件。 Ground Truth(真实数据):AI学习的验证数据。 Inference(推理):AI对新数据做出的预测。 LLM(大型语言模型):用大量文本数据训练的AI。 Machine Learning(机器学习):AI通过数据经验改进。 MCP(模型上下文协议):AI内部数据访问的标准。 NLP(自然语言处理):AI理解人类语言。 Neural Network(神经网络):受大脑启发的AI模型。 Parameters(参数):AI学习的内部变量。 Prompt Engineering(提示工程):创建输入以指导AI输出。 Reasoning Model(推理模型):有逻辑推理能力的AI。 Reinforcement Learning(强化学习):AI通过奖励与惩罚学习。 RAG(检索增强生成):结合搜索与生成的AI。 Supervised Learning(监督学习):在标记数据上训练的AI。 TPU(张量处理单元):AI处理专用芯片。 Tokenization(分词):将文本分割成词片。 Training(训练):通过调整参数教AI。 Transformer(变换器):用于语言理解的AI架构。 Unsupervised Learning(无监督学习):AI在无标签数据上发现模式。 Vibe Coding(情绪编码):通过语言捕捉情绪并预测输出。 Weights(权重):影响AI学习的值。 #AI# #AIAgent#
显示更多