註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Evacuation
Evacuation 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Evacuation 的搜尋結果
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
顯示更多
0
42
310
35
轉發到社區
World Model × Reward Density:递归自我迭代的真正拐点 过去几个月,讨论 AI 递归自我迭代(Recursive Self-Improvement, RSI)时,关注点几乎都放在模型能力和算力增长上。 但研发系统的实验效率相对模型和算力,可能才是真正的瓶颈。 过去一年,这个系统正在发生两个根本性变化:一是 World Model 快速成熟,二是 AI Model Design 的 Reward Density 持续提高。这两个趋势彼此强化,最终指向同一个结果——AI 研发正在从依赖真实实验,转向依赖模拟、预测与自动验证。 World Model 的意义远不只是让模型理解现实世界,更重要的是让 AI 可以构建越来越接近真实世界的原生模拟环境(Native Simulation World)。过去的模拟器主要依赖人工编写规则、物理公式和专家经验,只能覆盖有限场景;未来的模拟器将越来越多由模型生成,直接学习真实世界中的交通、人类行为、企业经营、材料性质、机器人动力学乃至科学规律。模拟世界将逐渐从 Rule-based 转向 Model-based。 这意味着 Simulation 与 World Model 不再是两个独立模块,而是一个递归系统。真实世界提供数据,训练 World Model;World Model 构建更真实的 Simulation;Simulation 为 AI 提供几乎无限的实验机会;实验产生大量高质量合成数据,再反过来继续优化 World Model。 整个循环可以表示为: Reality → World Model → Simulation → Synthetic Experience → Better World Model → Better Simulation → ... 一旦进入这一循环,Simulation 本身开始成为新的数据源。过去互联网几乎承担了全部训练数据来源;未来互联网、Simulation、机器人和自动实验室将共同构成模型训练的数据基础。其中,Simulation 将成为增长最快的数据来源,因为它几乎没有成本,可以无限复制、暂停、回滚、并行和加速运行。 机器人是最直接的受益者。今天机器人最大的瓶颈并非模型能力,而是真实数据获取速度。现实中,一台机器人一年只能积累几千小时经验,而 Simulation 可以同时运行数百万个机器人,在一天内完成现实世界几年甚至几十年的探索。机器人训练因此会逐渐从 Reality-first 转向 Simulation-first,真实机器人更多承担最终校准,而非主要学习过程。 科学研究也将遵循相同路径。未来药物、材料、催化剂、电池、蛋白质设计等领域,大部分假设将在 Simulation 中完成筛选,仅将最有希望的方案送入真实实验室验证。湿实验将越来越像对 Simulation 的最终确认,而非发现过程本身。 如果说 World Model 解决的是实验环境,那么 Reward Density 解决的是实验反馈速度。 AI Model Design 正在成为所有研发任务中 Reward Density 提升最快的领域之一。过去修改一个 Attention、优化一个训练策略或者调整一个架构,往往需要数周训练才能知道结果,反馈极其稀疏。今天越来越多中间信号已经能够提前提供可靠奖励,包括 Loss Curve、Scaling Prediction、Training Stability、Token Efficiency、Inference Latency、Proxy Benchmark 等。很多决策无需等待完整训练即可获得有效反馈,研发循环开始从周缩短到天、再缩短到小时。 World Model 的加入进一步提高了 Effective Reward Density。过去,一个团队提出一百个模型设计,只能真正训练其中极少数。未来,大部分方案将在 Simulation 中完成预验证,仅保留少数最优设计进入真实训练。单位时间内能够获得的有效反馈数量因此不是线性增加,而可能提高一个甚至多个数量级。 真正发生变化的不是 Reward Density 本身,而是有效 Reward Density: 过去: 100 个想法 → 训练 3 个 → 获得 3 个 Reward。 未来: 100 个想法 → Simulation 验证 95 个 → 训练 5 个 → 获得近百个高质量 Reward。 研发系统开始进入典型的正反馈。 RSI 意味着:Model → Better Model。 但如果拆开来看,其实是: Model → Better World Model → Better Simulation → Better Evaluation → Better Model。 更进一步,World Model 本身也是模型,因此模型不仅开始优化模型,还开始优化整个研发基础设施,包括 Evaluation、Reward Model、Simulation、Compiler、Kernel、Memory System、Chip、Interconnect、Datacenter、Energy 以及 Robot Lab。优化对象从单一模型扩展到整个 Intelligence Stack。 从这个角度看,RSI 的速度可以拆解为五个核心变量: RSI Speed = f(Model Capability × Experiment Speed × Reward Density × Automation Ratio × Compute) 过去几年,模型能力和算力提升最快,而实验速度、Reward Density 和自动化比例一直是限制因素。现在,这三个变量正在同时改善,并形成多个相互强化的反馈环。 Reward Density 提高,实验速度提升;实验速度提升,提高自动化比例;自动化比例提升,进一步增加迭代频率;更高的迭代频率提升模型能力;更强的模型又提升 World Model;更好的 World Model 再提高 Reward Density。 整个系统开始形成真正意义上的递归飞轮,而不是单变量增长。 因此,RSI 更可能表现为阶段性加速,而不是平滑指数增长。每当一个关键瓶颈被突破,例如 Evaluation、Simulation 或 Robot Lab,整个系统都会进入新的增长档位。 基于目前的发展节奏,可以将 RSI 粗略划分为四个阶段。 第一阶段已经开始。AI 能够辅助模型研发,但仍高度依赖人类完成实验、分析和决策,研发循环以周为单位。 第二阶段将在 World Model 和 Reward Density 继续成熟后出现。AI 将能够提出设计、完成 Simulation、自动 Evaluation、自动 Revision,人类只负责批准关键实验,研发循环压缩至小时级。这将是自动 AI Research 真正形成飞轮的起点。 第三阶段将随着 Robot Lab 普及而到来。Simulation 与自动实验室形成闭环,真实实验自动更新 World Model,整个研发流程实现 7×24 小时运行。现实世界逐渐从主要训练场转变为校准场。 第四阶段,也是 RSI 真正意义上的广义扩张。AI 不再只是优化模型,而是持续优化芯片、网络、能源、机器人、制造系统和整个智能基础设施。递归优化对象从 Software 扩展到整个 Physical Intelligence Stack。 基于上述路径,接下来最值得关注的是五个领先指标:AI 完成一次研发迭代所需时间;AI Model Design 的 Reward Density;World Model 对真实训练结果的预测精度;Simulation 与现实实验的一致性;以及整个研发闭环中自动化完成的比例。 这些指标共同决定了递归自我迭代是否真正开始进入加速阶段。 接下来,Simulation 将成为主要训练场,Reality 将成为最终校准场。 当 World Model 足够准确、Reward Density 足够高、Robot Lab 足够自动化之后,AI 将第一次拥有持续、自主、高频率优化自身的实验环境。这并不意味着智能会瞬间爆发,而意味着决定增长速度的约束正在系统性消失。 当研发系统本身成为优化对象时,递归自我迭代才真正开始。
顯示更多
0
29
10
2
轉發到社區
最近看了一篇 career advice 的长文。作者是一家 fully agent-native 公司的 founder,之前在 Scale、OpenAI、Google 都待过。 之前也跟一些行业内的研究员聊到过一个问题:如果你有小孩,在 AI 时代准备怎么教育他?确实啊,AI 把活都干得七七八八了,该让孩子学什么、卷什么? 借着这篇,聊聊我们自己的看法/建议。 1、把注意力放在真正稀缺的资源上 那篇长文里有个细节,我觉得很真实。作者当年手里有量化的 offer,保底现金高不少,但他选了 Scale AI,因为喜欢那里的社区,也想接触不同的产品和应用。后来正是通过 Scale,他认识了做 LLM inference 的那批人,才有了 DeepMind 和 OpenAI 的机会。当年的同事,现在也成了一圈 Scale 系 founder。 回头看,这些人脉和学习机会带给他的东西,远超 quant 多给的那点现金。 他的观念是:现在拿钱比任何时候都容易。vibe-coding 时代,找个快速赚一笔的机会不难。但真正稀缺的,是别人真实的时间,是牢固的人际关系,是你做成过事之后积累的声誉。 我周围也有些朋友,之前不在 AI 圈,但这两年一头扎进来,逐渐走到更核心的位置。他们放弃了安稳打工的收入,选择在 AI 圈摸爬滚打。要的就是这些稀缺资源。 2、学会找题 AI 最先替代的,是定义清楚、可以评分的任务。学校过去训练的大多也是这种能力:题目已经有人出好了,你负责把答案做对。 但 agent 越来越强之后,真正拉开差距的会是:你能不能发现一个值得解决的问题,能不能判断该把多少时间、token 和资源投进去。 答案越来越便宜,好问题越来越贵。 所以如果问 AI 时代该怎么教育小孩,我觉得至少要让他长期待在真实的问题里。自己做项目也好,研究一个没人布置的题目也好。找题的能力不是上课教出来的,是在一次次选错、做砸和重来里长出来的。 3、用 bitter lesson 选公司 Rich Sutton 那篇 bitter lesson 说的是:通用方法加 scaling,最终会赢过任务特化的优化。这条规则拿来选问题、选公司,同样适用。 公司和职业的回报从来都是幂律分布,AI 只是把走到结果的速度加快了。现在写软件门槛这么低,谁都能搭个简单系统,真正持久的价值只会来自对足够有野心的问题的极致专注。 选公司就问两件事:它做的是不是这个问题最有野心的形态?它有没有真的解掉的可能? 选岗位就问一件事:这个位置能不能让你直接在公司要解决的那个问题的最前沿干活? (当然,上述说的是最理想的版本。如果暂时进不了最核心的位置,也看这个岗位能不能让你逐渐靠近核心问题) 4、最后一英里,用冲刺跑 红杉的 Alfred Lin 写过,最后 10% 是 90% 的工作量,也是 90% 的回报。 AI 把结果两极化了,因为中位数水平就是一个 agent 拿着随手写的 prompt 能吐出来的东西。价值只能来自你对某一小片问题的独特视角,或者对细节的执着。 最后一英里靠迭代。而且 coding agent 进步太快,经常更好的做法,是带着上一轮的教训,直接用下一代模型从头再来。 5、xG 和射门效率 足球里 xG(预期进球),衡量一支球队按机会质量算应该进几个球;效率,则是把机会真正转化成进球的比率。 职业生涯很长,不是每个高 xG 的机会都必须抓住。但你得先让自己站在能看见这些机会的位置。 不过人生到某个阶段是要进球的,不能光看见机会,临门一脚的效率也重要。他复盘自己的职业选择时说,大部分决定都做对了,但后悔没有在做决定前,多花一点时间收集信息。 6、researcher 是心态,不是职业 说实话,现在做 research 的门槛前所未有地低。你不需要先进入前沿实验室,才能开始做研究。先大量使用模型,再把直觉沉淀成 evaluation。 前沿实验室里研究员的日常,无非是好奇心驱动着探索新想法,跟 infra 搏斗着把想法实现,把整个系统理解到足够细以便高效 debug、再把结果的价值讲清楚,去换更多算力。 这些事,你不在前沿实验室也全都能做。 所以我越来越觉得,researcher 是一种心态,不是一种职业。这是我整篇文章最想送给大家的一句话。 世界仍然充满机会。解锁的钥匙就是找到有意思的问题,然后交付超出预期的结果。就这么简单,也就这么难。
顯示更多
这次尝试凌辱系列呢!老公为了还债,让妻子被老板凌辱沦为性奴,羞辱调教,边做爱边打电话,鞋交射精。。。In order to repay debts, Husband offers his own wife to her boss: humiliation and sex training, having sex while talking on the phone, shoe-play ejaculation… @ToBulaer @ToBuerma @KawasawaSen @BulmaList
顯示更多
0
57
9.1K
639
轉發到社區