注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 RL-based
RL-based 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 RL-based 的推特
最近如果想系统补一下强化学习,尤其是 LLM post-training,这套 Berkeley CS 185/285 很值得收藏。 Sergey Levine 的 Deep Reinforcement Learning 2026 春季版课程资料已经完整放出来了,昨天课程录像也开始上传到 YouTube。 课程从 imitation learning、Policy Gradient、Actor-Critic、Q-Learning,一直讲到 Model-Based RL、Offline RL 和 Exploration。 我比较感兴趣的是今年还专门加入了「RL with Sequences & LLMs」。 里面会从 RL 的视角重新讲 RLHF、Verifier Reward、GRPO、KL Regularization 这些现在做 LLM post-training 经常看到的东西。 而且不只是听课,Homework 4 直接要求自己实现 GR-REINFORCE 和 GRPO,再真正跑训练实验做对比。 最近 RL、Agent 和 LLM post-training 连得很紧,这套课正好可以把很多零散的概念重新串起来。 课程: YouTube 上搜索 RAIL 的「CS 185/285 (Spring 2026)」播放列表就能看到最新课程录像。
显示更多
0
13
259
53
转发到社区
The Base Model Is Dead,这是我刚看完的一期分享,来自美国开源模型创业公司 Arcee AI 的预训练负责人 Varun Singh。标题有点唬人,但这哥们的观点非常扎实。 他认为,过去 Base Model 的任务,是尽可能吸收人类已有的知识。 GPT-3 那个时代,预训练的逻辑很简单,就是抓取大量互联网文本、Wikipedia、书籍,把尽可能多的人类知识压缩进模型参数里。 在 GPT-3 的训练数据里,来自网页和 Wikipedia 的数据大概占到了 85%。 那个时候大家的默认逻辑就是,模型到底有多强,很大程度上取决于预训练做得好不好。 后训练更多是在这个基础上做最后的行为调整,比如让模型更会聊天、更会遵循指令。RL 在当时的作用也比较有限。 但是 O1 之后,整个行业都发现了 RL 的重要性。 大家开始发现,只要 RL 做得足够好,模型在预训练结束之后,能力还可以继续明显提升。于是就不断加后训练的投入。 我记得之前罗福莉在一个访谈里提过,他们在预训练和后训练上的算力投入已经大致接近。 这也就是说,模型在预训练结束之后并没有定型。后训练已经不只是把模型调得更好用,它开始真正影响模型的最终能力。 Base Model 的角色也因此发生了变化。它越来越像是在给后面的 RL 准备一些原子能力,也就是 Atomic Skills。 举个例子,如果希望通过 RL 训练出一个非常强的 Coding Agent,那 Base Model 在预训练结束的时候,不一定已经能够独立完成十个小时的软件工程任务。 但它最好已经掌握了 Python、代码结构、API、函数调用、Git、文件系统这些基础能力。 这些就是 Atomic Skills。 进入更复杂的任务和环境之后,再通过 RL 学习怎么把这些基础能力组合起来,这样就可以涌现出复杂 Agent 任务的能力。 所以,如果 Base Model 的目标变了,预训练的数据自然也会变。 前面说过,GPT-3 时代网页文本占了训练数据的 85%。而现在一些新模型里,这个比例已经降到了 15% 左右,代码反而成了占比最大的数据来源。 背后的逻辑其实很好理解。 现在模型公司已经非常清楚模型需要的关键能力,诸如 Coding、长程任务等等,那在预训练阶段,就可以有意识地提前给它准备这些能力需要的数据。 所以训练数据开始越来越有目的性。一些过去主要在后训练阶段才会出现的问答、对话,以及更接近 Agent 任务的数据,也开始提前进入预训练。 这种训练逻辑下,合成数据的重要性也开始上升。因为当大家越来越清楚模型未来需要什么能力,然后就可以围绕这些能力,主动去准备更合适的训练数据。 比如我们已经知道,未来模型需要很强的 Coding、Reasoning 和 Agent 能力,那就可以围绕这些目标,主动生成更接近真实任务的数据。 原来只是一段代码,现在可以把它变成找 Bug、修改代码、调用工具、连续完成任务的训练样本。 这样模型在预训练阶段接触到的,就不只是知识本身,也开始包含未来真正要用到的能力。 模型未来需要什么能力,预训练阶段就可以围绕这些能力去设计和生成数据。 这些变化,也催生了现在经常听到的 Mid-training。 原因也很好理解。 预训练阶段模型看到的,过去主要是网页文本、书籍、代码。但到了后训练阶段,它突然要面对 Reasoning Trace、Agent 交互记录、多轮工具调用、长上下文任务。 前后两个阶段的数据分布差别可能非常大。 如果直接从一个阶段跳到另外一个阶段,模型就需要突然适应一套完全不同的数据。 对 MoE 模型来说,这个问题会更加明显,因为预训练过程中不同 Expert 已经逐渐形成了自己的分工,数据分布突然变化,可能会影响原有的负载平衡。 所以 Mid-training 可以理解成一个过渡阶段。 在正式进入后训练之前,提前让模型适应更长的 Context、更接近 Reasoning 和 Agent 的数据,以及未来真正会遇到的任务分布。 这样 Pre-training 和 Post-training 之间就不会切得那么生硬。 所以整体来看,Pre-training、Mid-training、Post-training、RL 这几个阶段之间的界限,确实已经越来越模糊了。 或者换一种理解方式,现在看待模型训练,可以粗略简化成两个大的范式:Supervised Learning 和 Reinforcement Learning。 前者帮助模型建立知识、表征和各种基础能力,后者再让模型进入环境,通过不断探索、试错和反馈,把这些能力组合起来。 回到开头那个标题。The Base Model Is Dead 当然是个有点夸张的说法。 Base Model 没有死,真正变化的是它在整个模型训练体系里的角色。 过去我们希望 Base Model 尽可能把人类知识学进去,然后在这个基础上做一些后训练。现在它越来越像一个为 Reasoning 和 Agent 准备的底子。 先把 Atomic Skills 准备好,再把更多复杂能力留给后面的 RL。 Base Model 依然重要,只是它越来越像一个起点。
显示更多
0
31
38
4
转发到社区
持续学习到底怎么落地?Mind Lab 用 LoRA 给了个解法 刚看 Mind Lab(Mindverse 旗下前沿实验室,成立还不到一年)出了 Macaron-V1 正式版。路线挺特别的,重点不在卷参数,是想让模型能从经验里接着学。 做法是用 LoRA 做后训练 RL,成本只有全参微调的 1/10。LoRA 模块像可插拔的经验单元:聊天、代码、UI、个人助理各训一个,基座共享,跑任务时按需组合(他们叫 MoL)。这么一来,模型就不再是训完定死的一套权重,能不断分化、把新经验吃进去。 感觉挺长一段时间里,LoRA 都被默认成“全参微调的打折平替”。他们这里有个我觉得挺有意思对 LoRA 的重新理解:base model 承载共性,adapter 承载个性(偏好、技能、工具习惯),说白了就是一块可写入、会随交互慢慢变的记忆。也是continual learning 这条路线,我目前看到最工程化的一份答卷。 Macaron-V1-Venti = 744B 的 GLM-5.2 基座 + 4×1B LoRA,一共 748B,原生支持 2M context: L0 Chat 管对话和指令 L1 Agent 管长程、动态工具任务(并入了Preview的OpenClaw LoRA) L2 Coding 管代码、SWE、终端 L3 UI/A2UI 管UI4A渲染和操作 至于为什么要拆成好几个 LoRA,他们的想法是:这些能力的思考流程差太远,全塞进一套 post-training 权重会互相干扰。MoL 让相似的技能共用一个 LoRA,差太多的各自单独训,再路由、组合;新增领域就加一个 adapter。 等 adapter 多起来,再让它们分工、组合、投票,就是他们所说的群体智能。 这条路也不是 Mind Lab 首创,John Schulman(OpenAI 联创、Thinking Machines首席科学家)那篇《LoRA without Regret》就是同一个方向。但全球能开万亿参数模型 RL 训练的 infra,目前就 Mind Lab 和 TML 两家。 不过Mind Lab是直接用国内最好的开源模型,最早2025年底在万亿参数Kimi K2上验证过RL后训练,Preview用GLM-5.1、Venti用GLM-5.2、Tall用Qwen-3.7-35b。拿这些现成的强基座来做,比 TML 从头做 Inkling 会更快(Inkling 现在的表现也明显还打不过 GLM 和 Kimi)。 商业化也很快:据团队披露,7 月启动商业化后2周达到 1000 万美元 ARR。 其实我会关注 Macaron-V1,很大一个背景是持续学习这个方向本身。 持续学习想解决的,是模型部署之后就不再进化这个老问题,让它能在真实使用里边用边学。 这方向最近越来越多重量级的人在点名。之前强化学习之父 Sutton 和 David Silver 提出“the era of experience”,说下一代 AI 拼的不再是喂数据,是从真实经历里持续学,他自己也去创业做了 Oak Lab 专攻这个。梁文锋最近四小时闭门会流出来,他给 DeepSeek 排的路线是 CoT → Agent → 持续学习,还说下一代模型不能持续学习,就不配叫下一代。 Macaron-V1 至少证明了这条路能工程化、也能商业化跑通。这种方向靠一两家撑不起来,挺期待接下来更多团队砸进来、多拿几个硬成果。真卷起来,应该会挺有意思。
显示更多
让前沿 AI 自己训模型,结局有点意思 假期看到一个实验,很有意思。给定与人类研究者相同的 base model、训练 API 和时间预算,一个前沿 agent 能不能端到端地跑完整个 modelcrafting 循环? 具体设定是这样:让 Claude 4.6 Opus 和 GPT-5.4 自己当researcher,用 Tinker API 从头写 pipeline,训练 Qwen3-8B 学会解青蛙放置游戏(N×N 网格放 N 只青蛙,行列对角线颜色都不能冲突)。预算分两档,8 小时和 20 小时。从生成训练数据、定义 reward signal、到通过 Tinker API 在远程 GPU 上跑训练、评估、迭代,全程没有人类监督。 省流版结果:20 个 agent 里只有 4 个 pass@4 超过 25%。 那差距到底来自哪?是原始能力不够,还是缺的是上下文? 看下来反复出现的就那么几个问题。一是过度依赖朴素 SFT,agent 经常一上来就在弱 base model 上做监督微调,结果模型在输出格式上过拟合,并没有真正提升任务表现。二是过早终止和算力浪费,Codex agent 尤其明显,做完计划好的流水线就提前停,预算根本没用完。三是输出无效或者根本没法 parse。 中间有一次失败暴露了 Tinker API 一个挺微妙的点(我觉得这是整个实验里最好玩的部分):Tinker 的 get_tokenizer() 底层走的是 HuggingFace 的 AutoTokenizer.from_pretrained(),但沙箱里 HuggingFace 是被屏蔽的。这就导致 agent 拿到了base model 却没有 tokenizer,没法把训练 prompt 转成 token id,等于卡死在第一步。面对这个困境,绝大多数 Opus 4.6 的 agent 没放弃,反而把缺失的 tokenizer 当成了一个研究问题,认认真真花时间从零手搓一个出来。 但Agents 的时间感是错乱的。Claude 和 Codex 用预算的方式还不一样:Opus 4.6 一直工作到时间耗尽,Codex 做完了计划好的流水线就提前歇了。GPT 类 agent 更绝,把计时器当成开局一次性的“了解一下我有多少预算”步骤,后面完全不 tracking。 而且 agents 几乎不会从耗时的灾难性流程里恢复。 一旦投入到一个流程里,agent 很少停下来反思…其中一次 20 小时 Opus 4.6 的成功实验,把 61% 的预算花在评估阶段,只把 3.6% 花在 RL 训练上。 花钱的习惯也很有意思。GPT 5.4 早早提交,几乎不训练,最终花费低表现也低(ps .gpt 5.5 系列升级很大,但这个实验没测到);Claude Opus 用的预算多得多,但方差很大。最有意思的一个数据:最好的 8 小时实验大致打平最好的 20 小时实验,价格只有三分之一。多花钱并不能买到更高的天花板。 但很赞同论文最后说的:研究这件事,最稀缺的从来就不是能力,而是直觉。 说到底,前沿模型确实能找到新颖的方法、干净地执行、快速学会一个新 API,Tinker API 本身也成了一个适合 agentic modelcrafting 的优雅接口。但跨多次实验,有一个 pattern 反复浮现:agents 优化的是好看的指标,而不是真正能用的系统。它们写完 eval 然后盲目相信,凭着自己代码产出的数字就宣告成功。几乎没人去问一个老练研究员会问的那种基础问题:什么会让这个指标失真?这个阶段我们到底应该测什么? #AI# #Agent# #机器学习# #RL#
显示更多
刚听了SemiAnalysis Weekly的一期视频播客,收获还是很大的,分享一下 1/ ROI与订阅vs API(lab API收入里70%+来自编程) 目前lab API收入里70%+来自编程,且高度集中在少数power公司/用户(如Meta约占Anthropic ARR的3–5%)。Ramp数据显示头部1%公司人均年花10万美元在AI上。 能用订阅就用订阅,因为补贴力度太大:Codex 200刀/月≈12K的API额度,Anthropic 200刀/月≈8K。有初创干脆刷公司卡买一堆订阅账号,比走API划算得多。 算笔账:Claude Max 20x只要10%利用率就打平,而实际利用率远高于此,所以这些20x订阅很可能是负毛利。厂商都想把量往API迁(Anthropic的API毛利估85%+)。 2/ Anthropic利润与两强格局(OpenAI的net-new ARR已和Anthropic持平) Anthropic已经盈利(Q2经营性盈利,Q3可能10亿美元+),靠的是80%+的ARR在高毛利API、90%+是企业客户。 OpenAI杀回来了:GPT-5.5(≈Opus 4.8水平)是拐点,5.6 Soul被评“便宜一半却接近 Fable”。net-new ARR已和Anthropic持平,编程市场从Anthropic一家独大变成两强赛马。 OpenAI消费端9亿+周活但付费转化差(Claude免费用户9%付费,更聚焦);广告是它押在2030年的指望,但消费变现这事一向难做。 3/ 谁是第三名&算力策略 xAI(Grok 4.5/Spark)、Meta(MSL)模型不差,但都不是前沿,没到前沿就没人碰它的API。 Gemini 被判“第五名,可能永远第五”。这里他们觉得,因为Google签了无法收回的长期TPU合约,反映管理层对AGI缺乏信念(Noam Shazeer、John Jumper 等出走)(不过我周围朋友里,还是有一群人看好Google)。 推崇Elon的clawback打法:把算力按市场价3–4倍短租给Anthropic这些,合同带90天召回条款,一旦自己要冲前沿随时收回。Meta要做Neocloud也该学这套,进可攻退可守。 卖自家token>卖别人token(AWS/Azure分成)>短期高价租算力。 4/ MSL与RL scaling law RL是当今提升模型能力最重要的scaling law。有人认为,有人认为模型离“能干人类在电脑上的一切”就差足够的 RL 环境。 于是催生了一整条RL环境创业供应链:把真实的经济任务转成可训练环境卖给lab。今年全行业数据预算估计超100亿美元(去年的10倍),需求几乎无上限,只看你能不能快速产出高质量数据。 Anthropic编程强,一大原因就是它最早、最激进地采购编程数据。 造一个好的编程RL任务:得让顶尖工程师花大概一天才能解,还要配验证器(集成测试+rubric)和一个既严谨无歧义、又自然真实的prompt。单个高质量任务lab愿付五位数美元,做得好的人年入七位数。 5/ Token预算:还在“疯狂烧”还是进入“紧缩期” 不少企业开始收紧预算,怕员工用太多token。但真相是,绝大多数人根本用不到上限,真正受影响的只有每家公司少数几个power user。 管控方式五花八门:按人头vs按公司整体(后者更合理);有的公司把自家模型算进预算、有的不算,于是大家拼命薅那个不计费的。 很多预算策略其实挺外行:Max吐槽有公司禁止销售用Opus/Fable写邮件、要求改用Sonnet,可写封邮件的token成本几乎为零,这么管毫无意义。真正的token大户是编程/软件开发。 也反对搞工程师“特权阶级”,只让他们用Claude Code/Codex,其他人用低配工具。 6/ Token-as-a-Service市场 市场增长极快(较去年翻了好几倍)。三大云(Bedrock/Azure/Vertex)靠现成的企业客户和合规优势拿下大头;Together/Fireworks/Base10这些创业公司也是好生意,但永远做不到OpenAI/Anthropic的体量。 前沿lab不会把优化自家模型的活外包给Fireworks;新芯片创业公司想借token-as-a-service上位也难,最后可能都得像Cerebras一样自己下场做Neocloud。
显示更多
拿遍硅谷顶级 lab offer 的人,写的ML面试指南 刚看完一篇 ML Research Scientist 面试指南,作者是 Silvia Sapora,PhD 做 ML,最后拿到了 DeepMind、Isomorphic Labs、Cohere、Meta和一家 stealth startup 的 offer,最后去了 DeepMind。 文章讲了很多实操指南,比如他说ML 求职已经越来越像一个工程项目、顶级researcher也会因为没准备面试而挂(原文里说,她认识很多极强的人,就是因为没准备而被拒)。感觉国内顶级researcher的面试也大概是这样。 总结一下看完体会最深刻的点,希望最优秀的研究员们,都能找到顶级的工作,不要因为没准备好面试,让才华短暂被埋没。 希望对大家有用。 1/ 拿到面试前,就是看简历 大家也可以按这个方向完善自己的履历: 3 篇以上一作/共同一作顶会 paper,至少一次大厂/前沿实验室实习,才比较稳定拿到 top lab 的 callback。 这里还有几个小细节: a.cold email 可能比想象中有效。尤其是直接写给 hiring manager 或团队成员,不要重复 CV 上已经有的东西,而是要讲清楚:你为什么 fit 这个 team,你为什么真的对他们的工作感兴趣。 b.cover letter 不要完全交给 LLM 写。可以让 LLM polish,但原始内容最好自己写,要有真实兴趣和个性。 c.LinkedIn / X 上的岗位信息要对看。很多 internship / research role 可能只通过某个 researcher 的帖子和 Google form 流出来。 2/ 一旦进面试,忘掉CV 但一旦进入面试,CV 基本就没用了。 很多面试官甚至不会仔细看你的简历。你有再多 ICLR / NeurIPS / ICML paper,这时候都没什么用了。 面试现在已经非常“杂技化”。 LeetCode、ML coding、debugging、ML fundamentals、LLM/RL/diffusion、system design、research discussion,全都可能问。 说白了,更像是一个压缩版竞技项目:45 分钟内,在陌生人注视下,把你平时几个月慢慢想、慢慢查、慢慢 debug 的东西,现场做。 b.这里有个很实用的方法。 每次面试前,她会把JD、公司、面试类型丢给 LLM,让它 mock interview,而且实际问题经常撞上(笑死,毕竟我估计问题也是AI写的)。 她还列了一张 baseline 清单,能在限时下从头写出来,才算状态在线: ① 端到端实现一个 transformer ② causal / cross / self attention ③ flash attention,以及它的 backward pass ④ MLP 的前向和反向 ⑤ 用 PyTorch 或 JAX 写一个带 SGD 的训练 loop c.还有个细节,越到顶级 lab,越不能靠“我懂这个方向”混过去。他们会问到非常基础,也会问到非常细,甚至会问你熟悉领域里最容易被忽视的部分。 3/ 情绪管理 她说自己最严重的问题是睡不好。一周 10 场面试的时候,整个人快被榨干。她还吃不下,看到食物会反胃,最后只能靠猛灌可乐补糖续命(她也说了,这不是什么最优解,只是她当时能想出的唯一办法)。 她还有一套面试前仪式:背景里插一束新鲜的花、化妆、看同样几个 comfort 视频。 听起来很琐碎,但我觉得非常真实。高压面试最可怕的,不一定是你不会,而是你明明会,但脑子突然空白。 4/ 谈薪是一场暗战,而且你大概率被读穿了 一天最好只排一场面试;先面自己没那么想去的公司练手;让不同 offer 尽量落在同一个窗口。 然后,主动告诉每家公司你还有其他流程。听起来很“职场”,但这些真的会影响最后结果。 到了谈 offer 阶段,peer offer 的重量也完全不一样。OpenAI / Anthropic / DeepMind 这种互相之间的 offer,才真的有谈判筹码(这部分大家都熟练了)。 这部分不要太信“谈判要像盲拍、别亮底牌”那套,好几家公司明确要求她出示竞争 offer 的截图才肯加价,有一家甚至当场质疑她截图的真假(lol)。 而且 recruiter 极其会读人。你多频繁提一家公司、用什么语气谈论它,全都是会被记录的信号。一旦对方知道自己已经是你的首选,你的谈判筹码基本就没了。她说自己很透明、很好读,所以在这上面吃了点亏。 唯一让人稍微松口气的是:公司真的想要你的时候,能报的数字比你以为的大得多。永远值得开口问,多数公司愿意谈。 其实她的履历已经很顶了。但她复盘下来,最有用的结论反而很朴素:做研究,和通过 ML 面试,是两套能力。
显示更多
0
17
325
58
转发到社区
小米今天正式发布了MiMo-V2系列旗舰模型,包括 1.MiMo-V2-Pro:总参数超1T(激活42B),专为Agent场景优化,支持1M超长上下文,全球Artificial Analysis排行榜第8、国内第2。 2.MiMo-V2-Omni:全模态基座模型(文本+图像+视频+音频理解),音频理解能力超Gemini 3 Pro。 3.MiMo-V2-TTS:端到端语音合成模型,支持高保真、多语种、自然情感表达。 (ai语音说话) 相关链接 官方API开放平台(接入、定价、文档): (MiMo-V2-Pro API定价:256K内输入$1/百万tokens、输出$3;1M内输入$2、输出$6。注册后可立即获取Key。) 在线体验平台(MiMo Studio,含MiMo Claw Agent演示,直接免费试用MiMo-V2-Pro的Agent能力): (推荐从这里开始玩,网页端就能体验“养龙虾”式的复杂任务,比如自动生成网站、操控工具等。) 初步评测: Artificial Analysis排行榜:MiMo-V2-Pro全球第8(综合智能指数),国内第二 (强调性价比最高之一,尤其在< $0.15/百万tokens价位段霸榜。) OpenClaw标准评测(PinchBench & ClawEval):MiMo-V2-Pro排名全球顶尖(第三,仅次Claude Sonnet 4.6和Opus 4.6)。在无人工干预下,能完成复杂工作流编排、长程规划、精准工具调用。 1M上下文下支撑真实高强度龙虾应用;早期匿名版“Hunter Alpha”在OpenRouter调用量超1T tokens,多日登顶日榜。 作如何和OpenClaw结合? MiMo-V2-Pro就是专为OpenClaw这类Agent框架深度优化的! 小米官方已宣布联合OpenClaw、OpenCode、KiloCode、Blackbox、Cline五大框架团队,提供一周限时免费接口支持(全球开发者都能白嫖)。结合方式:直接用MiMo API替换Claude/OpenAI Key(兼容OpenAI SDK格式),在OpenClaw的Scaffold(脚手架)里接入即可。 模型针对OpenClaw等框架做了深度SFT + RL强化,工具调用、多步推理、长程规划特别稳。 实际表现:在OpenClaw里能一步生成完整网页、自主处理报错/多标签切换、完成选品比价下单、制作短视频等复杂链路,像真人操作浏览器。 小米自己的扩展:他们还出了Xiaomi miclaw(手机端类OpenClaw系统级Agent),基于MiMo系列,能直接“动手操作手机”。 快速上手建议:去 Claw(内置OpenClaw式演示); 或直接在OpenClaw项目里换API Base为
显示更多
RL训练模拟环境市场地图
这篇讲 forecasting RL 预测强化学习的文章挺有意思。 它做的事情可以这样理解: 拿一批已经有结果的历史预测题,让 AI 回到当时的时间点。 但不能让它直接上今天的互联网,否则会偷看到答案。 所以作者搭了一个「时间遮罩」环境: 搜索只能搜当时以前的资料; 网页通过历史快照读取; 金融和趋势数据也只给当时可见的部分。 然后让模型自己查资料、判断证据、输出概率。 等真实结果揭晓后,用 proper scoring rule 给它打分,再用 RL 去强化更好的预测过程。 这点最有意思: 训练的不是一句答案,而是整套预测动作: 查什么、读什么、什么时候停、怎么处理冲突证据、最后给多少概率。 放到预测市场里,我觉得第一步还不是让 AI 自动交易。 更应该先让它保留 forecast diary: 1. 当时概率 2. 使用证据 3. 市场价格 4. 是否会交易 5. 后续结果 6. 错因归类 如果一个系统说 60% 的时候,长期并不像 60%,那它还不是策略,只是会写理由。 如果你也想练习“记录预测 → 等结果 → 校准自己”,可以从小额/模拟开始,把它当预测日记,而不是交易建议。 我自己用的链接: 原文在这里: 我觉得最值得看的不是结论本身,而是它把“预测”拆成了一个可以训练和复盘的过程。
显示更多
在这张 RL 环境公司市场地图中,Benchflow AI 是唯一一家: > 仅获得天使轮融资 > 没有 YC 或 a16z accelerator 背景 > 创始团队没有 PhD、实验室经历或传统学术光环 并且还是 solo founder 模式。 却发出了两篇顶级研究,还收到独角兽的八位数收购报价!
显示更多