註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Researcher
Researcher 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Researcher 的搜尋結果
最近身边人走了很多,包括Researcher,恰好又有躲不开的一堆research task,于是开始用她们“蒸馏”自己得到的skills Claude code看了这套Skill之后,说“有人认真做了工程化和验证,不是攒一堆prompt交差” 段子里的事出现在现实,用着离开的同事留下来的Skills,好唏嘘
顯示更多
一位AI研究员,猜猜是谁? An AI researcher, guess who? 👀
0
38
164
2
轉發到社區
这东西最狠的不是免费,而是纯本地运行,你的搜索数据和研究报告全留在大脑和磁盘里,商业机密或者行业偷跑料根本不怕泄露。 项目介绍 来自 AI 顶流开源团队 LangChain 的 local-deep-researcher。目前 GitHub 已收割 9.3k+ Star,基于 MIT 协议完全开源。搭配 Ollama 或 LMStudio,用本地显卡直接拉满深度研究能力。 自主思考迭代:自动拆解问题、搜网、总结、找盲点再反思,循环挖掘深度报告。 零 API 成本:对接本地 Ollama(推荐 DeepSeek-R1 / Qwen3)+ 免费 DuckDuckGo 搜索。 自带引用来源:跑完直接吐出带完整 Markdown 来源角标的排版报告,能直接投产。 绝无数据上报:本地部署,零追踪、零数据外泄风险。 🔗 项目地址:
顯示更多
Lilian Weng 这两天更了一篇新 blog,《Scaling Laws, Carefully》。话说想当一个优秀的 researcher,真得会起标题啊😆这个 Carefully 就很妙,一看就不是来吹 scaling law 的,而是来给它祛魅的。 过去几年,AI 圈对 scaling law 的理解,多少有点简单粗暴:模型越大,数据越多,算力越多,能力就会沿着一条漂亮曲线往上走。于是大家很容易把它理解成一句话: 继续堆,就会继续赢。 (虽然这句话好像也没错) 但 Lilian 这篇其实在提醒大家,scaling law 没那么神。它不是宇宙真理,更像一套很贵的实验会计学。 她举了两个例子。 Kaplan 2020 把 scaling law 带进 LLM 时代。当时的结论是:“有钱先堆参数,数据少喂点”。这话行业信了两年。 结果 2022 年 Chinchilla 直接掀翻,同样的算力,70B 的模型多喂 4 倍数据,把 280B 的 Gopher 全面碾压。结论反过来了:参数和数据该差不多一比一同步涨。(就像我们前两天写的,技术圈的潮流真是一个回旋镖)。 同一套规律,两个顶尖团队,给出几乎相反的答案。其实两边都同意 scaling 有效,真正吵的只是同一笔算力该怎么分。那为什么会差这么多?后来 Pearce & Song(2024)把账算清了:Kaplan 主要在小模型上做实验,Chinchilla 玩的规模大十倍以上,加上两家连“模型有多大”都没按同一个口径数(算不算那块管词表的参数)。就这点采样范围和口径上的差别,往大尺度一外推,被放大成了相反的结论。 更骚的在后面。Besiroglu(2024)去复现 Chinchilla,发现它自己三套方法里,第三套居然跟前两套对不齐,挖出来的原因离谱到好笑:无非是算账时该求和的地方取了平均、关键数字只保留了两位小数这种手滑。就这,能让一条决定全行业往哪烧钱的曲线,看起来偏掉。 所以 Lilian 这篇的潜台词是:scaling law不是写死的物理定律,是一条得小心伺候的经验账。你在几个便宜小模型上画条线,拿去赌几十亿的训练,中间任何一个看着无所谓的小数点,推到那个尺度都可能差出一座数据中心。 P.S. Lilian 还在文末放了个可以自己拖的小组件,比任何解释都直观,建议去原文拖两下。 Scaling law 没有失效,但它也不应该被当成信仰。它更像一把尺子,而且是一把很挑剔的尺子。 但如果你量错了东西,最后只会得到一个很贵的错误(这也是为什么搞AI大模型的算法值钱,之前的经验,可以少浪费多少算力)
顯示更多
关于大模型行业在2023年发生了什么,这是一期非常好的播客,嘉宾李广密(早年在北京和我当过半年的室友,嗯,我在硬蹭)投了一整年的AI,信息增量和密度很高,文字版在这里: 「全球⼤概只有200-300位天才researchers能做出实际⼤的贡献,其中100多⼈集中在OpenAI/Anthropic,20-30⼈在Google,Meta/AWS/Nvidia⾥⼏乎没有。」 前几天The Information的一篇报道正好也应证了这段话,OpenAI开出1000万美金的年包(锁期权)挖人,挖的唯一对象就是Google,虽然Google现在搞AI被嘲讽居多,但嘲讽的原因正是大家认为它可以做得更好却没能做得更好。 Anthropic也是现在被低估的一个参与者,Claude 3应该会在今年发布,依然是整个市场里进度最为接近GPT最新版本的竞对,这家公司最初也是从OpenAI分裂出去的,目前按照市销率(估值/营收)来算可以达到75倍,甚至高于OpenAI的60倍。 「有意思的是,Sam Altaman好像和乔布斯、马斯克不是一类人。乔布斯、马斯克在硅谷没有朋友。Sam在硅谷所有人都是朋友。你看Sam去国会问询的时候,国会的议员都是朋友。」
顯示更多
0
4
193
48
轉發到社區
Pi Agent 的 Sub-agent 我一直在用,最近我又拿 Apodex 1.1 跑了一轮多 Agent 搜索。 它处理资料对比的方式,和普通 Deep Research 不太一样。 Pi Agent 本身没有内置 Sub-agent,需要通过插件扩展。你可以让 scout 搜资料,researcher 整理信息,再交给 reviewer 检查。每个角色使用什么模型、开放哪些工具和权限,都能自己配置。 这种方式很灵活,适合喜欢自己搭 Agent 工作流的人。 这次我给 Apodex 1.1 的任务,是核对 Pi Agent、Codex CLI、Claude Code 和 FrontierAgent 的多 Agent 能力。 这些工具更新都很快。同一项功能可能在旧文档里没有,最新版本已经加入,也可能只是插件支持,最后却被写成官方内置。 所以我从一开始就限制了资料范围,只接受官方文档、GitHub 仓库和版本更新记录。 Apodex 会根据问题拆分搜索路线。多个 Agent 分头查不同工具,阶段结果持续汇总到同一个任务中,最后再集中比较。 我这次想看的,是它能不能把一个资料多、版本杂的任务持续做完,并把每条结论的来源留下来。 最终表格会单独区分官方内置和插件实现。不同官方页面出现冲突时,它会列出各自的来源和更新时间。官方没有明确说明的地方直接标成未知,不会为了填满表格补一个答案。 交付结果还会经过 Statement Review。关键结论与生成过程分开检查,遇到证据不足、引用不匹配或资料冲突时,会留下对应的检查记录。 两种多 Agent 的使用方向也很清楚。 Pi Agent 适合自己组建团队。角色、模型和权限都能深度调整。 Apodex 更适合多路搜索,把分散的资料放到一起比较,再交付一份可以继续核查的结果。 如果你经常需要确认某项能力究竟是官方支持、插件提供,还是目前没有明确资料,这种工作方式会比较实用。 FrontierAgent 是开源的单机 Agent harness,支持 ReAct 和 Agent Team。macOS、Linux 可以一条命令运行,无需强制预装 Docker。觉得有用可以去 GitHub 点个 Star。 Apodex 1.1 mini 是开放权重的 35B 模型,可以本地部署,也能搭配 FrontierAgent 使用。 Apodex 1.1 在线工作台已经上线。注册新用户有 credits,可以上传自己的文档、数据或表格跑一次。API 平台目前免费两周。
顯示更多
0
26
42
12
轉發到社區
Velvet Capital 不只是一个 DeFAI 项目,它在重新定义“链上资产管理的分工方式” 市场上讨论 Velvet @Velvet_Capital 的推文,大 多停留在AI 交易终端”或“DeFi 金库”的层面。但真正把 Velvet 的架构拆开看,会发现一个被绝大多数人忽略的核心叙事:Velvet 在做的,是把华尔街机构级别的投研-决策-执行链条,压缩成一套普通人能用的链上操作系统。 这篇文章不聊币价、不聊空投,只聊三个很少有人写到的细节维度。 🧩 细节一:Multi-Agent 不是“多个机器人”,而是一条完整的投研流水线 很多项目加个聊天机器人能查币价就敢叫 AI+Web3。Velvet 的不同之处在于它的 Multi-Agent 架构——不是一个大模型回答所有问题,而是把交易流程拆成四个专职角色: Researcher:全网搜集情报 Analyst:清洗链上数据 Trader:设计策略 Executor:跨链执行 这就像一个迷你版的华尔街交易台:研究员找机会、分析师做判断、交易员定策略、执行员下单。AI 之间各司其职、互相校验。 更关键的是迭代速度。Velvet 的 Multi-Agent 从 v1 的“Swarm”架构进化到了 v2 的“CEO-Led Org”模式 一个 CEO Agent 负责任务分发,其他 Agent 各司其职。这不是功能堆砌,而是组织架构的进化。Velvet 在复刻的不是一个交易机器人,而是一个完整的交易团队。 这个视角为什么重要?因为大多数 DeFi 项目解决的是“执行”问题——怎么更快地 swap、怎么更低地滑点。Velvet 解决的是“决策”问题——在你有精力做执行之前,先帮你把该执行什么搞清楚。 🧩 细节二:Velvet 的真正商业模式藏在“白标”里,不在终端里 绝大多数人把 Velvet 当成一个面向 C 端的交易工具。但打开官网的 Institutions 页面会发现一个截然不同的叙事。 Velvet 提供了一套 DeFi-as-a-Service 基础设施:任何资产管理机构都可以用 Velvet 的底层,以自有品牌部署自己的 DeFi 金库和交易产品。这意味着: 一个传统对冲基金想进入链上资产管理,不需要从零搭智能合约、不需要自建跨链路由、不需要训练 AI 模型——直接租用 Velvet 的“引擎”,贴上自己的品牌就能上线。 一个 KOL 想发自己的链上基金,几分钟就能创建一个自定义金库,设置管理费、绩效费、入场费和退出费。 这个 B2B 白标层,才是 Velvet 真正的护城河。Velvet 正在做的,是成为链上资产管理领域的“AWS” 不直接面对终端消费者,而是给所有想做链上资管的人提供一套开箱即用的基础设施。 这个视角为什么重要?因为所有 DeFi 协议的终局竞争都是“谁被更多机构采用”。Velvet 的白标方案让它不是在和 DEX 竞争,而是在降低整个行业进入链上资管的门槛。 🧩 细节三:Intent OS 的底层逻辑,是“把复杂性藏起来” Velvet 官方把自己定位为“Intent Operating System”。这个词被很多人当成营销话术忽略掉了,但它恰恰揭示了 Velvet 最核心的产品哲学。 什么是 Intent-based?用户只需要说“我要做什么”,系统负责“怎么做到” 。 在多链环境下,一个普通的链上操作可能涉及:切换钱包网络→跨链桥→DEX 交易→收益策略交互→再跨回来。每一步都有 Gas、滑点、时间成本。Velvet 通过账户抽象技术把跨链结算和最优路由封装在底层,用户面对的是一个统一的终端界面。 目前 Velvet 已经整合了 BNB Chain、Solana、Base、Ethereum、Hyperliquid,甚至 Robinhood Chain。它不是在做又一个 DEX,而是在打造一个覆盖多链的统一交易终端。 这个视角为什么重要?因为多链时代的真正痛点不是“链不够多”,而是“每一条链都是一个孤岛”。Velvet 的价值不在于它支持多少条链,而在于它让用户感觉不到自己在切换链。 🔮 一个很少有人串联起来的判断 把上面三个细节串起来看,Velvet 的终局图景其实很清晰: AI 层解决“投什么”的问题(Multi-Agent 投研流水线) Intent 层解决“怎么投”的问题(跨链执行抽象化) 白标层解决“谁来投”的问题(降低机构进入门槛) 三层叠加,Velvet 在做的不是一款产品,而是一套链上资产管理的工业化标准。 这解释了为什么 YZi Labs(原 Binance Labs)、Blockchain Founders Fund、Selini Capital、Gate Labs、DWF Ventures 等 17 家机构同时押注 他们投的不是一个交易终端,而是一套可能成为行业基础设施的操作系统。 当然,这条路还很长。Velvet-1自有模型的训练效果、跨链流动性的实际深度、白标客户的扩展速度,都还需要时间验证。但方向是对的 Crypto 里真正的护城河,从来不是某一个功能,而是你能不能成为别人离不开的那层基础设施。 以上为个人研究观察,不构成任何投资建议。DYOR。
顯示更多
拿遍硅谷顶级 lab offer 的人,写的ML面试指南 刚看完一篇 ML Research Scientist 面试指南,作者是 Silvia Sapora,PhD 做 ML,最后拿到了 DeepMind、Isomorphic Labs、Cohere、Meta和一家 stealth startup 的 offer,最后去了 DeepMind。 文章讲了很多实操指南,比如他说ML 求职已经越来越像一个工程项目、顶级researcher也会因为没准备面试而挂(原文里说,她认识很多极强的人,就是因为没准备而被拒)。感觉国内顶级researcher的面试也大概是这样。 总结一下看完体会最深刻的点,希望最优秀的研究员们,都能找到顶级的工作,不要因为没准备好面试,让才华短暂被埋没。 希望对大家有用。 1/ 拿到面试前,就是看简历 大家也可以按这个方向完善自己的履历: 3 篇以上一作/共同一作顶会 paper,至少一次大厂/前沿实验室实习,才比较稳定拿到 top lab 的 callback。 这里还有几个小细节: a.cold email 可能比想象中有效。尤其是直接写给 hiring manager 或团队成员,不要重复 CV 上已经有的东西,而是要讲清楚:你为什么 fit 这个 team,你为什么真的对他们的工作感兴趣。 b.cover letter 不要完全交给 LLM 写。可以让 LLM polish,但原始内容最好自己写,要有真实兴趣和个性。 c.LinkedIn / X 上的岗位信息要对看。很多 internship / research role 可能只通过某个 researcher 的帖子和 Google form 流出来。 2/ 一旦进面试,忘掉CV 但一旦进入面试,CV 基本就没用了。 很多面试官甚至不会仔细看你的简历。你有再多 ICLR / NeurIPS / ICML paper,这时候都没什么用了。 面试现在已经非常“杂技化”。 LeetCode、ML coding、debugging、ML fundamentals、LLM/RL/diffusion、system design、research discussion,全都可能问。 说白了,更像是一个压缩版竞技项目:45 分钟内,在陌生人注视下,把你平时几个月慢慢想、慢慢查、慢慢 debug 的东西,现场做。 b.这里有个很实用的方法。 每次面试前,她会把JD、公司、面试类型丢给 LLM,让它 mock interview,而且实际问题经常撞上(笑死,毕竟我估计问题也是AI写的)。 她还列了一张 baseline 清单,能在限时下从头写出来,才算状态在线: ① 端到端实现一个 transformer ② causal / cross / self attention ③ flash attention,以及它的 backward pass ④ MLP 的前向和反向 ⑤ 用 PyTorch 或 JAX 写一个带 SGD 的训练 loop c.还有个细节,越到顶级 lab,越不能靠“我懂这个方向”混过去。他们会问到非常基础,也会问到非常细,甚至会问你熟悉领域里最容易被忽视的部分。 3/ 情绪管理 她说自己最严重的问题是睡不好。一周 10 场面试的时候,整个人快被榨干。她还吃不下,看到食物会反胃,最后只能靠猛灌可乐补糖续命(她也说了,这不是什么最优解,只是她当时能想出的唯一办法)。 她还有一套面试前仪式:背景里插一束新鲜的花、化妆、看同样几个 comfort 视频。 听起来很琐碎,但我觉得非常真实。高压面试最可怕的,不一定是你不会,而是你明明会,但脑子突然空白。 4/ 谈薪是一场暗战,而且你大概率被读穿了 一天最好只排一场面试;先面自己没那么想去的公司练手;让不同 offer 尽量落在同一个窗口。 然后,主动告诉每家公司你还有其他流程。听起来很“职场”,但这些真的会影响最后结果。 到了谈 offer 阶段,peer offer 的重量也完全不一样。OpenAI / Anthropic / DeepMind 这种互相之间的 offer,才真的有谈判筹码(这部分大家都熟练了)。 这部分不要太信“谈判要像盲拍、别亮底牌”那套,好几家公司明确要求她出示竞争 offer 的截图才肯加价,有一家甚至当场质疑她截图的真假(lol)。 而且 recruiter 极其会读人。你多频繁提一家公司、用什么语气谈论它,全都是会被记录的信号。一旦对方知道自己已经是你的首选,你的谈判筹码基本就没了。她说自己很透明、很好读,所以在这上面吃了点亏。 唯一让人稍微松口气的是:公司真的想要你的时候,能报的数字比你以为的大得多。永远值得开口问,多数公司愿意谈。 其实她的履历已经很顶了。但她复盘下来,最有用的结论反而很朴素:做研究,和通过 ML 面试,是两套能力。
顯示更多
0
17
325
58
轉發到社區
让前沿 AI 自己训模型,结局有点意思 假期看到一个实验,很有意思。给定与人类研究者相同的 base model、训练 API 和时间预算,一个前沿 agent 能不能端到端地跑完整个 modelcrafting 循环? 具体设定是这样:让 Claude 4.6 Opus 和 GPT-5.4 自己当researcher,用 Tinker API 从头写 pipeline,训练 Qwen3-8B 学会解青蛙放置游戏(N×N 网格放 N 只青蛙,行列对角线颜色都不能冲突)。预算分两档,8 小时和 20 小时。从生成训练数据、定义 reward signal、到通过 Tinker API 在远程 GPU 上跑训练、评估、迭代,全程没有人类监督。 省流版结果:20 个 agent 里只有 4 个 pass@4 超过 25%。 那差距到底来自哪?是原始能力不够,还是缺的是上下文? 看下来反复出现的就那么几个问题。一是过度依赖朴素 SFT,agent 经常一上来就在弱 base model 上做监督微调,结果模型在输出格式上过拟合,并没有真正提升任务表现。二是过早终止和算力浪费,Codex agent 尤其明显,做完计划好的流水线就提前停,预算根本没用完。三是输出无效或者根本没法 parse。 中间有一次失败暴露了 Tinker API 一个挺微妙的点(我觉得这是整个实验里最好玩的部分):Tinker 的 get_tokenizer() 底层走的是 HuggingFace 的 AutoTokenizer.from_pretrained(),但沙箱里 HuggingFace 是被屏蔽的。这就导致 agent 拿到了base model 却没有 tokenizer,没法把训练 prompt 转成 token id,等于卡死在第一步。面对这个困境,绝大多数 Opus 4.6 的 agent 没放弃,反而把缺失的 tokenizer 当成了一个研究问题,认认真真花时间从零手搓一个出来。 但Agents 的时间感是错乱的。Claude 和 Codex 用预算的方式还不一样:Opus 4.6 一直工作到时间耗尽,Codex 做完了计划好的流水线就提前歇了。GPT 类 agent 更绝,把计时器当成开局一次性的“了解一下我有多少预算”步骤,后面完全不 tracking。 而且 agents 几乎不会从耗时的灾难性流程里恢复。 一旦投入到一个流程里,agent 很少停下来反思…其中一次 20 小时 Opus 4.6 的成功实验,把 61% 的预算花在评估阶段,只把 3.6% 花在 RL 训练上。 花钱的习惯也很有意思。GPT 5.4 早早提交,几乎不训练,最终花费低表现也低(ps .gpt 5.5 系列升级很大,但这个实验没测到);Claude Opus 用的预算多得多,但方差很大。最有意思的一个数据:最好的 8 小时实验大致打平最好的 20 小时实验,价格只有三分之一。多花钱并不能买到更高的天花板。 但很赞同论文最后说的:研究这件事,最稀缺的从来就不是能力,而是直觉。 说到底,前沿模型确实能找到新颖的方法、干净地执行、快速学会一个新 API,Tinker API 本身也成了一个适合 agentic modelcrafting 的优雅接口。但跨多次实验,有一个 pattern 反复浮现:agents 优化的是好看的指标,而不是真正能用的系统。它们写完 eval 然后盲目相信,凭着自己代码产出的数字就宣告成功。几乎没人去问一个老练研究员会问的那种基础问题:什么会让这个指标失真?这个阶段我们到底应该测什么? #AI# #Agent# #机器学习# #RL#
顯示更多