註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Xiuyu Li
@sheriyuo
Researcher @StepFun_ai | Working on long-horizon tasks | Prev @RUC1937 | Opinions are my own
1.9K 正在關注    14.6K 粉絲
Step 5 Preview 在真实 API 计价下处在 AA Intelligence (图1)和 Terminal-Bench 4(图2) 的帕累托前沿! Step 5 Preview 的真实 API 计价为:$0.00350/Mtokens,Max Plan。(采用低缓存命中统一负载:85%/14.65%/0.35%,缓存命中输入/输入/输出) 值得一提的是,Step 5 采用的统一负载为低缓存负载,目前仅 Gemini 和 Step 5 采用该负载,(似乎因为基础设施的原因,这两个模型的缓存命中很难进一步提升了)。若缓存命中率提高,Step 5 Preview 将会处在一个更前沿的位置🥳
顯示更多
Step 确实是好起来了。群里和大家聊,大家也觉得体感不错。说实话,做任务设计的时候表现比 Sol 做得还更好,很神奇。 用它做这个射击游戏,当时30分钟直接一次做完,也没调整过,做完就可用,没什么bug。审美也很好。 没有开 goal,然后一次30分钟做了一个完整的任务,说明长程任务表现也很不错。
顯示更多
0
31
44
1
轉發到社區
DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。
顯示更多
0
107
840
82
轉發到社區
看了一眼评论区几乎全是骂的 😥 DeepSeek 的行事风格一向如此,习惯就好,为什么要用看待所谓产品公司的角度压力一只蓝色大肥鱼呢 AGI 才是最重要的,别打扰 AGI 训练
顯示更多
鉴于 DS V4.1 Flash 模型在性能、费用、速度、总用时等各项指标上都全面超越了 V4 Pro。再以更高的价格、更慢的速度和更多的算力消耗给 DS 用户提供原有的性能较差的 V4 Pro 模型会不太合适。V4.1 Flash 正式上线之后,V4.1 Pro 上线之前,V4 Pro 模型的请求都会被路由到 V4.1 Flash,并按 Flash 的价格计费。
顯示更多
0
41
213
3
轉發到社區
在现代,拥有一只 Astra 是什么感觉:一觉醒来 codex 能力提升一千倍,而我 claude 保持不变
0
56
90
1
轉發到社區
老大饿饿饭饭🫡🫡
看到今天AA连夜改index对应的benchmark,想到前两天和 @CyouSakura 聊到的。不过以下都是我的个人观点: 1. build一个bmk很大程度依赖taste,集成一堆bmk也是一样。这次AA被打脸的深层原因就是显然AA和OAI的taste有巨大的gap。具体来说,有的人可能觉得语音模型重要,有的人可能觉得模型需要有cu能力,有的人可能觉得任何的东西都可以被coding agent覆盖。不管是数据公司还是众包团队在造一个benchmark的时候,都是bet这个方向是一个promising的下一个方向,AA也是一样,AA index无非就是AA认为最重要的几个能力,通过一定的权重加和得到的,也就是AA的taste。只能说人家都要AGI了你还搁这儿玛卡巴卡(没错说的就是你GPQA) 2. 以bmk为导向其实并没什么错,错的是overfit到极少数的bmk。本身LLM很大程度上是“崎岖的智能”,如果存在足够多的bmk来观测,我认为几乎不会有人会说刷榜这件事了。不过目前的一个问题似乎是没有足够多高质量的bmk,你能想象critpt scicode ALE这些bmk都有bug么。另一个问题是目前的感觉不像是有足够多的bmk,然后我们一次把它们都刷完了;更像是一个domain刷完了,看看OA两家最近在刷什么榜,我们也去造那个domain的bmk然后刷。总而言之,如果大模型厂商内部如果有足够多高质量的bmk来观测+刷,这应该不太会是问题。 3. bmk在今天仍然是不可或缺的&充满human bias的。前面说到需要有足够多高质量的bmk,很显然让人容易联想到让agent来scale&build bmk。不过目前还不太可行。我认为判断&发现模型的弱点依赖于taste以及verification的能力,比较显然的是现在的LLM不太具有这样的能力,比如可以试试让他给你十个能得test of time 的idea。anthropic也写过一个相关的blog: @ZimingLiu11 的播客上提到过这件事情,以及他们想通过做一个meta model来让模型拥有一些sense/taste,eg判断一个训练的curve走势。本质上是同一件事。所以目前看来,RSI中的一个大断点就是taste,因为归根结底,目前的work都是在一个bmk上自提升,这太narrow了。一个朴素的想法是,模型可以提出各种各样的榜单,然后优化自己在榜单上的分数,这可能是一个弱化版的RSI。
顯示更多
0
51
27
0
轉發到社區
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
顯示更多
0
42
310
35
轉發到社區
愿意说真话的已经很少数了 一班醉生夢死的達官貴人,卻又個個興高采烈,歌舞昇平起來。——《孽海花》
部分学生掌握了绝大多数老师不具有的知识或者说经验,这部分知识恰巧代表着现在的人工智能frontier。
0
32
102
2
轉發到社區
中关村创业大街 AGI Bar😇 现在转架构还来得及吗😭
今天有个多模态转架构的男孩发信息跟我说这是他成年以来最好的夏天。 这一年他把多模态的刷榜任务全推了,转头扎进了预训练架构洗数据洗到吐的日子结束了,他每天琢磨的是 block 怎么堆、权重怎么复用。上周 Astra 的消息漏了出来,OpenAI 藏了一年的新模型用的是 loop transformer,推理不靠显式 CoT,靠把同一组权重循环几十轮,在 latent space 里把事情想完同样的 FLOPs,把参数比它大一倍的模型按在地上摩擦。 半年前字节那篇被全组翻出来逐字逐句研读。当年劝他别去的人,现在在问架构组还招不招人。 昨天在中关村创业大街散步,所有人突然停下手边的事,互相拥抱,喝彩欢呼。他说很开心,有种research 黄金时代的错觉。
顯示更多
0
35
48
0
轉發到社區
牛来:明天的明天,就是现在 @liulicheng10 had a feeling. Not now, not tomorrow, not tomorrow’s tomorrow, one day.
0
28
46
0
轉發到社區
没了 API,没了数据,没了 ARR,只剩下古法手作 RL 仙人
训练模型,要和光同尘,心中装的是九州万方 训大模型,要三思,思进,思危,思退! 我有一计,改训为蒸,上利公司,下利你们,我就不明白,这天大的好事,怎么就推行不下去? 搅吧,搅吧,你们就搅吧!搅得基模组前方蒸馏没了 API,没了数据;搅得 loss 曲线大乱,把 AGI 丢了,老子无非陪你们一起喝西北风就是。
顯示更多
0
15
22
0
轉發到社區
互联网上关于()的消息,()是假的 A. DeepSeek,99% B. GPT Astra,99% C. Fable 5.1,99% D. 以上选项都不对
🚨离谱,网上一批所谓的 GPT Astra 实测,可能压根测的就是 DeepSeek Pro?? @TokenGremlin 今天发帖指出,很多被海外社区拿来展示 Astra 能力的游戏、工程 Demo,其实能直接在 B 站搜到对应的 DeepSeek Pro 测试视频。 链路大概是: 国内用户用 DeepSeek Pro 做 Demo → 视频被搬运、裁切 → 模型信息丢失 → 海外账号重新发出来 → 评论区开始感叹“GPT Astra 太强了” 甚至他说,大家现在看到的大量 Astra “实测结果”,源头都可以追到这个中国视频平台。 目前这只能算他对素材来源的追踪,不能证明所有 Astra 测试都是假的。 但这个乌龙确实很 AI 时代: DeepSeek 在国内跑了个 Demo,绕地球一圈,回来成了 OpenAI 新模型的 Benchmark。 PS:目前我没找到真实的case。
顯示更多
0
44
33
0
轉發到社區
学术界有用的 idea 没那么多,只不过 pretrain 确实要做很多 ablation 工业界一直在 follow 学术界的新 idea,但是只有那些经过验证的 consensus 才能承担得起 scale up,只有那些 bottleneck 才值得一个 team “天马行空”地去 research
顯示更多
没去过业界,现在一直好奇像kimi智谱这样大模型厂商在正式预训练的模型大规模训练的时候,可以有空出来的节点去做天马行空的取自研究论文的技术前瞻验证和消融实验吗?毕竟模型厂商的GPU也有限。K3 技术报告里kda里很多组件像上下采样投影门控都做过许多消融尝试,glm5之前也尝试过线性注意力的门路🤔
顯示更多
我个人体感发现的一个情况是,随着2026年开始的coding/long-horizon能力大跃进,frontier模型的语言使用能力开始在看不懂的路上狂奔。在opus4.5的时代,他的语言风格还可以勉强算得上合理。在这之后,无论是gpt,opus还是国模,随着他们coding能力的起飞,这些模型的语言使用能力也开始一泻千里。 这个语用能力和风格的collapse在日常使用的体感是非常明显的:我日常遇到最大的问题是,无法正常的阅读和理解模型的文字内容,需要反复揣摩和skill/gemini翻译才可以理解。我个人的使用习惯偏向一部分的human-in-the-loop避免模型自己vibe起飞,但是目前“看不懂模型在说什么”严重影响我的工作效率。
顯示更多
0
74
393
30
轉發到社區
"Hy4 preview 是 Hy4 迭代的一个早期版本,预训练和后训练均仍有较大的提升空间,也有一些已知问题,如复杂任务的长思考和过度自我验证倾向,我们将持续敏捷迭代"
顯示更多
0
47
177
8
轉發到社區
抱歉,我不该在机器上 xxx,已加入 P0 警告红线 对,我又打破了红线,现在我把红线升级了(禁止触碰版) 是的,我在 memory 里记录了每一版本的红线,导致我使用了第一版红线(去除了第一版红线)
顯示更多
GPT西红柿炒鸡蛋真的是蠢到家了。
0
50
59
1
轉發到社區
一方面是四大变成两大了 一方面是 ICLR 2027 今日取号已到 5000 明年有没有人信 A 会不知道,有没有人信 A\ 是知道的 谁有 A\ 谁就是 A 会
中国有句古话 谁有CPT 谁就是四大
0
54
69
0
轉發到社區
中国有句古话 谁有CPT 谁就是四大
RIP UIUC If this was a year ago I'll think about how to argue deep learning alpha research is mandatory for iSchool graduation lmaoo
整个顶会审稿环境从 nips2025 开始,似乎随着 GPT 唱智斗变得越来越参差了
这年头读 PhD 真是有福了。 AI 审稿导致学术圈崩溃到了触目惊心的地步:亲眼见证所有的会议从 23 年中到现在,第一轮的 review 分数全部雪崩。我只记得 23 年的时候,ICLR 第一轮投稿可能中位数还有 5 分,现在直接 3 分都是高分?? 😅
顯示更多
0
49
77
3
轉發到社區
paper / experience / taste 是一个综合的标准,都希望招没有短板的全栈人才 数一作数量是一个边际效益很递减的评估标准,只要有 paper / 没有 paper 用其他 credits 去补,也不卡 candidates 的学历,这才是良好的双选状态 我们持续招人中,简历可以发 lixiuyu@stepfun.com,实习 / 校招均可
顯示更多
最近我有个手握十篇AI顶会的博士朋友正在找工作,分享一下他找工作的经验吧: 整理了 50 多篇青云、Seed、Kimi 等大模型人才计划面经,发现一个挺反常识的现象: 论文多的人,不一定更容易通过。 面试官真正关心的通常不是论文数量,而是几个更具体的问题: 你的研究方向和团队是否匹配?工作里哪些部分是自己完成的?为什么这样设计?方法在哪些场景会失败?换到真实业务里,成本和收益是否仍然成立? 研究型团队会重点考察问题定义、方法创新、实验设计和未来研究方向。但对于后训练、Agent 和推理系统岗位,工程闭环同样重要: 能不能搭建数据、训练、rollout 和评测流程?是否真正用过 verl、vLLM、Ray、DeepSpeed?遇到 reward 异常、熵崩溃、显存不足或吞吐下降时,能不能定位原因? 所以常见的四类候选人,大致是: 1. 论文强、工程弱:Research Talk 有优势,但容易挂在 Coding、系统实现和工程追问。 2. 工程强、论文弱:业务组适配度不错,但需要证明自己不只是调用框架,也能定义和分析问题。 3. 论文和工程都强:竞争力最高,但面试官会重点确认工作是否真正由自己主导。 4. 两边都不突出:与其继续堆零散经历,不如完成一个方向匹配、指标完整、能讲清失败案例的闭环项目。 人才计划不一定选择履历最豪华的人,更可能选择: 1. 方向匹配,并且能够独立把问题推进下去的人。 2. 一篇能讲透、能复现、能落地的工作,可能比几篇说不清个人贡献的论文更有说服力
顯示更多
0
39
113
4
轉發到社區