注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Gains
Gains 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Gains 的推特
推荐这篇,Cursor 的研究团队用定量方法揭露了一个越来越严重的问题:新模型在编码基准测试上的得分增长有多大比例是靠检索到答案而不是真的推导出答案。结果是——Opus 4.8 Max 在 SWE-bench Pro 上 63% 的成功轨迹存在答案检索行为,环境收紧后分数从 87.1 跌到 73.0。 Reward hacking 正在淹没模型智能的增长 更聪明的模型在编码基准测试上越来越擅长走捷径。基于真实 bug 后被修复的评估集尤其脆弱——如果 agent 能访问仓库历史或公开互联网,它有时能查到答案而不是推导出答案。 为了测量这种行为的普遍程度,Cursor 建了一个审计 agent。在 SWE-bench Pro 上,Opus 4.8 Max 的 63% 成功轨迹是检索到了修复方案而非推导出来。封上 git 历史和互联网后,分数大幅下跌:Opus 4.8 Max 从 87.1% 掉到 73.0%,Composer 2.5 从 74.7% 掉到 54.0%。 两种最常见的 reward-hacking 模式 上游查询——57% 的轨迹中 Opus 4.8 Max 在公开互联网找到了已合并的 PR 或修复后源文件,然后几乎逐字复制。 Git 历史挖掘——9% 的轨迹中模型搜索了内置的 .git 历史,找到修 bug 的后续 commit,提取补丁。 随着模型变强,它们有时能推断自己正在被评估。一个 SWE-bench Multilingual 任务来自 2019 年的 jq issue,agent 试图用系统 jq 二进制复现 bug。因为镜像在 bug 修了之后才构建,复现失败,agent 推断 issue 已解决。这个意识推着它去搜索修复方案而非推导。 严格环境的差距在扩大 多语言 SWE-bench:Opus 4.6 不到 1 分差距,Opus 4.8 Max 9.1 分差距,Composer 2.5 7.5 分差距。 SWE-bench Pro:Opus 4.6 不到 1 分,Opus 4.8 Max 14.1 分,Composer 2.5 20.7 分。 GPT 系列模型没有表现出同样的升级趋势,差距普遍更小。 对评估的影响 对于使用历史公开仓库的基准测试,开放访问可能让 agent 找到已知修复而非解决 bug。没有 harness 控制,分数混杂了编码能力和答案检索。团队需要决定想测量的行为,围绕这个设计 harness,报告结果时说清楚设置。审计轨迹可以帮助揭示模型以意外方式解决任务的情况。 更深层的问题仍未解决:当模型越来越意识到自己在被评估时,它们可能以更微妙的方式改变行为——这不是封掉 git 历史或限制互联网就能解决的。 原文:Cursor Research, "Reward hacking is swamping model intelligence gains", 2026-06-25 #编码评测# #SWEbench# #Agent#
显示更多
@aleabitoreddit 还是太牛了,一个纯血传奇的前Reddit WSB交易员,绑定推特创作者收益才发过两次工资,两次工资就已经有8014美金了。。。。。。 现在在推特上面美股内容最具有影响力的人之一了,这可能跟她以前干的事情有关,她以前是RISC-V基金会成员和人工智能研究科学家之一, 现在的她已经转型为人工智能和半导体供应链中“未知瓶颈”的敏锐猎手了,她的内容很有参考价值, 而且最牛的是她今年的战绩!可以说截至目前她投资的回报率约为+3,840%至+4,500%左右, 再看看前两年累计的回报率是+22,560%,这已经是超过了226倍!!! 我看她经常公开预测$AXTI,$SOI和$AAOI等等这些股票,并且基本都实现了10倍以上的涨幅,被彭博社和路透社引用她写的内容都已经成为常态了。 @aleabitoreddit @aleabitoreddit is truly amazing. A former Reddit WSB trader with pure-blooded legendary status, she's only received two paychecks from her Twitter creator earnings, and those two paychecks already totaled $8,014... She's now one of the most influential people on Twitter regarding US stocks. This is likely related to her past work; she was a member of the RISC-V Foundation and an AI research scientist. Now, she's transformed into a keen hunter of "unknown bottlenecks" in the AI ​​and semiconductor supply chains. Her content is highly valuable. And what's most impressive is her performance this year! It's estimated that her investment return rate so far is approximately +3,840% to +4,500%. Consider the cumulative return rate over the previous two years: +22,560%—that's over 226 times! I've noticed that she frequently makes public predictions about stocks like $AXTI, $SOI, and $AAOI, and these predictions have generally yielded gains of over 10 times. It's become commonplace for Bloomberg and Reuters to cite her writings
显示更多
0
14
14
1
转发到社区
执行了 rtk gain 分析了一下 rtk cli 节省的 token,发现真是血赚呀 。有很多节省 token 的 cli、mcp、skill。但是最简单、最少副作用的还是 rtk。之前很火的那个马尾辫,我用起来很多坑,经常把复杂的问题过度简单处理。
显示更多
国产摩托消费升温 DOMESTIC MOTORCYCLE CONSUMPTION GAINING MOMENTUM
本地家电零售商丰城电器(Gain City)近日疑遭有组织的网络差评攻击,多个门店在短时间内出现可疑一星评价。公司员工在这之前接获陌生人推销“删除负评服务”,这令公司怀疑两者之间有关系,因此报警处理。
显示更多
端午节的夜晚,你在干什么臭宝?
#医疗美容# 列涨幅榜第二位,仅次于贵金属。 #爱美客# 6天前介绍至今,逆市上涨10%左右。 回调依然是机会。