TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
加入集合
xsser
@xsser_w
pua skill author, AI security agent startup CEO
2.2K
正在关注
3.5K
粉丝
xsser
@xsser_w
2026.09.10 07:58
说白话就是:它报的成绩是"最好那次"的成绩,不是"正常用"的成绩。 具体三件事: 一、同一场考试换了 8 种考法考了 8 遍,报最高的那次。 8 种考法成绩从 65.5 到 74.2 不等,平均 69.0,报的是 74.2。而竞争对手只考了一遍。最尴尬的是:它宣称在 DeepSWE 上以 74.2 险胜 Opus 5 的 74.0 —— 但那 74.2 是换了个别人的考法才拿到的,用它自己默认的考法只有 72.6,其实是输的。 二、考试时把"思考档位"开到最大。 从中档提到满档,分数涨 8 分,但要多花 2.5 倍的钱。而且他们自己在报告里写了:最后那一档加得不划算,多烧近一倍 token 只换来一点点提升。日常用根本不会开到那个档。 三、整个训练过程都在拿这几套题当进度表,还专门挑这几套题考得好的存档继续练。 这个影响有多大没法算,因为他们没留对照组。 那这算作弊吗?不算。 所有厂商都报最好成绩,而且它把 8 种考法的成绩全公开了 —— 真想糊弄人是不会给你看这张表的。 但有个别扭的地方:它整个卖点是"便宜",结果最漂亮的分数是靠"多花钱"换来的。 你按它自己推荐的日常档位用,拿不到 74.2 那个数。 至于省显存、省算力那部分(890 字节/token、只激活 8B),那是架构本身决定的,我自己算过一遍对得上 —— 那部分是真的,跟考试怎么考没关系。
显示更多
0
0
9
14
2
转发到社区
xsser
@xsser_w
2026.08.12 13:11
@passluo
上班其实很耽误赚钱的
0
0
0
1
0
转发到社区
xsser
@xsser_w
2026.07.17 14:35
感觉解释性强的人,行动力就弱了。行动力强的人一般解释性弱,就是会显得有点蠢或者是莽撞
0
0
26
2
0
转发到社区
xsser
@xsser_w
2026.07.12 09:18
grok build cli 会上传你的git历史和仓库
@musk
出来挨打
0
0
22
116
9
转发到社区
加载中...
热门用户
狱
@Wx1n11124
259.1K 粉丝
オリコンニュース
@oricon
1.9M 粉丝
New York Post
@nypost
4.2M 粉丝
吴说区块链
@wublockchain12
181.4K 粉丝
空空道人
@Kongkongda5882
34K 粉丝
TVer新着
@TVer_info
100.8K 粉丝
玉米棒棒
@fljjx61
478.6K 粉丝
ツイッター速報〜BreakingNews
@tweetsoku1
256.7K 粉丝
李李Momo💋
@Lili33O49
23.7K 粉丝
中國新聞社
@CNS1952
547.4K 粉丝
政经鲁社长
@xzzzjpl
733.3K 粉丝
华尔街观察 Xtrader
@cnfinancewatch
129.6K 粉丝
看中國
@kanzhongguo
348.8K 粉丝
First Squawk
@FirstSquawk
567.9K 粉丝
香风智乃
@ManuMougan
20.7K 粉丝