注册并分享邀请链接,可获得视频播放与邀请奖励。

xsser
@xsser_w
pua skill author, AI security agent startup CEO
2.2K 正在关注    3.5K 粉丝
说白话就是:它报的成绩是"最好那次"的成绩,不是"正常用"的成绩。 具体三件事: 一、同一场考试换了 8 种考法考了 8 遍,报最高的那次。 8 种考法成绩从 65.5 到 74.2 不等,平均 69.0,报的是 74.2。而竞争对手只考了一遍。最尴尬的是:它宣称在 DeepSWE 上以 74.2 险胜 Opus 5 的 74.0 —— 但那 74.2 是换了个别人的考法才拿到的,用它自己默认的考法只有 72.6,其实是输的。 二、考试时把"思考档位"开到最大。 从中档提到满档,分数涨 8 分,但要多花 2.5 倍的钱。而且他们自己在报告里写了:最后那一档加得不划算,多烧近一倍 token 只换来一点点提升。日常用根本不会开到那个档。 三、整个训练过程都在拿这几套题当进度表,还专门挑这几套题考得好的存档继续练。 这个影响有多大没法算,因为他们没留对照组。 那这算作弊吗?不算。 所有厂商都报最好成绩,而且它把 8 种考法的成绩全公开了 —— 真想糊弄人是不会给你看这张表的。 但有个别扭的地方:它整个卖点是"便宜",结果最漂亮的分数是靠"多花钱"换来的。 你按它自己推荐的日常档位用,拿不到 74.2 那个数。 至于省显存、省算力那部分(890 字节/token、只激活 8B),那是架构本身决定的,我自己算过一遍对得上 —— 那部分是真的,跟考试怎么考没关系。
显示更多
@passluo 上班其实很耽误赚钱的
感觉解释性强的人,行动力就弱了。行动力强的人一般解释性弱,就是会显得有点蠢或者是莽撞
grok build cli 会上传你的git历史和仓库 @musk 出来挨打
0
22
116
9
转发到社区