TwiScan
熱門
社區
帳號集合
登入
註冊
English
日本語
한국의
简体中文
繁体中文
註冊並分享邀請連結,可獲得影片播放與邀請獎勵。
立即註冊
加入集合
xsser
@xsser_w
pua skill author, AI security agent startup CEO
2.2K
正在關注
3.5K
粉絲
xsser
@xsser_w
2026.09.10 07:58
说白话就是:它报的成绩是"最好那次"的成绩,不是"正常用"的成绩。 具体三件事: 一、同一场考试换了 8 种考法考了 8 遍,报最高的那次。 8 种考法成绩从 65.5 到 74.2 不等,平均 69.0,报的是 74.2。而竞争对手只考了一遍。最尴尬的是:它宣称在 DeepSWE 上以 74.2 险胜 Opus 5 的 74.0 —— 但那 74.2 是换了个别人的考法才拿到的,用它自己默认的考法只有 72.6,其实是输的。 二、考试时把"思考档位"开到最大。 从中档提到满档,分数涨 8 分,但要多花 2.5 倍的钱。而且他们自己在报告里写了:最后那一档加得不划算,多烧近一倍 token 只换来一点点提升。日常用根本不会开到那个档。 三、整个训练过程都在拿这几套题当进度表,还专门挑这几套题考得好的存档继续练。 这个影响有多大没法算,因为他们没留对照组。 那这算作弊吗?不算。 所有厂商都报最好成绩,而且它把 8 种考法的成绩全公开了 —— 真想糊弄人是不会给你看这张表的。 但有个别扭的地方:它整个卖点是"便宜",结果最漂亮的分数是靠"多花钱"换来的。 你按它自己推荐的日常档位用,拿不到 74.2 那个数。 至于省显存、省算力那部分(890 字节/token、只激活 8B),那是架构本身决定的,我自己算过一遍对得上 —— 那部分是真的,跟考试怎么考没关系。
顯示更多
0
0
9
14
2
轉發到社區
xsser
@xsser_w
2026.08.12 13:11
@passluo
上班其实很耽误赚钱的
0
0
0
1
0
轉發到社區
xsser
@xsser_w
2026.07.17 14:35
感觉解释性强的人,行动力就弱了。行动力强的人一般解释性弱,就是会显得有点蠢或者是莽撞
0
0
26
2
0
轉發到社區
xsser
@xsser_w
2026.07.12 09:18
grok build cli 会上传你的git历史和仓库
@musk
出来挨打
0
0
22
116
9
轉發到社區
載入中...
熱門用戶
オリコンニュース
@oricon
1.9M 粉絲
New York Post
@nypost
4.2M 粉絲
吴说区块链
@wublockchain12
181.4K 粉絲
空空道人
@Kongkongda5882
34K 粉絲
ツイッター速報〜BreakingNews
@tweetsoku1
256.6K 粉絲
中國新聞社
@CNS1952
547.4K 粉絲
TVer新着
@TVer_info
100.8K 粉絲
币安Binance华语
@binancezh
464.2K 粉絲
看中國
@kanzhongguo
348.8K 粉絲
Reuters
@Reuters
26.4M 粉絲
First Squawk
@FirstSquawk
567.8K 粉絲
华尔街观察 Xtrader
@cnfinancewatch
129.5K 粉絲
billboard
@billboard
16.8M 粉絲
一劍浣春秋
@chee828
231.8K 粉絲
小牛
@Xiaoniu6161
189.3K 粉絲