TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
阑夕
@foxshuo
说什么是你的自由,做什么是我的权利,如果我做的得不到你的赞同,那就对了,否则我将与你一样平淡无奇。
가입 August 2009
794
팔로잉 중
172.1K
팬
阑夕
@foxshuo
2026.08.20 11:04
随着智谱的GLM-5.3终于也在AA竞技场开榜,年中这一轮国产模型的上新,基本算是告一段落了。 若以AA竞技场的分数为参照标准,且全部按提交的满功率版本来算,目前各家厂牌的期中考试成绩如下: Kimi K3和GLM-5.3并列60分,是中国唯二能够挤进T1阵营里的模型,死死咬住了GPT-5.6和Claude Opus 5。 当然Kimi K3是已经发布超过1个月的「老」模型了,可见含金量之足,月之暗面应该是今年惊喜最大的AI公司了,路线修正得太及时了。 按照智谱创始人唐杰的说法,GLM-5.3是故意在控制变量,只通过后训练来做迭代,不动基座、架构和参数,看看能有多少提升,也很满意新模型的表现。 T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。 阿里的Qwen3.8这一代其实口碑不错,非但Max版本重回开源,27B版本更是被评价为「Opus at home」,在Hugging Face,Qwen全系列模型今年被下载了20亿次以上,比第2名到第5名加起来还多。 DeepSeek-V4-Pro到底出了什么问题,现在没人知道,虽说有搭配专武(Harness极简模式)的找补,但我觉得葬AI说得没毛病,一言不合就堆定语,是车圈陋习,咱大模型行业不要学。 再说T3分段,这里已经接近上桌吃饭的底线了,能看到45分的MiniMax-M3、43分的MiMo-V2.5-Pro、42分的Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。 MiniMax今年算是垫给了智谱,M3押注的原生多模路线,在商业价值上还是比不过纯Coding,最后还是靠视频模型找回了场子,字节比智谱好打你们敢信? 在DeepSeek-V4-Flash发布之前,小米的MiMo系列模型其实在OpenRouter上当了小半年的性价比之王,很适合用来跑自动化工具链之类的低价值高频次任务,也已经在财报里帮雷总做市值管理了。 腾讯的Hy3是姚顺雨的第一个作品,打响了翻盘的第一步,而且真做到了中美两开花,内有扶WokrBuddy上位的功劳,外有开打OpenRouter价格战的成绩,均衡双修。 再往下数,T4的分段就很接近不可言说的深海了,蚂蚁的Ling 3.0 Flash是38分,美团的LongCat 2.0是34分,阶跃的Step 3.7 Flash是31分,已经不太适用通用场景了,只能用在特定的细分领域。 比如它们都突出一个「快」字,主攻高速模型的品类,聪不聪明你别管,就问有没有秒回吧,在不追求解题效果的工业化任务里是有价值的。 什么,你问22分的百度文心ERNIE 5.0是不是位于马里亚纳海沟?自从拉了这坨大的之后,百度就没有再把新发布的ERNIR5.1上传AA竞技场了,不参战就是没胜负,精髓。
더 보기
0
0
31
96
11
커뮤니티로 전달
인기 있는 사용자
オリコンニュース
@oricon
1.9M 팬
TVer新着
@TVer_info
100K 팬
空空道人
@Kongkongda5882
30.8K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K 팬
New York Post
@nypost
4.1M 팬
브라운더스트2 공식트위터
@BROWNDUST2_KR
21.5K 팬
「승리의 여신: 니케」 x 「P3R」, 「P4G」, 「P5R」 콜라보 진행 중
@NIKKE_kr
79.4K 팬
中國新聞社
@CNS1952
547.1K 팬
看中國
@kanzhongguo
348.3K 팬
Girls' Generation
@GirlsGeneration
3.3M 팬
吴说区块链
@wublockchain12
180.6K 팬
一劍浣春秋
@chee828
231K 팬
彭博商業周刊 / 中文版
@BloombergBWCN
41.6K 팬
i-dle (아이들)
@official_i_dle
2.3M 팬
아이유(IU)
@_IUofficial
1.8M 팬