TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Phoenix Yin
@Phoenixyin13
🇺🇸 04美本 | 计算机科学&认知科学 ⚙️AI, cognition, crypto, and the future of intelligence. ✨相信好奇心驱动。相信人永远可塑。
가입 May 2025
980
팔로잉 중
20K
팬
Phoenix Yin
@Phoenixyin13
2026.06.19 08:08
LMSYS Arena已经是目前整个 AI 圈公认含金量最高、最难刷榜、水分最少的榜单了。 比起某些厂商自己发论文、用固定题库比如MMLU、HumanEval跑出来的作弊满分 ,Arena 机制更像电竞比赛的排位天梯赛。 看到这个 2026 年第 25 周AI代码能力的排名,我有这几个最直观的看法。 Claude江山稳固。 Claude-Fable-5 强势空降第一。直接登顶。更夸张的是,前 20 名里它家占了 9 个席位,包括各种版本的 Opus 和 Sonnet。在代码和复杂工程领域,Claude 依然是很多程序员的本命。 这次最亮眼的黑马绝对是国产的 GLM-5.2 Max,直接冲到了全球第二。 这代表国产模型在纯代码逻辑、Debug 和架构设计上,已经真正具备了跟国际顶尖模型贴身肉搏、甚至全面超越大部分旧旗舰的硬实力。 Thinking模型已经成为标配。 这种通过长思维链反复推演、自己 Debug 完再输出代码的模式,已经在盲测中被全球开发者用脚投票,证明了它在应对复杂项目时的胜率更高。 前 20 名里,国产模型占了 7 个席位。而且阿里的通义千问和月之暗面都咬得很紧,甚至还推出了专门的 kimi-k2.7-code 这种垂直上榜的特化型号。 国内在大模型数据清洗、工程落地和代码对齐上的技术已经非常成熟。 这种榜单的更新、迭代,对开发者来说是天大的好事。 模型之间卷得越厉害,平时写代码、跑 Cursor、调 Agent 时的体验就越丝滑。 现在已经不是某一家模型独大的时代了。 针对不同的代码场景,比如要长文本上下文选 Kimi,要极致推理逻辑选 Claude、GLM,组合使用才是性价比最高的方式。
더 보기
0
0
95
152
22
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
TVer新着
@TVer_info
100.9K 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
569.2K 팬
吴说区块链
@wublockchain12
181.5K 팬
Bloomberg
@business
10.5M 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.2K 팬
zerohedge
@zerohedge
3.4M 팬
一劍浣春秋
@chee828
231.9K 팬
中國新聞社
@CNS1952
547.6K 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬