註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 LMArena
LMArena 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 LMArena 的搜尋結果
我让 Claude 画了 DeepSeek 新模型每次发布时在 lmarena 的最高排名走势图 从 V2 的默默无闻,到 R1 给世界带来一点点小小的中国震撼,再到现在 V4 归于平庸,在这条曲线上可以说很好的体现了 “于是我们奋力向前划,逆水行舟,不停地倒退,直回到往昔岁月” - 菲茨杰拉德《了不起的盖茨比》🥲
顯示更多
别再看 AI 榜单自嗨了!7月 LMArena 刷榜狂欢下的选型清醒指南 7 月的 AI 圈,每天都在"登顶"。 Claude Opus 4.8 暴力登顶。Claude Fable 5 屠榜封神。GPT-5.5 Pro 推理封王。Gemini 3.1 Pro 刷爆科学榜。 短短一周,"世界第一"换了四五个主人。 这正常吗? 不正常。因为当一个榜单每周都在换主人,说明的不是"谁更强"——而是这个榜单本身,已经无法承载 2026 年模型竞争的真实形态了。 今天,聊点清醒的。 第一个判断:全能歌王的时代,彻底结束了 模型竞争已经从"争夺总冠军",进入残酷的"按场景分科"。继续用一张总榜指导业务选型,刻舟求剑都算客气——更像是拿去年的地图找今年的路。 第二个判断:榜单经济的泡沫,正被置信区间戳破 看到"登顶"两个字,清醒的人第一反应是三个问题—— 登的是谁家定义的哪座山?投了多少票?误差区间多大? 很多人连榜单口径都没搞懂,就急着拼总表。 第三方汇总里,Claude Opus 4.8 综合分被拉到约 1580;但 LMArena 7 月 10 日官方 Text Arena 快照里,总榜第一是 Claude Fable 5(1509±9)。 这不是谁算错了。版本、时点、评分口径只要偏一点,结果天差地别。拿着缝合的榜单去指导业务,无异于用两张不同比例尺的地图导航——你永远到不了终点。 抛开厂牌,看 7 月这五位"主治医生"的真实成色 🏗 Claude Opus 4.8(Thinking 版)|复杂工程的重装步兵 硬核指标: 1560±9(WebDev 榜) 大实话: 别看到"Opus 4.8"就无脑冲。它的分数是 Thinking 版用反复规划和算力堆出来的——你买的是结果,不是过程。润色文案、改个样式,上它纯属高射炮打蚊子,还顺带把延迟和账单一起拉满。 复杂代码重构、长链路 Agent、需要深度内省的逻辑推演,它无可替代。但"无可替代"是有价格的,别为用不到的能力买单。 🏭 Claude Sonnet 5(High 版)|高频生产线的性价比之王 硬核指标: 1543±13(WebDev 榜,输入 $2/输出 $10 每百万 Token) 大实话: 它在 WebDev 榜没进前五,但它是真正的企业级牛马。商业落地不看偶尔秀一次肌肉,看的是天天进流水线的稳定性和吞吐量。 团队日更代码、批量改页面——稳定、速度、投入产出比,远比榜首虚名值钱。这才是 99% 的业务该选的那一个。 🎨 Claude Fable 5|前端 WebDev 的屠榜黑马 硬核指标: 1649±15(WebDev 榜首,2,161 票) 大实话: 分数确实炸,但别被冲昏头。WebDev Arena 测的是前端生成、视觉还原、工具调用,不是你的全栈架构。它的长周期自主性惊艳,但每百万 Token 输入 $10/输出 $50 的高阶定价,注定它走的是高精度消耗路线。 全自动网页原型、视觉 1:1 还原、可点击 Demo,它是尖刀。指望它无脑包办后端大型分布式架构,你会失望。 🔍 GPT-5.5 Pro|高难度推理的质检员 硬核指标: 推理方向领先(综合 1551,代码 1531) 大实话: 第三方汇总的推理高分不是免检证书。LMArena 官方 Math / Math-Hard 分类里,各家梯队的置信区间已经重叠——意思是,"推理之王"这个头衔,现在谁戴都行,也都别太当真。 多步骤核验、复杂决策树、跨模态材料,放 A/B 测试里去卷延迟和正确率,别直接盲信榜单。 🌊 Gemini 3.1 Pro|长文档海里的深海潜水员 硬核指标: 科学方向领先(GPQA Diamond 94.3%) 大实话: 科学 Benchmark 强,不等于你的专业细分领域不翻车。能读长文本,不等于每个 Needle-in-a-Haystack 的细节都对。 科研阅读、跨文档整合——它是拿来跟 GPT/Claude 打擂台的极佳对照组。但"对照组"三个字本身就说明:它不该是唯一答案。 🛠 别看厂牌,看疗效。业务选型的清醒四步法: 真正靠谱的架构师,挑模型时只问四件事: 第一,任务是什么? 通用对话、复杂代码、前端生成、严谨推理、科学阅读——各自有对应的垂类榜单。看子榜,别看总榜。 第二,版本是什么? Thinking、High、普通版,别混为一谈。差一个后缀,差一个量级。 第三,分差可靠吗? 看置信区间的重叠度。票数少的子榜,分数再高也别当真——统计学意义上,它就是噪声。 第四,业务代价是什么? 可用性(SLA)、首字延迟(TTFT)、Token 成本、工具兼容性,任何一项卡脖子,都能把那点打榜优势蒸发得一干二净。 一张更接近真实工作的"挂号表" ▸ 复杂工程、长链路 Agent → 优先实测 Claude Opus 4.8 Thinking ▸ 高频开发、批量迭代 → 优先实测 Claude Sonnet 5 High ▸ 前端页面、视觉还原、网页 Demo → 优先实测 Claude Fable 5 ▸ 多步骤推理、复杂决策 → 优先实测 GPT-5.5 Pro / 高推理档 ▸ 科研资料、长文档整合 → 优先实测 Gemini 3.1 Pro ⚠️ 注意:是"优先实测",不是"直接指定"。拿你自己的真实业务数据跑一遍,比转发一百张排行榜都管用。 最后的行业大实话 每天都有新模型“登顶”,每天都有人在制造焦虑。 真正的行业信息差,不是你没看到榜单,而是你只看到了被自媒体压缩成中文的“某某模型世界第一”,却没看到原文里复杂的测试限制条件、投票权重和长达几页的技术局限性说明。 AI 模型的下半场,是分科主治医生的时代。谁能跨过语言这道墙,直接读到一手评测,谁就掌握了判断的主动权。 用【沉浸式翻译】开启双语对照,直接读 LMArena 原始榜单,看原汁原味的完整评测。 打破语言带来的认知偏见,从拒绝吃二手结论开始。🌐 #AI模型# #LMArena# #沉浸式翻译# #大模型选型# #人工智能#
顯示更多
基于nano-banana模型非常优秀的改图能力,把平面动画角色转成3D手办的玩法这几天很火,不过我自己在LMArena测试了一会儿,发现它对纯血二次元图片的转化其实不太理想,改出来的成品都更像是亚克力的吊牌而不是手办,反而让我抽到的Qwen-Image出图效果意外的好。 比如图1是原图,图2是nano-banana的,图3是Qwen-Image的,差距很明显。(1/n)
顯示更多
0
9
145
8
轉發到社區
每天刷两小时推特,看到的还是二手转述。这 12 个源直接看一手,建议收藏: 1、AI News — 每日自动汇总各大社区和论文动态的日报,一篇顶你刷半天 2、The Batch — 吴恩达团队的每周简报,观点比资讯多,适合建立判断 3、Hugging Face Papers — 每天社区投票选出的热门论文,带简介 4、alphaXiv — 论文讨论区,能看到同行对一篇论文的质疑和补充 5、arXiv — 最原始的论文源,追某个方向就订阅对应分类 6、LMArena — 大模型盲测竞技场排行榜,看真实对战胜率而不是厂商自测分 7、Artificial Analysis — 各家模型的速度、价格、质量横向对比,选型时直接看这里 8、OpenRouter Rankings — 按实际调用量排的模型使用榜,能看出开发者到底在用什么 9、Simon Willison's Blog — 每个新模型发布他都会实测并写清楚能干什么,几乎不吹 10、Latent Space — 深度访谈和技术拆解,适合了解工程侧的真实做法 11、Interconnects — 训练和后训练方向的深度分析,偏研究 12、SemiAnalysis — 算力、芯片和数据中心的产业分析,看清楚上游发生了什么 如果只留两个:日常追进展看 AI News,选模型看 Artificial Analysis。
顯示更多
每天刷两小时推特,看到的还是二手转述。这 12 个源直接看一手,建议收藏: 1、AI News — 每日自动汇总各大社区和论文动态的日报,一篇顶你刷半天 2、The Batch — 吴恩达团队的每周简报,观点比资讯多,适合建立判断 3、Hugging Face Papers — 每天社区投票选出的热门论文,带简介 4、alphaXiv — 论文讨论区,能看到同行对一篇论文的质疑和补充 5、arXiv — 最原始的论文源,追某个方向就订阅对应分类 6、LMArena — 大模型盲测竞技场排行榜,看真实对战胜率而不是厂商自测分 7、Artificial Analysis — 各家模型的速度、价格、质量横向对比,选型时直接看这里 8、OpenRouter Rankings — 按实际调用量排的模型使用榜,能看出开发者到底在用什么 9、Simon Willison's Blog — 每个新模型发布他都会实测并写清楚能干什么,几乎不吹 10、Latent Space — 深度访谈和技术拆解,适合了解工程侧的真实做法 11、Interconnects — 训练和后训练方向的深度分析,偏研究 12、SemiAnalysis — 算力、芯片和数据中心的产业分析,看清楚上游发生了什么 如果只留两个:日常追进展看 AI News,选模型看 Artificial Analysis。
顯示更多
0
8
598
169
轉發到社區