註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 大模型选型
大模型选型 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 大模型选型 的搜尋結果
别再看 AI 榜单自嗨了!7月 LMArena 刷榜狂欢下的选型清醒指南 7 月的 AI 圈,每天都在"登顶"。 Claude Opus 4.8 暴力登顶。Claude Fable 5 屠榜封神。GPT-5.5 Pro 推理封王。Gemini 3.1 Pro 刷爆科学榜。 短短一周,"世界第一"换了四五个主人。 这正常吗? 不正常。因为当一个榜单每周都在换主人,说明的不是"谁更强"——而是这个榜单本身,已经无法承载 2026 年模型竞争的真实形态了。 今天,聊点清醒的。 第一个判断:全能歌王的时代,彻底结束了 模型竞争已经从"争夺总冠军",进入残酷的"按场景分科"。继续用一张总榜指导业务选型,刻舟求剑都算客气——更像是拿去年的地图找今年的路。 第二个判断:榜单经济的泡沫,正被置信区间戳破 看到"登顶"两个字,清醒的人第一反应是三个问题—— 登的是谁家定义的哪座山?投了多少票?误差区间多大? 很多人连榜单口径都没搞懂,就急着拼总表。 第三方汇总里,Claude Opus 4.8 综合分被拉到约 1580;但 LMArena 7 月 10 日官方 Text Arena 快照里,总榜第一是 Claude Fable 5(1509±9)。 这不是谁算错了。版本、时点、评分口径只要偏一点,结果天差地别。拿着缝合的榜单去指导业务,无异于用两张不同比例尺的地图导航——你永远到不了终点。 抛开厂牌,看 7 月这五位"主治医生"的真实成色 🏗 Claude Opus 4.8(Thinking 版)|复杂工程的重装步兵 硬核指标: 1560±9(WebDev 榜) 大实话: 别看到"Opus 4.8"就无脑冲。它的分数是 Thinking 版用反复规划和算力堆出来的——你买的是结果,不是过程。润色文案、改个样式,上它纯属高射炮打蚊子,还顺带把延迟和账单一起拉满。 复杂代码重构、长链路 Agent、需要深度内省的逻辑推演,它无可替代。但"无可替代"是有价格的,别为用不到的能力买单。 🏭 Claude Sonnet 5(High 版)|高频生产线的性价比之王 硬核指标: 1543±13(WebDev 榜,输入 $2/输出 $10 每百万 Token) 大实话: 它在 WebDev 榜没进前五,但它是真正的企业级牛马。商业落地不看偶尔秀一次肌肉,看的是天天进流水线的稳定性和吞吐量。 团队日更代码、批量改页面——稳定、速度、投入产出比,远比榜首虚名值钱。这才是 99% 的业务该选的那一个。 🎨 Claude Fable 5|前端 WebDev 的屠榜黑马 硬核指标: 1649±15(WebDev 榜首,2,161 票) 大实话: 分数确实炸,但别被冲昏头。WebDev Arena 测的是前端生成、视觉还原、工具调用,不是你的全栈架构。它的长周期自主性惊艳,但每百万 Token 输入 $10/输出 $50 的高阶定价,注定它走的是高精度消耗路线。 全自动网页原型、视觉 1:1 还原、可点击 Demo,它是尖刀。指望它无脑包办后端大型分布式架构,你会失望。 🔍 GPT-5.5 Pro|高难度推理的质检员 硬核指标: 推理方向领先(综合 1551,代码 1531) 大实话: 第三方汇总的推理高分不是免检证书。LMArena 官方 Math / Math-Hard 分类里,各家梯队的置信区间已经重叠——意思是,"推理之王"这个头衔,现在谁戴都行,也都别太当真。 多步骤核验、复杂决策树、跨模态材料,放 A/B 测试里去卷延迟和正确率,别直接盲信榜单。 🌊 Gemini 3.1 Pro|长文档海里的深海潜水员 硬核指标: 科学方向领先(GPQA Diamond 94.3%) 大实话: 科学 Benchmark 强,不等于你的专业细分领域不翻车。能读长文本,不等于每个 Needle-in-a-Haystack 的细节都对。 科研阅读、跨文档整合——它是拿来跟 GPT/Claude 打擂台的极佳对照组。但"对照组"三个字本身就说明:它不该是唯一答案。 🛠 别看厂牌,看疗效。业务选型的清醒四步法: 真正靠谱的架构师,挑模型时只问四件事: 第一,任务是什么? 通用对话、复杂代码、前端生成、严谨推理、科学阅读——各自有对应的垂类榜单。看子榜,别看总榜。 第二,版本是什么? Thinking、High、普通版,别混为一谈。差一个后缀,差一个量级。 第三,分差可靠吗? 看置信区间的重叠度。票数少的子榜,分数再高也别当真——统计学意义上,它就是噪声。 第四,业务代价是什么? 可用性(SLA)、首字延迟(TTFT)、Token 成本、工具兼容性,任何一项卡脖子,都能把那点打榜优势蒸发得一干二净。 一张更接近真实工作的"挂号表" ▸ 复杂工程、长链路 Agent → 优先实测 Claude Opus 4.8 Thinking ▸ 高频开发、批量迭代 → 优先实测 Claude Sonnet 5 High ▸ 前端页面、视觉还原、网页 Demo → 优先实测 Claude Fable 5 ▸ 多步骤推理、复杂决策 → 优先实测 GPT-5.5 Pro / 高推理档 ▸ 科研资料、长文档整合 → 优先实测 Gemini 3.1 Pro ⚠️ 注意:是"优先实测",不是"直接指定"。拿你自己的真实业务数据跑一遍,比转发一百张排行榜都管用。 最后的行业大实话 每天都有新模型“登顶”,每天都有人在制造焦虑。 真正的行业信息差,不是你没看到榜单,而是你只看到了被自媒体压缩成中文的“某某模型世界第一”,却没看到原文里复杂的测试限制条件、投票权重和长达几页的技术局限性说明。 AI 模型的下半场,是分科主治医生的时代。谁能跨过语言这道墙,直接读到一手评测,谁就掌握了判断的主动权。 用【沉浸式翻译】开启双语对照,直接读 LMArena 原始榜单,看原汁原味的完整评测。 打破语言带来的认知偏见,从拒绝吃二手结论开始。🌐 #AI模型# #LMArena# #沉浸式翻译# #大模型选型# #人工智能#
顯示更多
每天刷两小时推特,看到的还是二手转述。这 12 个源直接看一手,建议收藏: 1、AI News — 每日自动汇总各大社区和论文动态的日报,一篇顶你刷半天 2、The Batch — 吴恩达团队的每周简报,观点比资讯多,适合建立判断 3、Hugging Face Papers — 每天社区投票选出的热门论文,带简介 4、alphaXiv — 论文讨论区,能看到同行对一篇论文的质疑和补充 5、arXiv — 最原始的论文源,追某个方向就订阅对应分类 6、LMArena — 大模型盲测竞技场排行榜,看真实对战胜率而不是厂商自测分 7、Artificial Analysis — 各家模型的速度、价格、质量横向对比,选型时直接看这里 8、OpenRouter Rankings — 按实际调用量排的模型使用榜,能看出开发者到底在用什么 9、Simon Willison's Blog — 每个新模型发布他都会实测并写清楚能干什么,几乎不吹 10、Latent Space — 深度访谈和技术拆解,适合了解工程侧的真实做法 11、Interconnects — 训练和后训练方向的深度分析,偏研究 12、SemiAnalysis — 算力、芯片和数据中心的产业分析,看清楚上游发生了什么 如果只留两个:日常追进展看 AI News,选模型看 Artificial Analysis。
顯示更多
每天刷两小时推特,看到的还是二手转述。这 12 个源直接看一手,建议收藏: 1、AI News — 每日自动汇总各大社区和论文动态的日报,一篇顶你刷半天 2、The Batch — 吴恩达团队的每周简报,观点比资讯多,适合建立判断 3、Hugging Face Papers — 每天社区投票选出的热门论文,带简介 4、alphaXiv — 论文讨论区,能看到同行对一篇论文的质疑和补充 5、arXiv — 最原始的论文源,追某个方向就订阅对应分类 6、LMArena — 大模型盲测竞技场排行榜,看真实对战胜率而不是厂商自测分 7、Artificial Analysis — 各家模型的速度、价格、质量横向对比,选型时直接看这里 8、OpenRouter Rankings — 按实际调用量排的模型使用榜,能看出开发者到底在用什么 9、Simon Willison's Blog — 每个新模型发布他都会实测并写清楚能干什么,几乎不吹 10、Latent Space — 深度访谈和技术拆解,适合了解工程侧的真实做法 11、Interconnects — 训练和后训练方向的深度分析,偏研究 12、SemiAnalysis — 算力、芯片和数据中心的产业分析,看清楚上游发生了什么 如果只留两个:日常追进展看 AI News,选模型看 Artificial Analysis。
顯示更多
0
27
1.6K
428
轉發到社區
欧洲算力赛道可以分成综合机房托管(IDC)、本土公有云AI算力、专用HPC/AI算力厂商、国家级超算运营方四大类,头部企业(截至2026年): 一、欧洲体量最大的中立IDC机房(机柜、电力、互联能力最强) 主打算力园区、整机柜租赁、大客户托管,是AI算力最核心的载体 1. Digital Realty(数字地产,美国上市,欧洲第一大IDC) 收购欧洲老牌Interxion后坐稳龙头,欧洲64个数据中心,总电力容量约566MW,法兰克福、阿姆斯特丹、伦敦拥有欧洲顶级算力园区,面向微软、Nebius、AI企业做批发算力机柜,欧洲高密度液冷算力节点最多。 2. Equinix(艺恩尼克斯) 欧洲93个数据中心,侧重互联网交换、金融与云互联,欧洲 peering 网络最强,适合需要低时延的算力调度、跨境算力组网,高端政企算力托管首选。 3. Vantage Data Centers、Global Switch 主攻英国、法国、德国大型超算园区,承接海外AI公司欧洲落地自建机房需求。 二、欧洲本土全栈云厂商(可直接租用GPU算力,主打欧盟数据主权) 欧美云市场格局:AWS、微软Azure、谷歌云占据欧洲70%公有云份额;下面是欧洲本土自研算力云,合规性优势极强 1. OVHcloud(法国,欧洲本土第一大云) 欧洲最规模化的本土云计算企业,9个国家自建43个数据中心,裸金属、H100/L4 AI算力齐全,性价比显著高于美国大厂,垂直自研服务器、散热体系,是欧洲商用大模型最常用的算力平台。 2. Nebius Group(荷兰注册,原Yandex拆分) 当前欧洲增速最快的AI算力巨头,手握欧洲稀缺的2.5GW电力配额,批量部署英伟达H100/Blackwell集群,拿到微软、Meta大额AI算力长单,主打大规模训练级算力,定位欧洲版CoreWeave。 3. Hetzner(德国) 性价比标杆,德国、芬兰自建机房,GPU服务器、托管机价格极低,中小企业、量化、推理算力使用最多,PUE能耗控制优秀。 4. 德国电信 T Cloud 欧盟国家级主权云,面向工业、政务、医疗等高监管行业布局AI算力,计划2026年底对标美国超大规模云能力,工业仿真算力优势突出。 5. Scaleway(法国伊利亚德集团)、IONOS(德国) 二线本土云,主打绿色可再生能源算力、轻量级AI推理集群,合规适配GDPR。 三、欧洲专注AI/HPC高性能算力的专业厂商(专精大模型、液冷超算) 1. Northern Data(德国上市) 欧洲老牌高性能算力运营商,从算力矿机转型AI液冷算力集群,拥有欧洲最大的专用GPU算力集群之一,主打高密度浸没式冷却,适合长周期大模型训练。 2. Eviden(原法国Atos) 欧洲本土超算整机厂商,BullSequana系列是欧盟EuroHPC计划主力机型,承建欧洲首台艾级超算JUPITER,提供政企定制HPC、科研算力整体方案。 3. WBS Power(波兰) 在建欧洲单体最大算力园区:波兰波罗的海数据中心,规划总装机3.2GW,依靠北欧风电做低成本绿色算力,面向全球AI企业做超大算力基建出租。 四、欧洲国家级顶级超算运营体系(科研、工业顶级算力) 由欧盟EuroHPC统筹,算力面向科研、气象、生物医药、工业仿真开放: • 德国于利希超算中心(运营JUPITER,欧洲首台艾级超算) • 芬兰LUMI超算、意大利LEONARDO超算、西班牙MareNostrum超算,构成欧洲最强科研算力矩阵 简单选型参考 • 租商用GPU、做大模型训练:优先 Nebius、OVHcloud、Northern Data • 机柜托管、自建算力集群:Digital Realty、Equinix • 低成本推理、中小算力:Hetzner、Scaleway • 政务、工业合规算力:德国电信T Cloud、Eviden
顯示更多
💻 震惊,Magnitude 能让你已经在用的 Claude Code、Codex、Cline 直接改用本地模型跑,token 账单归零。 GitHub 上 3449 star,仓库今年 6 月才建,三个月不到涨到这个数,光是最近一周 CLI 就连发了五个版本。 以前想在自己机器上跑本地模型,最劝退的一步是选型:显存这么大该配哪个模型、量化到几 bit、上下文开多长,一堆参数只能自己试,试错一次就是几十 G 的下载。Magnitude 的做法是先把你这台机器摸一遍,按硬件推荐模型,然后下载、调优、跑起来一路包到底,推测解码和并发这些优化也是它照着硬件自己配。 跑起来之后,模型、提示词和文件都留在本机,模型下完直接断网也照常用;闲置或者内存不够的时候它会自己把模型卸掉,要用再加载回来。想换模型也没被锁死,Hugging Face 上的 GGUF 拿下来就能接上。macOS 和 Linux 直接支持,Windows 走 WSL。 不用 API key,不看速率限制,Apache 2.0 开源。写代码这件事,终于可以完整地发生在自己电脑里了。 GitHub:
顯示更多
大模型圈的现状 人人都能使用前沿模型是一项基本权益
大模型厂商真应该超严肃对待用户隐私问题,本来模型 API 就采集了不少用户数据(用户已知),这些数据怎么存储、再加工等用户就不知道了,也不可控。大模型厂商的相关客户端运行在用户电脑或服务器里,还非预期打破用户隐私边界的话,这种信任紧张关系立马就裂开。不少个人可能还无所谓,但许多公司/单位就非常有所谓了,隐私红线一旦突破,很快上纲上线。 我更担心的是这些大模型厂商或知名中转站被黑,导致海量隐私外泄或者被内部做恶。AI 超级威胁没到来之前,人类黑灰产早就泛滥成灾。
顯示更多
0
5
109
6
轉發到社區
大模型机器人开始了 再印度,已经有人给体力工作的工人报酬,让他们拍摄自己从事体力劳动的视频,以训练机器人学习人类劳动
大模型的核心竞争力不是看谁领先,都是暂时的 下一步,看谁是自己有芯片,能源,专家,渠道等全栈的,这样就有成本优势,分发优势,这样的话,spacex和google会很牛。
顯示更多
0
14
12
1
轉發到社區
大模型厂商在想,等 Deepseek V4 Pro 发了,会不会还有 Deepseek V4 Ultra?
0
56
48
0
轉發到社區