注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 glm52
glm52 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 glm52 的推特
本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意原始精度要到1.5TB, 本地跑的很少有富到这个程度的, 所以大家都用各种量化版本, 毕竟4bit量化就只要430GB了. 问题这就来了, 由于 GLM-5.2 的 MTP 采用了非常特殊的 DSA (动态稀疏注意力), 导致目前几个推理引擎 (llama.cpp, vLLM, mlx) 都无法支持. 其中 llama.cpp, mlx 是完全没办法开 MTP, vLLM 只支持FP8精度的. 而SGLang 没事哈, SGLang 架构比较屌上来就支持同一个计算流使用混合精度. 所以直接用 GLM-5.2-W4AFP8 就行. 所以回到这几个不支持的推理引擎, 大部分的量化版本 GLM-5.2 开了 MTP 反而会掉速度. 甚至有的量化版本直接把MTP部分给砍了(mlx). 而社区作者dnhkng搞了个缝合方法, 最终搞出了 GLM-5.2-AWQ-INT4-FP8-MTP-delta, 即 底座用 INT4(走 Marlin 算子)+ MTP 用 FP8(保持精度)同时还能让vLLM 支持. 速度从原来的 2 token/s 直接飙升到了 43.39 token/s (绑定NUMA+MTP-3) 所以目前位置 SGLang 和 vLLM (魔改版)都能直接火力全开跑带MTP的 GLM-5.2了. 而 llama.cpp和mlx用户还需要再等等. 社区还在弄. 这个作者的blog (过程极其精彩, 有不少优化技巧): #glm52# #mtp# #dsa#
显示更多
0
66
208
30
转发到社区
想买Mac运行大模型? 这是劝退贴 其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大模型都能跑到 40 token/s. 如果专门买 MacStudio M3 Ultra 96G 运行大模型, 如果把设备售价 (32999) 换算成使用API, 以 GLM-5.2 为例, 每百万token 28块, 一台 MacStudio 的价格大概能买到 32999/28 = 1178M token. 而为了输出这些token, 买到的 MacStudio 运行 Qwen3.6-27B 要持续运行 209天. 也就是说回本周期至少是200天不间断运行. 然后运行模型才是纯赚. 这还是没算电费和不直接买API而是买套餐的情况.而且, 最重要的是这还是在运行一个只有27B的小模型. 如果真的买512G的 MacStudio (108749, 而且好像已经断货了), 然后运行量化版本的 GLM-5.2, 速度就会跌到只有 17 token/s, 回本周期大概在 7 年左右... 对于现在1.5个月模型就发新版本的情况下, 普通用户自用是绝对不划算的. 所以大部分用户买 coding plan 会更划算, 如果像我一样要测新模型, 直接租卡也会比直接买划算很多. 当然, 如果你本身就有Mac或者显卡, 那么空闲的时候(比如睡觉的时候)让它跑大模型运行任务, 反而是划算的. #本地大模型# #mac# #qwen36# #glm52#
显示更多
0
110
149
11
转发到社区
GLM-5.2 刚刚正式发布! 给大家带来实测! 直接说结论本次测试中, 提升最大的是Agent能力, 而且是有质的变化! 测试中GLM-5.2 完全不用搜索附近的位置, 就能直接去想要到达的地方. 这一切竟然是它在一开始把地图背下来了! 这在我测试的20多个模型中之前是没有一个模型能做到的, 比如之前的模型想去换电站, 那么都要搜一下附近有哪些换电站(这就会浪费一次tool_call), 而GLM-5.2直接就知道换电站的位置! 从来没用过搜索函数. 这种一开始就把需要的数据内化到上下文中, 并且能够贯穿整个1M上下文进行推理的能力真的是叹为观止. 除此之外, 本次测试后端代码的 Agentic Coding 能力也有提升, 来到了总榜的第二名. 而本次测试暴露出最大的短板则是空间理解. 其实成也萧何败也萧何, 它虽然把换电站的位置都背下来了, 但是去的换电站却不是最近的, 所以虽然记住了, 但是记住了之后在用之前再根据自己当前所在位置推理一下, 他还是没有做到的, 这也是最大的短板了, 强烈建议官方优化一波. #GLM52# #智谱# #智谱AI# #AgenticCoding# #长上下文能力#
显示更多
0
12
92
5
转发到社区
GLM-5.2 与 AI 利润率的重塑:一场关于智能商品的双重叙事 上个月我们聊过 GLM-5.2 的 1M 上下文能做什么——整本书喂进去、全量代码库一次读懂、长文本翻译不再切片。 今天想聊另一个问题:它的出现,对整个 AI 行业的定价逻辑,意味着什么。 目前搞科技评论的出现了一个奇妙的“平行宇宙”: 英文圈看到 753B 旗舰、MIT 协议、性能直逼 GPT-5.5 但成本只要六分之一,惊呼:“AI 利润率要彻底崩溃了!” 中文圈同期却在讨论:“智谱提价、国产大模型集体放弃价格战。” 同一个事实,两种叙事。究竟是谁在嘴硬,谁在流血? 别误会,崩溃的不是模型能力,是“中间商”的暴利 很多人把“利润率崩溃”误读成了 AI 药丸。实际上,大多数人把因果关系理解反了。 先看一组让人肉疼的数据: 2023 年(GPT-4 时代): $60 / 百万 token。 2025 年初(推理爆发): $2.50 / 百万 token。 2026 年中(当前商品级模型): 已经跌破 $0.10。 不到三年,推理成本直降 600 倍。这个速度,比摩尔定律还快。 再看最新的旗舰对决: GPT-5.5 输出定价: $30 / 百万 token GLM-5.2 输出定价: $4.4 / 百万 token 性能差距: 🤏 不到 1% 价格差距: 接近 7 倍 但这里有一个被刻意忽视的行业悖论:OpenAI 今年预计亏损 140 亿美元,每赚 1 美元要花 1.7 美元;而英伟达单季营收 816 亿美元,毛利率高达 75%。 同一个 AI 盛世,有人在深夜流血,有人在昼夜印钞。 📉 看看附图里 ICONIQ 最新的 2026 行业调查,数据更加骨感: 过去传统 SaaS 躺着就能拿到 70%-85% 的黄金毛利率;而 2026 年强行缝合 AI 的产品构建者,预期毛利率被硬生生压缩了近 30 个百分点,暴跌到 ~52%。 高昂的算力和推理成本,正在不知不觉中抽干应用层的财务血条。这也是为什么像 GLM-5.2 这种把推理成本打到极致的模型出现时,整个科技圈会如此敏锐。 这根本不是“AI 药丸”,这是利润率的重新分配——从虚胖的应用层,流向了硬核的基础设施层。真正崩溃的,是“靠垄断大模型推理服务、躺着收高溢价过路费”的幻觉。 那中文圈的“涨价”又是怎么回事? 这才是这个话题最有意思的地方——两个叙事并不矛盾,它们描述的是同一场战争的两个不同战场。 智谱在 2026 年短短三个月内两度提价,GLM Coding Plan 整体涨幅自 30% 起。更关键的数据是:第一季度 API 定价累计上调 83%,但 Token 消耗量同期增长了 400%。 涨价了,用的人反而更多了。 这说明什么?说明智能体时代,Token 的消耗模式彻底变了。以前是“一问一答”,线性消耗;现在是 Agent 长链路思考、多步骤执行、循环调用,Token 消耗是指数级增长。智谱 CEO 张鹏的原话是:“AGI 时代的商业价值 = 智能上界 × Token 消耗规模。” 所以中文圈的“涨价”,本质上是:需求爆炸了,供给跟不上,定价权回到了卖方手里。 这和英文圈的“利润率崩溃”并不矛盾——崩溃的是“低质量、高溢价”的推理服务;涨价的是“高质量、供不应求”的 Agent 能力。 同一件事,不同切面。 20 年前那场搞垮巨头的“带宽爆炸”,正在重演 这种教科书级别的结构性重组,历史演过一次。 2000 年代初,全球光纤带宽爆炸式扩张,传输一个比特的成本瞬间跌了 99%。 当时的输家: 电信巨头 WorldCom、Global Crossing 直接破产,因为他们赖以生存的“昂贵带宽费”变成了一文不值的空气。 当时的赢家: 刚刚成立、拼命消耗免费带宽的 Google。 “带宽崩溃”那年,恰恰是全球互联网真正爆发的元年。 杰夫·贝佐斯(Jeff Bezos)有句话放在这里特别合适:“你的利润,是我的机会。” GLM-5.2 刺破泡沫的今年,大概率是同一个剧本。崩溃的不是 AI,崩溃的是“智能属于奢侈品”的伪命题。 当智能像自来水一样便宜,真正的壁垒是什么? 这意味着,那些曾经因为语言障碍、付不起高昂 API 费用、或者没有渠道接触顶级信息的人,第一次在物理层面上,站在了和硅谷工程师几乎相同的信息起跑线上。 智能,正在从稀缺神坛走向路边的自来水管。 但作为做翻译和生产力工具的,我们想留一个足够清醒(甚至有点冒犯)的问题:当“能力”被彻底普惠后,“机会”真的会均等吗? 语言和成本不再是壁垒。但如果你根本不知道外面有什么值得读,或者习惯了信息茧房,那么再便宜的旗舰模型,对你而言也是冗余的算力。 信息平权真正要解决的,从来不只是“怎么翻译”,而是“让你睁眼看到,世界上还有另一种叙事存在”。 🌐 而这,也正是沉浸式翻译一直在做的事。 当 GLM-5.2 将顶级长文本的推理成本打到“平民价”,通过在沉浸式翻译中接入你的自定义 API,那些高高在上的海外一手信息,都将变成你无缝吞吐的认知底层: 前沿技术文档与 PDF 研报:一键双语对照读懂 GitHub 上的开源技术 Specs、Arxiv 论文或海外科技媒体的硬核分析,让行业红利没有时差。 全球财经与国际叙事对比:在浏览器里直接无缝对照阅读英文圈的“利润率崩溃论”与中文圈的“供需重组论”,在双重叙事中看清真实的行业大势。 海外硬核视频与社交媒体流:实时双语翻译 YouTube 上的技术讲座、公开课,以及 X(Twitter)上的硬核技术推特链,让你直接站在和硅谷同等强度的信息源头。 智能正在变成像水、电一样的基础设施,而沉浸式翻译,就是把这股智能水流无缝接入你日常浏览器、PDF 和视频里的那根双语管道。 智能不再稀缺,机会留给最先睁眼看世界的人。 #AI# #GLM52# #信息平权# #沉浸式翻译#
显示更多
GLM5.2 好像有很明显的“多重人格”,像多个角色在一个模型里。经常会用“请将”提示自己,应该是把 agent 输出拿回去练模型了。
glm5.2 做的新技能 u1s1 gpt的出图降智蛮厉害的
GLM5.5会在7月发布,至少会发一个745B的版本,甚至包括一个大参数量的新基座模型,但minimax m3的万亿参数版本可能要拖到四季度才能发布。 即使跌了这么多,minimax按照最新arr估值还有40倍,但按照这种模型发布进度,minimax的收入增长非常危险。
显示更多
0
11
75
1
转发到社区
GLM5.2的文学审美比ChatGPT强! ChatGPT 评估意见的最大风险不在具体建议本身,而在它的审美惯性。它的修订建议默认指向一种"冷硬轻"的小说美学:少解释、多场景、让读者自己感受、克制判词、母题替换为具体动作。这套美学对海明威 / 卡佛 / 麦克尤恩有效,但对《先知手记》是错的。
显示更多
GLM5.2 今天开源了。 各家云服务商应该已经或者即将提供服务,因为架构上没啥变化,只需要部署一下。 作为前zhipu max 老会员,对他家订阅服务的商业决策不太认同,还是用别家的套餐吧。
显示更多
0
55
122
2
转发到社区
GLM5.2发布后证明了我一直以来的观点,中国模型(开源模型)在coding上只落后美国模型(闭源模型)6-8个月。 但是要知道Fable 5强的地方不是Coding能力(这方面它甚至和Opus4.8在一个水平),而是规划能力。 这也是完成Loop的重要能力(甚至是自动递归),这个差距可能来自于Anthropic模型范式的改进(latent reasoning)。 现在中美的Neo Lab们都在对这个峰顶进行冲刺。
显示更多