註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

实践哥 Li
@MinLiBuilds
AI Builder 超级个体。实践哥Li不做概念党,只聊 AI 实战。分享Claude,Codex,Grok,Gemini, 开源大模型各种一手折腾心得。
2.1K 正在關注    18.5K 粉絲
能不能让韩立本人,给学生讲一期雷法到底怎么修炼? 刷到一段韩立拔剑引雷的打斗,那几秒确实帅。 ⚡ 最近 Fotor Agent 挺火。能不能让它复刻这个画风,再让韩立一边引雷,一边给学生讲真正的“雷法”? 当然,不是真修仙。讲的是闪电科普。 什么是云闪,什么是地闪,为什么有的雷会劈到地面,云顶上那些红色的“精灵闪电”又是什么。 同样的知识,课本里可能就是一张示意图。 但如果换成: 🔥 韩立站在山顶,亲自引雷给你演示。 学生估计一下就愿意看了。 所以我直接把一段 53 秒的《凡人修仙传》打斗片段 丢给 Fotor Agent,只说了这个想法。 然后我基本就没管了。 它先自己把素材看了一遍,拆成: 蓄力 → 剑诀防御 → 大招 → 收尾。 又截了前面大约 14 秒 当风格参考,接着自己写科普脚本,拆成 7 个分镜。 我真正干的事情就一个: 看一遍,点“确认生成”。 最后真给我整出来一堂 53 秒的“修仙物理课”: 韩立站在山巅,一边引雷,一边给我们讲闪电。😂 🔥 不过这个产品更牛逼的地方,其实在后面:它生成的不是一条 MP4 成片,而是一个还能继续编辑的视频工程。 视频、配音、字幕,全都拆开放在多轨时间轴里。 哪一镜不满意就改单镜,字幕、音量、顺序继续调,非常丝滑。 而且这些生成出来的东西都变成了素材,以后还能反复拿来用。 🚀 越用越觉得,@fotor_com 其实很像 视频版 Coding Agent。 视频模型负责生成,上面那层 Harness 负责看素材、拆任务、调模型,再把所有东西组织成一个可以继续编辑的工程。 跟我做一样的视频: 点开视频,韩立的雷法课,开讲。👇
顯示更多
0
16
30
2
轉發到社區
太魔幻了,Astra 还在让大家惊叹:AI 终于会用 Blender 了。 结果Nex-AGI 已经直接出现在现实世界里了。 我只给了一个 Prompt: 做一根 6cm 的粉色活动香蕉,省点料。 然后我基本没碰 Blender。 它自己用 MCP 建模,Computer Use 看结果、自己修,最后直接吐给我一个 STL。 我顺手扔进拓竹。 👇 视频里正在一层一层长出来的,就是它自己设计的香蕉。 这一刻我是真有点惊到了。 Nex-AGI + Computer Use,能力完全超出我预期。 一句话 → Blender → STL → 3D 打印 → 实物。 🔥 这真的有点科幻了。 直接免费体验nex-agi :
顯示更多
0
120
335
196
轉發到社區
后来我翻看了他们的论文,确实挺牛逼。 更爽的是: 我这几天自己做的 Apodex vs Qwen 底座实验,居然正好踩中了这篇论文最核心的问题。😂 他们想证明的是: 后训练能不能把怎么干活直接训练进模型。 而我当时直接把同架构、同 INT4、同 128K、同 Harness 全锁死,只换模型和底模。 这样最后拉开的差距,基本就在测后训练本身。 结果也确实看到了: Search、规划、纠错、验证这些 Working Policy,真的能被训练进去。 论文很牛逼。 但看完以后最爽的是: 我没看论文,先把他们最关键的实验逻辑给做了。 点击下文查看论文。 或者点击我的原帖查看我的复刻过程 👇👇
顯示更多
🔥🔥兄弟姐妹们,你被「AI裁员」了吗?! 今天聊一个打工人都很关心的话题:「AI 裁员」!!! AI 甚至不需要裁掉你,才算抢走你的工作。 公司只需要做一件事:你离职以后,这个岗位从此消失 过去一年,AI 裁员成了互联网大厂最好用的公关遮羞布 - 业绩下滑叫 AI 转型 - 管理臃肿叫 AI 提效 - 预算砍光叫 AI 重组 只要套上AI,一次平庸的成本削减,听起来都像是在主动拥抱未来 打工人真的被技术淘汰了?还是公司终于找到了一个听起来更体面的裁员理由? 别再看营销号互相洗稿了,我直接用刚发布的Apodex 1.1,核查了近两年29个与AI叙事相关的科技公司裁员、减少招聘和组织调整案例,脱水媒体标题,只认硬核证据,扒出来的真相反直觉到让人发凉: 1. 刀锋向内:确实有 8 家大厂,是被 AI 直接干掉的 - Oracle:直接在 10-K 年报白纸黑字写明“AI 采用导致裁员”,全职员工净减 2.1 万 - Salesforce:50% 客服互动被 AI Agent 接管,团队从 9000 人暴砍至 5000 人 - Block & Snap:明确用内部 AI 缩减编制,一刀切掉外包 2. 钝刀割肉:最恐怖的隐性杀手,5 家大厂在玩“离职不补” - Shopify:想申请新HC?部门必须先自证“这活儿 AI 真的干不了” - ServiceNow:靠员工自然离职后“锁死空缺”来压平招聘。 这种软刀子在裁员新闻里根本看不见,但初级白领的门,正在被悄悄焊死 3. 全员演戏:最大的反转,近一半(14 家)大厂纯粹在拿 AI 甩锅! - 微软、亚马逊、Autodesk、Uber…… 官方信件里的真实原因全是“疫情过度扩张、去中层官僚化、组织扁平化”。 - 微软高管甚至公开澄清:“被裁岗位不会被 AI 替代。” 他们只是借着 AI 的风口演戏给资本市场看,顺便掩盖业务亏损。 这次用Apodex 1.1跑任务,最让我意外的不是它找了多少,而是它肯删: 审查环节把网上疯传的Snowflake技术写作团队、TikTok内容审核等“AI裁员实锤”重新检查了一遍 因为找不到足够的公司原始表述,最终全部删除或降级。 什么被采用,什么被排除,为什么,都留了记录 最后交付的不只是一份报告,还有一张29个案例、24个字段的Excel证据表和分类图。 跑完这一圈我才明白: AI 有时是刀,直接砍掉岗位; 有时是杠杆,让更少的人干更多活; 有时只是遮羞布,掩盖管理层的无能。 AI 最先抢走的,不是你当下的饭碗,而是你原本可以跳槽的下一份工作。 ---- 🔥打工人投个票:下面三种情况,你最怕哪一种? A. 明天醒来,AI直接替代了我的岗位 B. 行业集体冷冻,从此不再招聘这个岗位 C. 一次普通裁员,被包装成无法反驳的“AI提效” 评论区扣A/B/C 也聊聊你所在的行业:最近开始出现“离职不补、新人不招、一人兼三职”了吗?
顯示更多
牛来之后,孙哥一直在找妈妈。 这哪是吃瓜?像大电影。 我用游戏 CG 做了一个孙哥找妈妈
Qwen-3.8-Flash-Next 和 GLM 牛来,到底哪个更强? 今天不跑 benchmark 了。 我做一个赛博评测:直接让它们打一架。 这俩其实代表了两种很不一样的路线。 Qwen-3.8-Flash-Next,已经开始进入普通人可以本地部署、量化、折腾 runtime 的范围。 GLM 牛来则完全是另一种怪物: 能力很强,但对绝大多数人来说,本地部署基本没什么讨论意义。 但这些今天都不测了。 我决定让它们直接打一架。 丢进 90 年代街机横版地图里,全自动狠狠干。 🔥最后谁把谁打趴下,谁就是今天的 SOTA。 关键是: 这游戏我一行代码都没写。 我只是把这个脑洞丢给 @gearzero_alaya 。 角色、场景、战斗逻辑、技能、随机事件,它都能自己继续往下做。 玩下来我感觉,它就是一个专门干游戏开发的 Agent。 你负责说: “我要一只 Qwen 熊狠狠干 GLM 牛。” 剩下的让它自己想办法实现。 以前脑子里冒出来一个逗比游戏,基本也就笑完算了。 现在不一样了。 🔥Vibe Coding 再往前一步,Vibe Gaming 真开始变成现实了。 你们也去注册做一个: 我把我做的游戏丢评论区。你们也玩玩,是 qwen 强还是牛来强。 然后也做一个你们自己的,丢过来给我玩。🫡
顯示更多
实践哥 ,孙割和景甜这事用apodex调查一下是否可行,能把来龙去脉梳理出来吧,感觉都能把最终走向都能猜个八九不离十呢
又一位中文AI创作者,进入TOP行列 今天的「X指数·新星推荐」属于: @MinLiBuilds 实践哥MinLi 他长期专注AI实战 每当新的模型和工具出现,他都会先亲自体验,再把复杂的信息整理成普通人也能看懂、可以直接使用的经验 过去30天,他新增1,824名粉丝;最近一周曝光量突破100万!已迈入头部账号行列 截至目前: → X指数 603.8 → 账号等级 A++ → AI分类第 18名 → 全站排名第 51名 1.6万粉丝,同样可以凭借持续、有用、定位鲜明的内容,进入AI分类TOP20 恭喜实践哥MinLi
顯示更多
Qwen-3.8-Flash-Next 和 GLM 牛来,到底哪个更强? 今天不跑 benchmark 了。 我做一个赛博评测:直接让它们打一架。 这俩其实代表了两种很不一样的路线。 Qwen-3.8-Flash-Next,已经开始进入普通人可以本地部署、量化、折腾 runtime 的范围。 GLM 牛来则完全是另一种怪物: 能力很强,但对绝大多数人来说,本地部署基本没什么讨论意义。 但这些今天都不测了。 我决定让它们直接打一架。 丢进 90 年代街机横版地图里,全自动狠狠干。 🔥最后谁把谁打趴下,谁就是今天的 SOTA。 关键是: 这游戏我一行代码都没写。 我只是把这个脑洞丢给 @gearzero_alaya 。 角色、场景、战斗逻辑、技能、随机事件,它都能自己继续往下做。 玩下来我感觉,它就是一个专门干游戏开发的 Agent。 你负责说: “我要一只 Qwen 熊狠狠干 GLM 牛。” 剩下的让它自己想办法实现。 以前脑子里冒出来一个逗比游戏,基本也就笑完算了。 现在不一样了。 🔥Vibe Coding 再往前一步,Vibe Gaming 真开始变成现实了。 你们也去注册做一个: 我把我做的游戏丢评论区。你们也玩玩,是 qwen 强还是牛来强。 然后也做一个你们自己的,丢过来给我玩。🫡
顯示更多
0
33
19
0
轉發到社區
这个《天龙八部》的场景,每次看都热血沸腾。 这次文峰揍 Dario,也是这个味道。😂 中国技术圈对 AI 的认知,最后可能就一句: 开源是正义。 一个模型开出来,后面几千个人帮你量化、微调、适配 Runtime、狠狠干部署。 一个人开源,整个江湖都来帮你打。
顯示更多
还在把 md 当记忆补丁、把窗口加大当「有记忆」的,这篇值得认真拜读一下。 窗口再大也只是缓存。Harness 调的再顺,也只是外壳在进化,模型没进化。RAG 再全,也只是把查询相关的信息塞回到 prompt。官方这篇写得很硬核:这些做法给了 AI 更多的信息,但却不能让 agent 变的更强。 从初级助理变成熟手搭档的,是需要带着判断和反馈的工作经验——而这种东西网上是没有的。 两派人现在走的不是一条路。一边继续往外加检索、加会话摘要、加更长的上下文;而另一边则是把真实工作流里的判断、改稿、交付结果,经过筛选写回权重,再用质量门和回滚把进化锁住。前者每次接活都有点重来的味道,后者每干完一次,下一次再干就又有了很大的进步。 Alloomi 把应用层和模型层焊在一起,四层是一个飞轮,不是四个功能。OpenContext 开源的是第一层:时间上下文、记忆检索、上下文校正、多平台接入、主动调度。产品侧是 OKR 驱动的自进化数字员工,已经在法律、保险、投顾这些高专业度场景里共创。 下一阶段比的不是模型有多聪明,是它在真实世界里每干完一件活,学走了什么。 现在智能只是起跑线,而经验和判断力才是分叉口。你站哪边?👇
顯示更多
0
19
29
1
轉發到社區
看完实践哥的这个帖子,也验证了自己的想法,属于本地部署小模型的时代正式到来了。 整个八月可以说是阿里 Qwen 系列的天下,没人给他打广告,但是奈何产品自带广告属性,疯狂在大众面前刷屏。 尤其是开源大模型 Qwen3.8-27B,成功的把开源模型生态带到了前所未有的高度。 而实践哥实验的这个 Apodex-1.1-mini-GPTQ-Int4 就是 一个 35B 的开源模型后训练一下,就号称专业 Agent 能力已经能摸到甚至超过 Fable。 详情可以看看视频,那我相信很多人会跟我一样,有必要搞懂几个词 什么是后训练呢? 什么是预训练? 什么是微调? 什么是预训练? 预训练:相当于给模型打基础、学通识。 模型通过海量的网页、书籍、代码、论文等数据,不断做「预测下一个 Token」的训练,逐渐学会语言、知识、代码和基本的推理能力。 可以理解为: 让模型先“读万卷书”,变得见多识广。 预训练结束后,通常得到的是 Base Model(基座模型)。 什么是微调? 微调:就相当于在现有模型基础上做专项训练。 不用从头训练,而是拿一个已经训练好的模型,再用特定领域或任务的数据继续训练。 比如把通用模型训练成: 医疗模型 法律模型 编程模型 客服模型 SQL 模型 可以理解为: 模型已经大学毕业了,现在再去接受岗位专项培训。 LoRA 就是一种常见的低成本微调方式,只训练少量额外参数,而不是修改整个模型。 什么是后训练? 后训练:就相当于预训练完成以后,对模型进行的一整套“调教和实战训练”。 它不是一种具体算法,而是一个大的训练阶段。 包括: SFT 指令微调 DPO 偏好优化 RLHF RLVR 推理训练 安全训练 工具调用训练 Agent 训练 目的就是让模型从: “有能力” 变成:“知道怎么正确地把能力用出来”。 也就是让模型学会听指令、推理、拒绝不合适请求、调用工具、检查错误、完成复杂任务。 最后总结一下: 预训练决定模型的底子,微调让模型学会了专项,后训练则决定了模型怎么把能力真正的发挥出来。
顯示更多
0
30
17
1
轉發到社區
Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。 现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。 那问题来了: 后训练到底训练进去了什么? 是知识更多了?推理更强了?还是模型“干活的方式”变了? 我正好部署了两个特别适合做 A/B Test 的模型: 🔥Apodex-1.1-mini-GPTQ-Int4 vs 它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4 但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了: 在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。 同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。 一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。 这个我偏不信。 我正好有机器。我有两张 4090。 一张跑 Apodex,一张跑原版 Qwen。 同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。 所以这个实验非常干净: 底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。 结果越来越有意思。 甚至测出来一层能力,已经开始往 Fable 那个方向靠了。 🔥我给这两个模型和 Fable 出了一道预测题。 2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。 我提前几个小时,让它们预测: 总营收 GAAP 毛利率 Data Center 营收 下一季度指引 要求自己上网调研,最后给判断。 本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。 🔥结果这道题出了个非常离谱的乌龙。 底座其实非常努力。它搜了 40 次。 而且最离谱的是:它中间已经把正确答案全部查出来了。 然后到了最终答案——它自己把这些正确数据全扔了。 我一开始都看懵了。 后来翻完整 Agent 日志,才发现真正有意思的事情: 当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。 🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。 它看起来会更聪明、更机灵。 它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。 以后每个企业,都会有一个自己的模型。 不一定是从零预训练。 但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。 🔥小模型不一定非得和 Frontier Model 拼所有能力。 把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。 最后夸一下 Apodex。 这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。 一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。
顯示更多
0
114
93
30
轉發到社區
Qwen3.8-Flash-Next 的 GGUF,111GB 模型在双 4090 96G 竟然跑通了。 这模型是真的邪门。 我这台机器是: 2× RTX 4090 48G = 96GB 显存 62GB 内存 跑的是 Unsloth 的 UD-Q4_K_XL。 没开 MTP 下,最后实测生成速度稳定在: 66 tokens/s。 而且不是 1bit 那种“能跑就行”的版本,是 103.7 GiB 的 Q4,高质量档。 1. 先说 Q4:111GB 的模型,96GB 显存居然装下了 Q4_K_XL 的 GGUF 总共大概 111.3 GB。 正常看,这东西根本塞不进 96GB 显存。 但这个模型有一个很特殊的东西: PLE / N-gram Embedding。 单独一个 tensor: per_layer_token_embd.weight 就占了: 28.8 GB。 所以账其实是这么算的: 111.3 GB 总权重 28.8 GB PLE ≈ 82.5 GB 真正需要长期放 GPU 的权重 这一下,双 4090 就能装了。 而且这个 Q4 也不是简单粗暴全部 4bit。 Unsloth Dynamic 里面还有 125 个 tensor 保留成 Q8_0,主要是部分 ffn_down_exps。 它本质上还是一套“不均匀量化”。 该省的地方省,该保智商的地方继续给高 bit。 最后 wikitext-2 PPL: 3.9419 对比 IQ1_S 的: 4.6171 差距已经很明显。 试了 IQ1_S 做长代码生成直接会陷入 reasoning 死循环,降智严重。 🔥 显存最后占了多少? Q4_K_XL + PLE offload 之后: GPU 0: 41,308 MiB GPU 1: 39,020 MiB 合计: 80,328 MiB,也就是大约 80.3 GB。 96GB 显存还剩下差不多: 16GB。 这 16GB 还能继续留给 KV Cache。 而这个模型 KV 又特别省。 🔥这他娘的是个天才 48 层里面只有 12 层是 full attention,其他 36 层是 Gated DeltaNet。 所以 32K context 的 KV 大约才: 0.8 GB 128K 也才大概: 3.1 GB。 这也是为什么这玩意特别适合这种“显存装权重、内存放大查表”的玩法。 🔥最骚的是 PLE:28.8GB 直接扔进 CPU 内存 一开始我也担心: 卧槽,28GB 权重放内存,通过 PCIe 查,不得慢死? 结果恰恰相反。 IQ1_S 做 A/B: 全部进 GPU: 61.47 t/s PLE 放 CPU: 73.53 t/s 不但没掉,反而更快。 原因也比较好理解。 这个 28.8GB 并不是普通 Transformer 每个 token 都遍历 GEMM 的权重。 它本质上是一个巨大的随机查表结构。 每个 token 真正取的数据非常少。 所以你根本没必要为了这 28.8GB 的“大仓库”,给它长期占着 28.8GB 显存。 仓库放系统内存,需要什么拿什么。 这可能才是 Qwen3.8-Flash-Next 这个架构最有意思的地方之一。 以后这种超大 N-gram / embedding / retrieval 型参数越来越多以后: 总参数量 ≠ 显存需求。 这个概念会越来越重要。 🔥最后能跑的命令配方: llama-server \ -m /path/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \ -ngl 99 \ -fa on \ -ot 'per_layer_token_embd\.weight=CPU' \ -c 32768 \ --jinja \ --host 0.0.0.0 \ --port 8080 但是注意: 现在不能直接拿 llama.cpp master 来跑。 这个模型的 architecture 是: qwen4exp 而 llama.cpp 主线目前只有 qwen3next,还没有完整支持这个架构。 我最后用的是 Unsloth 自己的 PR 分支: unslothai:qwen4exp/qwen3.8-flash-next PR #27742。# 里面不只是加了 converter。 text graph、稀疏 attention、vision,还有几处 quantizer 修复都在里面。 也就是说: 权重下下来 ≠ 你就能跑。 Runtime 也必须跟上。
顯示更多
已经用手机通知电脑 去下载部署了
0
29
116
8
轉發到社區
已经用手机通知电脑 去下载部署了
我刚干了个挺有意思的实验: 用 Fable 5 和一个本地开源模型,提前预测 NVIDIA 财报。 同一道题,同一时间点,都自己上网 Research,最后给数字。 结果两边直接押反了。 一个明显押 超预期。 一个整体押 低于共识。 而且不是随便拍脑袋,两边都给了完整的数据和理由。 几个小时后财报开奖。😂 等结果出来,再看谁被狠狠干脸。
顯示更多
牛来已来。😂 Qwen 刚提前两个多小时抢跑, 智谱后脚就把 Ox Alpha 认领了。 今晚中国开源模型双响炮,真打起来了。 老外们,看到没? 牛来可以跑在中国芯片上
顯示更多
唐总,牛来呢?😂 熟悉的剧情。 上次 GLM 先发,结果千问后脚一个 Qwen3.8-27B Dense,把风头狠狠干走了。 这次更离谱。 千问自己明明预告: 今晚 23:00。 结果刚刚 20:30 多就提前官宣了。 足足抢跑两个多小时。怕是牛来风头太大。 而且 Qwen4 这条腿终于彻底露出来了: 125B MoE + 51B N-gram Embeddings,A6B GDN + QSA 混合 Attention、Gated Residual、N-gram Memory、Muon 全上了。 我们下午猜的那坨 51B 巨型记忆表,真有。 训练成本只有 Qwen3.7-Plus 的 1/9,官方说性能还全面超过它。 262K 原生上下文,能拉到 1M。 API 价格也狠狠干: Input $0.16/M Output $0.47/M 现在就剩一个问题: 那 51B 能不能狠狠干进内存。 可以好好研究一下了。 以及…… GLM,轮到你了。 唐总,牛来呢?😂
顯示更多
唐总,牛来呢?😂 熟悉的剧情。 上次 GLM 先发,结果千问后脚一个 Qwen3.8-27B Dense,把风头狠狠干走了。 这次更离谱。 千问自己明明预告: 今晚 23:00。 结果刚刚 20:30 多就提前官宣了。 足足抢跑两个多小时。怕是牛来风头太大。 而且 Qwen4 这条腿终于彻底露出来了: 125B MoE + 51B N-gram Embeddings,A6B GDN + QSA 混合 Attention、Gated Residual、N-gram Memory、Muon 全上了。 我们下午猜的那坨 51B 巨型记忆表,真有。 训练成本只有 Qwen3.7-Plus 的 1/9,官方说性能还全面超过它。 262K 原生上下文,能拉到 1M。 API 价格也狠狠干: Input $0.16/M Output $0.47/M 现在就剩一个问题: 那 51B 能不能狠狠干进内存。 可以好好研究一下了。 以及…… GLM,轮到你了。 唐总,牛来呢?😂
顯示更多
0
24
35
3
轉發到社區
今晚中国开源模型圈双响炮。 Qwen3.8-Flash-Next:Qwen4 新架构预览,今晚开权重。 Ox Alpha:智谱已向彭埠社确认,就是 GLM 系列新版本,今晚也放权重。 我准备第一时间把,Qwen 部署上。 最期待的还是唐总出来一句: “对,牛来就是我。” 😂 最近智谱股价也够刺激。 8 月 24 日单日跌了 10.81%,前一周还出现过 -13.3% 的一天。 这时候真的需要来头牛了。 牛来。 牛来。 快涨啊 😂
顯示更多
5090 这次要吃亏了。显存不够。😂 如果社区扒出来的参数最后是真的: 125B MoE,A6B + 51B N-gram Embeddings 总参数大约 176B。 🔥而且 Unsloth 已经明确回复了: “Yes we are working day zero support for it.” 但这次最有意思的,Qwen4 附带了一个大词表。 以前的 Qwen 当然也有词表,也有 Embedding。 比如 Qwen3.8-27B 这种普通 Dense 模型,也要先把 Token 映射成 embedding vector,再送进 Transformer 里算。 区别是: 以前这种 Token Embedding 只是模型入口的一小部分。 这次传闻里的 51B N-gram Embeddings,如果属实,就完全不是一个量级了。 如果这 51B 能独立量化、放系统内存或者统一内存,GPU 按需 lookup,那一个看着 176B 的模型,实际 GPU 部署门槛可能低很多。 🔥硬件版图也突然变得很有意思: BF16 → M5 Ultra 512G FP8 → 双 DGX Spark 4bit → 单 Spark / PRO 6000 96G / 双 48G 4090 然后最尴尬的来了: 双 5090。 算力很猛。 两张卡加起来才 64GB 显存。 这次可能真要被显存卡死。👇
顯示更多
0
19
26
0
轉發到社區
5090 这次要吃亏了。显存不够。😂 如果社区扒出来的参数最后是真的: 125B MoE,A6B + 51B N-gram Embeddings 总参数大约 176B。 🔥而且 Unsloth 已经明确回复了: “Yes we are working day zero support for it.” 但这次最有意思的,Qwen4 附带了一个大词表。 以前的 Qwen 当然也有词表,也有 Embedding。 比如 Qwen3.8-27B 这种普通 Dense 模型,也要先把 Token 映射成 embedding vector,再送进 Transformer 里算。 区别是: 以前这种 Token Embedding 只是模型入口的一小部分。 这次传闻里的 51B N-gram Embeddings,如果属实,就完全不是一个量级了。 如果这 51B 能独立量化、放系统内存或者统一内存,GPU 按需 lookup,那一个看着 176B 的模型,实际 GPU 部署门槛可能低很多。 🔥硬件版图也突然变得很有意思: BF16 → M5 Ultra 512G FP8 → 双 DGX Spark 4bit → 单 Spark / PRO 6000 96G / 双 48G 4090 然后最尴尬的来了: 双 5090。 算力很猛。 两张卡加起来才 64GB 显存。 这次可能真要被显存卡死。👇
顯示更多
0
33
29
4
轉發到社區
上次 Claude 大挂机,折腾了三个多小时。 Anthropic TM 连个屁都没有。 结果 Anthropic 转头面对投资人: 兄弟们,我 TAM 30 万亿美元。 😂😂😂 好家伙,终于学会老黄了。 怎么算的? AI 未来能干多少人类的活,就把这些活对应的市场全算进来。 这已经不是卖 AI 了。 这是准备参与全球 GDP 分成。 当然,30 万亿美元是 TAM,不是 Anthropic 预测自己能赚 30 万亿。 但按照这个算法…… 服务可以挂。 复盘可以没有。 饼必须画到全球 GDP。 下一页 PPT 可以直接写: 全球 GDP:我们的长期 TAM。 老黄看了都得点头: 这孩子终于学会怎么做 PPT 了。🫡
顯示更多
很难想象,claude 在发生这么大的故障后,官方集体装死 1 天,没有任何声明
这玩意在中国我感觉要被卖疯了。 如果你有 500 万,买 35 台 512GB M5 Ultra 还是 8 卡H200 整机? 国内 H200 整机报价500 万。 算一下推理预算: 8×H200:1.13TB HBM3e。 35×M5 Ultra:17.9TB 统一内存。多买 16 倍。 H200 单卡 HBM 4.8TB/s,当然狠狠干苹果 1.2TB/s 但一个巨型模型拆到 8 张卡以后,卡间 NVLink 是 900GB/s。 苹果这边直接给你: 单机 512GB 统一内存,1.2TB/s。 35 台。 DeepSeek、GLM、Qwen 这种巨型 MoE,量化以后整只模型直接塞进去。 所以如果我要训练,H200 没什么好说的。 但如果我要的是 Agent 推理,这账就开始邪门了。 500 万买一台 8 卡服务器, 还是搞35 台 Mac,每人发一台,每台塞一份大 MoE? 更何况这是中国。 顶级 NVIDIA 数据中心 GPU 又贵,又受到出口管制。 苹果: 兄弟,我就是卖 Mac 的。😂 所以我感觉这台 512GB M5 Ultra 在中国真的要被卖疯。 真正能让老黄的刀变钝的,可能不是另一家 CUDA。 是苹果。 竞品才是最好的驱动。老黄今晚睡不好了,该不该跟进 🫡
顯示更多
装了一把土豪,购物车已加好。 这个 Mac Studio M5 Ultra 芯片,1.2TB/s 的内存带宽,97999 元。 256G 的内存,4T 的丐版硬盘。 跑 deepseek flash int4 非常好。 如果要跑更高精度的,可以等等 10 月份出的 512GB 内存版的,只要再加 3 万元,127999 元。 可以取 3 个老婆了 🫡
顯示更多
0
76
201
19
轉發到社區
🔥 终于有人把我想做的测试先做了。 同一台 DGX Spark,同一个 Qwen3.8-27B,用类似的 4-bit 量化级别: SGLang / vLLM / llama.cpp 三个 Runtime Pk 跑一轮。 先看单路 Coding + DFlash2: SGLang:36.59 tok/s vLLM:32.01 tok/s llama.cpp:30.02 tok/s SGLang 最快。 🔥结果到了 Agent Tool Calling,反转了 SGLang:54.99 tok/s,16/18 成功 vLLM:47.41 tok/s,18/18 全过 最后跑 Tool-heavy Agent,反而推荐 vLLM + DFlash2。 这里说明一下:这不是三个 Runtime 共用完全相同的模型文件。 SGLang 和 vLLM 都是 NVFP4,但量化/转换产物不同;llama.cpp 用的是 GGUF Q4_K_M。 所以更准确地说,这是: 同模型、同机器、类似量化级别,不同完整部署栈的实战横评。 这个结果我觉得特别有意思。 以前测 Runtime,大家狠狠干 tok/s。 到了 Agent 时代,最快的 Runtime,不一定是最好的 Agent Runtime。 Parser、Tool Calling、长任务稳定性,都得一起测。 不然 55 tok/s 跑得飞快。 最后工具没调出来 😂
顯示更多
单卡 DGX Spark 跑 Qwen3.8-27B FP8 + DSpark k=14 投机解码:改代码该文章 30~45+ tok/s,但闲聊只有 ~8 tok/s 投机解码只对照抄型输出有效。 不适合多人并发。 我觉得DGX Spark 不适合部署 Qwen ,273 GB/s带宽下 27B dense 现编就是 ~10 tok/s 顶天。 可以再观望一下社区的优化。
顯示更多
0
48
10
3
轉發到社區