註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 推测性解码
推测性解码 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 推测性解码 的搜尋結果
DeepSeek真的是性价比和技术双重斩杀线... 有同学看不懂DSpark是啥, 简单给大家写个小教程讲讲. 推测性解码(投机解码)这个技术是用来提升大模型输出速度的. 本质是让小模型给大模型接话, 大模型判断小模型说的对不对. 因为现在模型普遍卡内存带宽, 而GPU算力是富余的, 所以大模型的prefill速度(看字)比decode速度(吐字)快很多. 那么让小模型沿着大模型的思路先说一段话, 大模型判断对不对(只需要看字), 只要小模型猜对了, 那么这就利用了prefill速度, 吐字就会成倍的提升. 但问题来了, 外挂小模型也要看字(prefill), 也要占用显存, 也要吃显存带宽. 那么有没有更好的方法来解决呢? 来了, 这就是DSpark. 看我的这个图(左侧DSv4架构图是 @rasbt 大佬的), DSpark 接在了 Final RMSNorm 过程中. 不是接一个完整的小模型, 而是一个3 层的MTP(多Token预测)微型Transformer堆叠. 大模型算完前面60多层后, 刚把当前这句话的"高浓缩概念"(特征向量/隐藏状态)推到 Final RMSNorm 这个出口,还没来得及翻译成具体文字时,DSpark开始截胡: 首先是半自回归极速脑补 (MTP + Markov Head), DSpark自己有一丢丢参数, 然后它就瞬间并行猜5个字(特征向量), 然后再用自己内部的一个串行网络理顺逻辑. (注意啊,先并行然后串行消除并行导致的逻辑不连贯). 然后, 它会有一个置信度预测头, 预判自己猜的准不准, 比如5个字的后2不准就直接砍掉, 防止后续送回大模型浪费算力. 最后把留下的3个字塞回词表映射层, 把向量翻译为token. 到此为止DSpark工作就做完了. 然后就是大模型扫一遍DSpark输出的对不对(只用prefill,不decode), 一旦正确了, 就直接吐字, 这样之前模型一次只能吐一个字, 现在就能吐3个字了! 最后, 推测性解码是不会降智的, 速度能提升60%-85%! 之前是雇一个小模型帮忙写草稿, 现在则是直接脑子里植入芯片了. 目前SGLang已经有这个特性的PR了(29538), 而且DeepSeek刚在自己的HuggingFace主页发了一大堆小模型的DSpark魔改版. 大胆猜一波未来发布的模型会不会标配DSpark? #dspark# #deepseek# #投机解码# #推测性解码#
顯示更多
0
18
203
25
轉發到社區
本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意原始精度要到1.5TB, 本地跑的很少有富到这个程度的, 所以大家都用各种量化版本, 毕竟4bit量化就只要430GB了. 问题这就来了, 由于 GLM-5.2 的 MTP 采用了非常特殊的 DSA (动态稀疏注意力), 导致目前几个推理引擎 (llama.cpp, vLLM, mlx) 都无法支持. 其中 llama.cpp, mlx 是完全没办法开 MTP, vLLM 只支持FP8精度的. 而SGLang 没事哈, SGLang 架构比较屌上来就支持同一个计算流使用混合精度. 所以直接用 GLM-5.2-W4AFP8 就行. 所以回到这几个不支持的推理引擎, 大部分的量化版本 GLM-5.2 开了 MTP 反而会掉速度. 甚至有的量化版本直接把MTP部分给砍了(mlx). 而社区作者dnhkng搞了个缝合方法, 最终搞出了 GLM-5.2-AWQ-INT4-FP8-MTP-delta, 即 底座用 INT4(走 Marlin 算子)+ MTP 用 FP8(保持精度)同时还能让vLLM 支持. 速度从原来的 2 token/s 直接飙升到了 43.39 token/s (绑定NUMA+MTP-3) 所以目前位置 SGLang 和 vLLM (魔改版)都能直接火力全开跑带MTP的 GLM-5.2了. 而 llama.cpp和mlx用户还需要再等等. 社区还在弄. 这个作者的blog (过程极其精彩, 有不少优化技巧): #glm52# #mtp# #dsa#
顯示更多
0
66
208
30
轉發到社區
DeepSeek 最新论文DSpark:让大模型说得更快 解决核心问题: 大模型生成文字像一个人写作文,必须一个字一个字地写,速度很慢。推测解码的思路是:先让一个小助理快速写一段草稿,再让主角(大模型)一次性检查整段,对的保留、错的纠正。 但现有方案有两个毛病: 1、小助理写的后半段经常跑偏。比如它想写of course,但of和course是各猜各的,结果可能拼出of problem,越往后越离谱。 2、检查浪费严重。明知道后半段大概率不对,还一个个去验证,白白浪费算力。 DSpark 的两个妙招 妙招一:边写边看前面写了什么 小助理写草稿时,前面的部分用并行快速生成(像打字机一次出一片),但从第二个字开始,用一个极轻量的模块看看前一个字是什么再写下一个。比如看到前面写了of,就自动偏向course而抑制problem。 这个看一眼的代价极低,只多了约 1% 的时间,但草稿质量大幅提升。 妙招二:不靠谱的就不查了 给草稿每个位置打个信心分。比如写代码,前几个字信心很高(0.95),可以放心验证;写闲聊时后几个字信心很低(0.3),就直接砍掉不查。 论文里有个直观数据:闲聊场景下,原来只有 45.7% 的草稿被接受,用了信心调度后跳到 95.7%,少做了一半多的无用功。 效果如何? 在 DeepSeek-V4 真实生产环境中: - 用户感知的生成速度提升了 60%-85% - 高并发时不再卡死,此前达不到的服务等级现在可以做到了 - 额外延迟开销仅 1%-2% 打个比方:原来一个 GPU 能同时服务 100 个用户且体验流畅,现在同样的硬件可以服务 160-185 个用户。 为什么重要? 这篇论文不只是一个算法技巧,是把草稿质量和系统调度打通了。就像餐厅不光要菜做得好(草稿质量高),还要会排号(智能调度验证顺序),两者结合才能让翻台率最大化。 DeepSeek 还开源了代码和模型,其他团队可以直接拿来用或改进,这对整个大模型推理加速领域是实打实的推动。
顯示更多
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
顯示更多
0
28
325
66
轉發到社區
推测产品经理的考核应该加一个点,是否把这些垃圾广告屏蔽,因为不是能不能的问题,而是愿不愿意的问题。 为了保持数据流量更好看,汇报时更漂亮,那当然不愿意清理掉,因为这些是推特上很大的数据来源。 为了用户体验更好,那就一定会弄掉,这才符合第一性原理。 @elonmusk
顯示更多
0
25
20
0
轉發到社區
中午在家里问语音豆包推测比赛结果 我老公听到了,问了一下我的买球思路 说我这种思路很傻,属于拿大本金博蚊子肉的玩法一届世界杯全程下来一定是亏的,就好比昨天墨西哥那场,买了1000单关胜负,赢了奖金是260,连本带利一共1260,他说这种买法哪怕你每次本金不变连续能买强队赢5次,后面只要有主流强队爆冷输一次那之前的所有利润几乎全部回吐,中途再输一次本金也没了,买球一定要以小博大,买串比分或者让胜平负,至少也要二串一才有赚的可能性,而且本金一定要控制的小,同样的1000块,拆成5份甚至10份在后面不同的场次买,才能保证最终赢钱概率大于输钱,刚才他给我一个二串一比分,100块赢的话能有三四千的收益,输了100块钱也无所谓😑 但是我看到X上今天好多人都是我这种本金单关买胜负玩法啊,比如拿200美金买了韩国胜,赢了多赚200还挺开心,我老公平时是不碰球也不买球的,他的思路我也是第一次知道,不知道对错,懂的人告诉我一下我老公说的对吗?
顯示更多
在人类进化过程中,在运动的宇宙中,表象的复杂性使人类感到困惑,从而形成了对现实和非现实的错误概念。 人类的生活如此热衷于观察复杂的表象现象,以至于表象成了事实,而唯一的现实却变成了纯粹的推测。 人通常以固体、那些能被感官感知的事物来理解可靠性。他所认为的可靠现实是物质的形式。 人从虚幻的、无法被感官感知的事物角度来思考不可靠性。他的非现实感就是精神。 人必须学会改变他对实体现实的认知,转而认识到心灵才是实体幻觉的根源。 他必须明白,唯一的现实本质就是那唯一的心灵。 ——Walter Russell 沃特尔. 罗素《The Universal One》
顯示更多
淫商在生活中的重要性 同事艾莉的老公年薪两百万,做爱像填Excel表格 一个朋友跟我吃饭,喝了两杯酒,突然冒出一句: "他什么都好。就是上床的时候,我觉得自己是个任务。" 她老公,985本硕,大厂技术总监,年薪两百万出头。 智商没得挑。 情商也不差——记得住每个纪念日,吵完架会主动道歉,朋友圈从来不发让她不舒服的东西。 但她说了一句让我半天没接上话的话: "他碰我的时候,我能感觉到他在走流程。" 前戏多长,哪个步骤先来,什么时候进入,什么姿势切换···这些像一份他在脑子里排好的SOP。 每一步都对。 但她的身体,一点反应都没有。 "我躺在那儿,他很努力,我知道他很努力。但我就是……干的。" 她说这两个字的时候,眼睛看着桌面,声音很轻。 不是抱怨。是困惑。 她困惑的是,一个这么聪明、这么体贴的男人,为什么碰她的时候,她的身体像一扇关着的门? 因为智商和情商,在床上都不好使 这话说出来很多人不服。 尤其是那些自认为"高情商"的人,我都这么照顾对方感受了,怎么可能不好使? 好,我拆给你听。 智商解决的是"世界怎么运转"的问题。 它让你能读懂一篇论文,能算清一笔账,能在复杂的商业局里看见别人看不见的路。 但它帮不了你在她喘息变重的那一秒判断——下一步该加速,还是故意停下来。 情商解决的是"别人在想什么"的问题。 它让你能在饭局上说对话,能在吵架时踩准对方的情绪节奏,能让人觉得跟你相处很舒服。 但它帮不了你在她身体弓起来的那一刻读懂——她现在要的不是温柔,是被用力按住。 智商是脑子对脑子。 情商是情绪对情绪。 但床上那些事,是身体对身体。 身体有自己的语言,自己的语法,自己的潜台词。 这套语言,智商听不见,情商翻译不了。 能听见它的,是另一种东西。 淫商。 什么是淫商? 不是技术。不是经验。不是你睡过多少人。 淫商是你对欲望的感知力。 包括三层: 第一层:你能不能听见自己身体的声音。 你知道自己什么时候真的想要,什么时候只是无聊?你能分清"我想被拥抱"和"我想被进入"的区别吗?你在高潮之后,是满足,还是空虚?你有没有认真想过这个问题? 大多数人活了二三十年,连自己身体的基本需求都说不清楚。 你的身体在深夜发出信号——发热、发紧、发湿——你的第一反应不是去感受它,而是压下去。假装没有。因为你被教育过:好人不应该有这种强烈的身体反应。 一个连自己身体说什么都听不见的人,淫商为零。 第二层:你能不能听见对方身体的声音。 她的呼吸变了,你听到了吗? 她的腰往上抬了一寸,你知道那是什么意思吗? 她咬住下唇的那一秒,是在忍耐快感,还是在忍耐疼痛? 她说"不要"的时候,是真的不要,还是要你更用力? 这不是猜。不是赌。是你的身体和她的身体之间有一条实时通道,你能不能接收到那些没有变成语言的信号。 智商高的人习惯用逻辑分析:"她说不要,那就停。" 情商高的人习惯用共情推测:"她可能是害羞,我温柔一点。" 淫商高的人不分析也不推测——他的身体知道。 因为他在碰她的时候,自己的皮肤也在接收信息。她的温度变化、她的肌肉收缩、她呼吸频率的每一次变化——全部通过触觉实时传入他的神经系统。 他不需要想。他的手自己会做出反应。 这不是天赋。这是长期不压抑自己身体感受的结果。 第三层:你能不能在欲望面前诚实。 这是最难的一层。 你能不能在做爱的时候,不表演? 你能不能告诉对方:"这里,再重一点"? 你能不能在对方问你"舒服吗"的时候,说出真话而不是"嗯挺好的"? 你能不能在想要的时候主动伸手,而不是等对方来猜? 你能不能承认——你有欲望,你渴望被触碰,你渴望被填满,你渴望在另一个人面前彻底放弃体面? 大部分人做不到。 不是因为害羞。是因为淫商低的人,把欲望和羞耻焊在了一起——想要的同时就在否定自己,享受的同时就在厌恶自己。 淫商高的人只有一种状态:我知道我要什么,我不为此道歉。 淫商低的人长什么样? 你一定见过。 那个做爱全程闭着眼、一声不吭、结束后立刻翻身穿衣服的人——不是性冷淡,是淫商低到身体和意识完全断联。 那个每次都用同一套动作、同一个节奏、像执行任务一样机械地完成全过程的人,不是不爱你,是他根本感觉不到你的身体在说什么。 那个在你最投入的时候突然问"你到了没有"的人,不是关心你,是他的焦虑盖过了他的感受力,他在用脑子做爱,不是用身体。 还有那个 做完之后,你明明还在余韵里,浑身发软,皮肤上每一寸都还残留着他的温度,你想让这一刻再停留几秒。 他拿起手机,开始刷短视频。 那一刻,你的身体比你的脑子更早明白:他不在这里。他从来都不在这里。 淫商高的人长什么样? 不一定好看。不一定有钱。不一定读过什么性学理论。 但你能感觉到。 他碰你的时候,你知道他在。 不是在走流程,不是在完成任务,不是在证明自己行。 他在。 他的手指从你锁骨滑下去的时候,速度会变——因为他感觉到了你的皮肤在他指尖下起了一层细微的鸡皮疙瘩。 他亲你脖子的时候,嘴唇会停——因为他感觉到了你的呼吸突然断了一拍。 他进入你的那一刻,他会看你的眼睛,不是确认"可不可以",是他想看见你在那一秒的表情,因为那个表情让他比任何时刻都硬。 他不是在操你。他是在和你的身体对话。 每一次触碰都是一个问句,每一次回应都是一个回答。 你的喘息变急了,他知道该加速。 你的手抓紧了他的背,他知道别停。 你突然安静了,他知道你正在攀升,这一刻最需要的是稳定的节奏而不是花样。 他不需要你开口。你的身体已经把一切都告诉他了。 而他听得见。 这就是淫商。 为什么我说淫商比智商和情商都重要? 不是因为性比事业和社交更重要。 是因为,淫商的底层能力,是智商和情商都给不了你的东西:对真实的承受力。 智商让你擅长构建秩序。但秩序是控制的产物。 情商让你擅长管理关系。但管理是表演的产物。 淫商要求你放弃控制,停止表演。 你没法用逻辑操控高潮。 你没法用情绪管理假装快感。 在床上,你的身体会出卖你所有的伪装。 你紧不紧张,你在不在场,你有没有真的放开——全都写在你的皮肤上、你的呼吸里、你的肌肉反应中。 床是这个世界上最诚实的地方。 一个淫商高的人,意味着他能承受这种诚实。 他不怕暴露自己的渴望。不怕看见对方最真实的样子。不怕在最脆弱的时刻敞开自己。 这种能力,带到床下 他做决策时更果断,因为他习惯了面对真实而不是逃进分析。 他处理关系时更直接,因为他习惯了读懂身体语言而不是猜来猜去。 他面对自己时更坦然,因为他早就接受了:我有欲望,我不完美,但我是真的。 智商让你赢得世界。情商让你赢得人心。淫商让你赢得自己。 而一个连自己都赢不了的人,赢了世界和人心又怎样? 淫商能不能后天提高? 能。 但方法不是看片,不是学技巧,不是背什么"让女人高潮的十个秘诀"。 第一步:停止惩罚自己的身体反应。 下次你在深夜感到发热、发紧、渴望被触碰的时候——不要压下去,不要转移注意力,不要用刷手机来麻痹那股热意。感受它。让它在你身体里待一会儿。它不脏,它是你的。 第二步:做爱的时候,把脑子关掉。 不想"我表现得够不够好"。不想"她是不是满意"。不想"我是不是该换个姿势了"。把注意力全部放到你的皮肤上,你碰到了什么温度,什么质感,什么节奏。像一个盲人用指尖阅读一样,去读对方的身体。 第三步:开口说出你真正想要的。 这是最难的一步,也是淫商飞跃的唯一路径。 不是"你喜欢什么我都行"。 是"我想要你这样碰我"。 是"这里,再慢一点"。 是"不要停"。 说出口的那一刻,你的淫商就已经在提升了。 因为你终于停止了和自己的欲望作战。 智商是你和世界的关系。 情商是你和别人的关系。 淫商是你和自己身体的关系。 三种关系里,最容易被忽视的那个,恰恰是最底层的那个。 因为一个连自己的身体都不敢诚实面对的人 他对世界的理解是隔着一层玻璃的。 他对别人的共情是带着剧本的。 他活着,但他不在场。 你敢不敢给自己的淫商打个分? 0到10,你打几分?
顯示更多
机器人最重要的是AI,现在XAI被SPACEX收购,那么一个合理的推测是:特斯拉也应该会被收购。 这好像才是符合“第一性原理”的做法,方便特斯拉未来10年最重要的机器人大脑协同。 猜测这会发生在SPACEX市值越来越大,而特斯拉市值下跌的时候。
顯示更多
0
56
60
11
轉發到社區
昨天看到Polymarket的概率从30%降到18%,跌加盘前Circle和比特币开始下跌,就推测大概率Clarity法案要投票失败。 下一次动议大概率要等到11 月 3 日中期选举结束到 2027 年 1 月 3 日之间的lame duck season。 而这也取决于中期选举的结果: 1. 共和党保住参众两院(Polymarket概率 11%) CLARITY 延续性最好,2027 年仍可继续推,但参议院 60 票门槛还在,依然需要民主党支持。 2. 民主党拿下众议院,共和党保住参议院(Polymarket概率 33%) 2026 年 11–12 月 lame-duck 窗口会变得更重要。若拖到 2027 年,新的民主党众议院大概率会要求重谈部分条款。 3. 民主党拿下参议院(Polymarket概率 1%) 影响更大。Senate Banking Committee 控制权和议程会变化,现有 CLARITY 文本更可能被重新修改,尤其是 DeFi、SEC 权限、AML 和利益冲突条款。 4. 民主党拿下参众两院(Polymarket概率 53%) 如果 CLARITY 没能在 2026 年底前通过,2027 年大概率会进入新一轮市场结构立法谈判,当前版本延续的难度最高。
顯示更多