注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 推测性解码
推测性解码 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 推测性解码 的推特
DeepSeek真的是性价比和技术双重斩杀线... 有同学看不懂DSpark是啥, 简单给大家写个小教程讲讲. 推测性解码(投机解码)这个技术是用来提升大模型输出速度的. 本质是让小模型给大模型接话, 大模型判断小模型说的对不对. 因为现在模型普遍卡内存带宽, 而GPU算力是富余的, 所以大模型的prefill速度(看字)比decode速度(吐字)快很多. 那么让小模型沿着大模型的思路先说一段话, 大模型判断对不对(只需要看字), 只要小模型猜对了, 那么这就利用了prefill速度, 吐字就会成倍的提升. 但问题来了, 外挂小模型也要看字(prefill), 也要占用显存, 也要吃显存带宽. 那么有没有更好的方法来解决呢? 来了, 这就是DSpark. 看我的这个图(左侧DSv4架构图是 @rasbt 大佬的), DSpark 接在了 Final RMSNorm 过程中. 不是接一个完整的小模型, 而是一个3 层的MTP(多Token预测)微型Transformer堆叠. 大模型算完前面60多层后, 刚把当前这句话的"高浓缩概念"(特征向量/隐藏状态)推到 Final RMSNorm 这个出口,还没来得及翻译成具体文字时,DSpark开始截胡: 首先是半自回归极速脑补 (MTP + Markov Head), DSpark自己有一丢丢参数, 然后它就瞬间并行猜5个字(特征向量), 然后再用自己内部的一个串行网络理顺逻辑. (注意啊,先并行然后串行消除并行导致的逻辑不连贯). 然后, 它会有一个置信度预测头, 预判自己猜的准不准, 比如5个字的后2不准就直接砍掉, 防止后续送回大模型浪费算力. 最后把留下的3个字塞回词表映射层, 把向量翻译为token. 到此为止DSpark工作就做完了. 然后就是大模型扫一遍DSpark输出的对不对(只用prefill,不decode), 一旦正确了, 就直接吐字, 这样之前模型一次只能吐一个字, 现在就能吐3个字了! 最后, 推测性解码是不会降智的, 速度能提升60%-85%! 之前是雇一个小模型帮忙写草稿, 现在则是直接脑子里植入芯片了. 目前SGLang已经有这个特性的PR了(29538), 而且DeepSeek刚在自己的HuggingFace主页发了一大堆小模型的DSpark魔改版. 大胆猜一波未来发布的模型会不会标配DSpark? #dspark# #deepseek# #投机解码# #推测性解码#
显示更多
0
18
203
25
转发到社区
本地用vLLM部署GLM-5.2的速度终于上来了! 好消息终于轮到本地部署 GLM-5.2 了! 大家都知道 GLM-5.2 这次是自带了MTP头的, 可以进行推测性解码. 但是, 这个只适用于bf16原始精度的GLM-5.2, 而这玩意原始精度要到1.5TB, 本地跑的很少有富到这个程度的, 所以大家都用各种量化版本, 毕竟4bit量化就只要430GB了. 问题这就来了, 由于 GLM-5.2 的 MTP 采用了非常特殊的 DSA (动态稀疏注意力), 导致目前几个推理引擎 (llama.cpp, vLLM, mlx) 都无法支持. 其中 llama.cpp, mlx 是完全没办法开 MTP, vLLM 只支持FP8精度的. 而SGLang 没事哈, SGLang 架构比较屌上来就支持同一个计算流使用混合精度. 所以直接用 GLM-5.2-W4AFP8 就行. 所以回到这几个不支持的推理引擎, 大部分的量化版本 GLM-5.2 开了 MTP 反而会掉速度. 甚至有的量化版本直接把MTP部分给砍了(mlx). 而社区作者dnhkng搞了个缝合方法, 最终搞出了 GLM-5.2-AWQ-INT4-FP8-MTP-delta, 即 底座用 INT4(走 Marlin 算子)+ MTP 用 FP8(保持精度)同时还能让vLLM 支持. 速度从原来的 2 token/s 直接飙升到了 43.39 token/s (绑定NUMA+MTP-3) 所以目前位置 SGLang 和 vLLM (魔改版)都能直接火力全开跑带MTP的 GLM-5.2了. 而 llama.cpp和mlx用户还需要再等等. 社区还在弄. 这个作者的blog (过程极其精彩, 有不少优化技巧): #glm52# #mtp# #dsa#
显示更多
0
66
208
30
转发到社区
DeepSeek 最新论文DSpark:让大模型说得更快 解决核心问题: 大模型生成文字像一个人写作文,必须一个字一个字地写,速度很慢。推测解码的思路是:先让一个小助理快速写一段草稿,再让主角(大模型)一次性检查整段,对的保留、错的纠正。 但现有方案有两个毛病: 1、小助理写的后半段经常跑偏。比如它想写of course,但of和course是各猜各的,结果可能拼出of problem,越往后越离谱。 2、检查浪费严重。明知道后半段大概率不对,还一个个去验证,白白浪费算力。 DSpark 的两个妙招 妙招一:边写边看前面写了什么 小助理写草稿时,前面的部分用并行快速生成(像打字机一次出一片),但从第二个字开始,用一个极轻量的模块看看前一个字是什么再写下一个。比如看到前面写了of,就自动偏向course而抑制problem。 这个看一眼的代价极低,只多了约 1% 的时间,但草稿质量大幅提升。 妙招二:不靠谱的就不查了 给草稿每个位置打个信心分。比如写代码,前几个字信心很高(0.95),可以放心验证;写闲聊时后几个字信心很低(0.3),就直接砍掉不查。 论文里有个直观数据:闲聊场景下,原来只有 45.7% 的草稿被接受,用了信心调度后跳到 95.7%,少做了一半多的无用功。 效果如何? 在 DeepSeek-V4 真实生产环境中: - 用户感知的生成速度提升了 60%-85% - 高并发时不再卡死,此前达不到的服务等级现在可以做到了 - 额外延迟开销仅 1%-2% 打个比方:原来一个 GPU 能同时服务 100 个用户且体验流畅,现在同样的硬件可以服务 160-185 个用户。 为什么重要? 这篇论文不只是一个算法技巧,是把草稿质量和系统调度打通了。就像餐厅不光要菜做得好(草稿质量高),还要会排号(智能调度验证顺序),两者结合才能让翻台率最大化。 DeepSeek 还开源了代码和模型,其他团队可以直接拿来用或改进,这对整个大模型推理加速领域是实打实的推动。
显示更多
转一下苏剑林老师对 K3 架构的复盘。 一句话概括,K3 = KDA + MLA + Stable LatentMoE + AttnRes。整套设计没什么炫技,核心就是在模型效果、计算效率和训练稳定性之间做取舍。 这里稍微解释一下: KDA,一种线性 Attention MLA,一种 KV Cache 较小的 Full Attention 变体 Stable LatentMoE,对 LatentMoE 做过稳定性改造的 MoE 方案 AttnRes,用可学习的跨层注意力,替代固定等权的残差累加 几个比较有意思的点: ① K3 同时使用了 KDA 和 MLA。另外,训练仍然用 Moonlight 版本的 Muon 优化器,Attention 权重改成 Per-Head Muon,每个 Head 独立优化。苏神说这不会直接提高效果,主要是数学和结构上更合理:各个 Head 本来就相对独立,不应该在优化时耦合在一起。 ② 解决MoE“容易炸”的问题。 LatentMoE 会先降维,再使用更多专家,最后升维,在训推成本大致相同的情况下效果略好。不过连续的矩阵投影也让训练更容易出现数值不稳定。 K3 把 SwiGLU 换成了 SiTU-GLU,用 softcap 压住异常激活;又在 LatentMoE 升维前加了一层 RMS Norm。这个 Norm 不只是让训练更稳定,在 Valid Loss 差不多的情况下,不加它,某些 Benchmark 会稳定变差。 (这里有超级多的技术细节,感兴趣的可以看苏神原文) ③ 关于MLA DSV4 看上去都换设计了,K3 怎么还在用 MLA?苏神的答案是,目前 MLA 仍然很难被全面击败。它在训练阶段是 MHA 形态,推理时 KV Cache 较小;在固定训练成本和 KV Cache 大小时,MLA 依然近乎最优。 它的问题是对 MTP(推测解码)不够友好。MTP 的思路是“用计算换速度”,而 MLA 在 Decoding 阶段本身就比较吃计算,再叠一个 MTP,两边就容易抢算力。 换别的方案也有代价。比如换成 128+128 的 GQA8,效果很难打赢 MLA,KV Cache 还是 MLA 的三倍多;换成 256+256 的 MFA(本质上是 MQA),训练和 Prefill 成本又会上去。 目前还没有一个简单的 Attention 设计,能同时占住效果、训练成本、Prefill、KV Cache 和 Decoding 计算量。在 KDA+MLA 的混合架构下,MLA 的部分问题得到缓解,所以 K3 最后还是选了 MLA。 ④ 苏神觉得,DSV4 也不算真正“抛弃 MLA”。 DSV4 看上去重新设计了 Attention,但底层仍然有 MLA 的影子。它采用的是 head_dims=512、K=V 的 MQA,这正是 MLA 在 Decoding 阶段的形态;再加上 Sparse + Compress,前者减少计算,后者进一步压缩 KV Cache,同时减少计算。 方向很激进,不过 Infra 也更复杂。 ⑤ K3 的 MLA 可以去掉 RoPE,是因为 KDA 已经隐含提供了一种广义的位置信息。 这只适用于 KDA+MLA 的混合结构,像 K2 那种全 MLA 模型,直接去掉 RoPE 还是会明显掉效果。 感觉苏神真正的观点是:大模型架构里很少有免费的升级。K3 的设计哲学不是找一个碾压所有方案的新架构,而是在效果、训练成本、Prefill、Decoding、KV Cache 和稳定性之间,找一个当前更合适的组合。 苏神原文里还有很多技术内容,非常值得一看。 原文地址:
显示更多
0
28
325
66
转发到社区
推测产品经理的考核应该加一个点,是否把这些垃圾广告屏蔽,因为不是能不能的问题,而是愿不愿意的问题。 为了保持数据流量更好看,汇报时更漂亮,那当然不愿意清理掉,因为这些是推特上很大的数据来源。 为了用户体验更好,那就一定会弄掉,这才符合第一性原理。 @elonmusk
显示更多
0
25
20
0
转发到社区
中午在家里问语音豆包推测比赛结果 我老公听到了,问了一下我的买球思路 说我这种思路很傻,属于拿大本金博蚊子肉的玩法一届世界杯全程下来一定是亏的,就好比昨天墨西哥那场,买了1000单关胜负,赢了奖金是260,连本带利一共1260,他说这种买法哪怕你每次本金不变连续能买强队赢5次,后面只要有主流强队爆冷输一次那之前的所有利润几乎全部回吐,中途再输一次本金也没了,买球一定要以小博大,买串比分或者让胜平负,至少也要二串一才有赚的可能性,而且本金一定要控制的小,同样的1000块,拆成5份甚至10份在后面不同的场次买,才能保证最终赢钱概率大于输钱,刚才他给我一个二串一比分,100块赢的话能有三四千的收益,输了100块钱也无所谓😑 但是我看到X上今天好多人都是我这种本金单关买胜负玩法啊,比如拿200美金买了韩国胜,赢了多赚200还挺开心,我老公平时是不碰球也不买球的,他的思路我也是第一次知道,不知道对错,懂的人告诉我一下我老公说的对吗?
显示更多
在人类进化过程中,在运动的宇宙中,表象的复杂性使人类感到困惑,从而形成了对现实和非现实的错误概念。 人类的生活如此热衷于观察复杂的表象现象,以至于表象成了事实,而唯一的现实却变成了纯粹的推测。 人通常以固体、那些能被感官感知的事物来理解可靠性。他所认为的可靠现实是物质的形式。 人从虚幻的、无法被感官感知的事物角度来思考不可靠性。他的非现实感就是精神。 人必须学会改变他对实体现实的认知,转而认识到心灵才是实体幻觉的根源。 他必须明白,唯一的现实本质就是那唯一的心灵。 ——Walter Russell 沃特尔. 罗素《The Universal One》
显示更多
机器人最重要的是AI,现在XAI被SPACEX收购,那么一个合理的推测是:特斯拉也应该会被收购。 这好像才是符合“第一性原理”的做法,方便特斯拉未来10年最重要的机器人大脑协同。 猜测这会发生在SPACEX市值越来越大,而特斯拉市值下跌的时候。
显示更多
0
56
60
11
转发到社区
有些人在兴奋到一定程度时 胸口、脖子、甚至脸颊会突然浮现一片红晕,像过敏一样 这个现象有专门的名称,叫「性红晕」(Sex Flush) 不是过敏,也不是害羞,是血管扩张造成的正常生理反应 高度兴奋时,交感神经会大量释放讯号 驱动皮肤表层的微血管快速扩张,让更多血液涌向体表 这个过程跟运动后脸红的机制很类似,都是血流量瞬间增加的表现 出现的位置通常从胸口开始,往上蔓延到脖子、脸颊 研究显示,女性出现这个反应的比例明显高于男性 推测可能跟女性皮肤微血管密度、雌激素浓度都有关係 红晕出现的深浅、范围大小,因人而异,没有标准答案 有些人反应很明显,有些人几乎察觉不到 但是这个现象纯粹是跟血管系统的个体差异有关 跟兴奋程度高低没有绝对的对应关係
显示更多
很多人都在讨论的 DEXE 暴跌事件到底是什么? 熊市来吃瓜! 纯粹好奇,下午扒拉了一下大家都在发的 DEXE 暴跌事件,扒拉完感觉还是挺有代表性的, 当资产在链上、价格在CEX、风险在合约、交易在内部账本、结算又延迟出现时,我们看到的所谓链上真相,可能只是整个故事的最后一页。 所以链上透明从来不等于市场透明。 来写一篇来龙去脉大家参考: 1️⃣事情经过: (DeXe Protocol 治理代币)在 2026 年 7 月中下旬经历了极端暴跌,引发大量对 DWF Labs 的 FUD(恐惧、不确定性和怀疑), 主要源于链上数据关联、Ceffu 的 MirrorX 机制,以及 DWF 与相关协议的公开联系。 当然目前没有确凿证据证明 DWF 直接操纵砸盘,属于基于线索的推测。 事件时间线与价格表现 1)7 月 12–13 日:DEXE 触及历史新高约 $49.4。 2)7 月 21 日:单日暴跌约 88%,从约 $46–$47 跌至约 $5–$5.65,成交量异常放大(短时间内超数亿美元),订单簿被砸穿。 3)随后 11 天内累计跌幅约 96.8%,低点约 $1.56。之后有反弹(部分报道提到接近翻倍),但整体仍大幅回撤。 这种恐慌下跌很简单:低流动性是放大因素,可交易筹码有限(大量锁在 DAO、团队合约等),任何较大卖压都容易引发踩踏、杠杆清算连锁反应。 2️⃣为什么 FUD 指向 DWF Labs 我觉得指向 DWF 主要是这几个原因: 1)DWF、DeXe、Falcon、Ceffu之间确实存在完整关联:DEXE → DeXe流动性合作方DWF → DWF支持的Falcon接受DEXE抵押 → Falcon使用Ceffu托管及镜像交易。这条链是真实存在的, 但“存在关联”还不等于“已经证明是谁砸盘”。 2)Ceffu从7月13日起分6笔向 Binance 转入约79.79万枚DEXE;DWF与DeXe存在流动性合作;DWF支持的Falcon接受过DEXE抵押并使用Ceffu;Andrei本人已经承认DWF出售过DEXE现货。 但是不能证明这些币全部属于DWF,也不能证明全部已经卖出。 3️⃣到底是谁的问题? 说实话正是因为这些不透明,目前谁的问题无法知晓。 就在写到刚才,发现 @ag_dwf 发布的内容, 他的意思很明确,我们卖了,但这是正常的套保退出和现金管理,不是恶意砸盘。 按照 Andrei 的说法,完整交易路径应该是: 1)2024年大量买入DEXE; 2)2025年卖出一部分获利; 3)之后再次大量买入; 4)2026年上半年,一边持有DEXE现货,一边做空DEXE合约,对冲价格下跌; 5)当资金费率转负,空头开始持续支付资金费,他们选择平掉空单; 6)空单平掉以后,原本被对冲的现货重新暴露在价格风险中,于是卖出DEXE现货,同时增加现金储备。 这个交易逻辑是成立的,假设DWF持有100万枚DEXE现货,同时做空等值永续合约,那么无论价格涨跌,整体净敞口都比较小,相当于锁定利润,而且当时被amm操控的资金费率是-2% 必须要卖出。 但当资金费率转负时,持有空单的一方需要不断付钱,DWF觉得继续套保不划算,于是:买入平掉空单;卖出现货;把仓位转换成现金。 这本质上就是一次解除对冲、缩减风险敞口。 但是,我觉得他还应该说下,卖了多少?什么时候卖?是不是通过Ceffu MirrorX完成?是否与那约80万枚DEXE有关?又对DEXE从46美元跌到5美元贡献了多少卖压? 真正能给这件事定性的,只需要三组数据:DWF/Falcon的UID成交明细、Ceffu资产实际受益人及MirrorX结算记录、DeXe与DWF的完整做市协议。 这也就是我说的链上透明和链下透明的结合处,不透明的话,大家永远不知道。 目前来看,结合所有信息,至于“DWF砸了80万枚、获利4000万美元”,目前依然没有足够证据,峰值名义价值不等于实际利润,Ceffu转账也不等于全部属于DWF。 在这些数据公布之前,最准确的定性是:一次高度可疑的机构风险撤退,叠加低流动性、复杂抵押结构和信息不对称,最终演变成了极端踩踏。 目前最佳的解决争议的方法就是让相关交易所或者独立审计机构确认: DWF的成交时间和数量; Ceffu转入DEXE的实际受益人; MirrorX交易与后续结算的对应关系。
显示更多
0
24
13
0
转发到社区