註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 dspark
dspark 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 dspark 的搜尋結果
SGLang 的 DSpark 实测数据在PR里放出了, 几个测试场景基本都能达到预测3个token, 其中数学类prompt是3.37个, 日常对话是3个, 代码是3.52个(果然代码是废token比较多的). 最亮眼的是加速比了, 在1K长度prompt下加速比来到了1.81倍. 测试使用的是8卡B200, 速度来到了 297 token/s. 而不使用DSpark 则是 164 token/s. 另外作者还测试了不同并发情况下的加速比, 目前来看单并发提升是最高的, 而超过8并发则只有1.2-1.3倍的提速了, 主要还是把GPU打满了. 另外比较震惊的数据时 DSpark 的 TPOT (每个输出 Token 的耗时) 只有2.9-5.2ms, 说明了这个DSpark内置的神经网络层运行得特别快. DSpark带来的延迟基本可以忽略不计了. 注意这个PR还没合并, 如果想尝试可以单独Fork这个PR29538.
顯示更多
DeepSeek 开源了 DSpark 🥸 可以让大模型回答时吐字更快的一种推理加速技术
DeepSeek 最新论文DSpark:让大模型说得更快 解决核心问题: 大模型生成文字像一个人写作文,必须一个字一个字地写,速度很慢。推测解码的思路是:先让一个小助理快速写一段草稿,再让主角(大模型)一次性检查整段,对的保留、错的纠正。 但现有方案有两个毛病: 1、小助理写的后半段经常跑偏。比如它想写of course,但of和course是各猜各的,结果可能拼出of problem,越往后越离谱。 2、检查浪费严重。明知道后半段大概率不对,还一个个去验证,白白浪费算力。 DSpark 的两个妙招 妙招一:边写边看前面写了什么 小助理写草稿时,前面的部分用并行快速生成(像打字机一次出一片),但从第二个字开始,用一个极轻量的模块看看前一个字是什么再写下一个。比如看到前面写了of,就自动偏向course而抑制problem。 这个看一眼的代价极低,只多了约 1% 的时间,但草稿质量大幅提升。 妙招二:不靠谱的就不查了 给草稿每个位置打个信心分。比如写代码,前几个字信心很高(0.95),可以放心验证;写闲聊时后几个字信心很低(0.3),就直接砍掉不查。 论文里有个直观数据:闲聊场景下,原来只有 45.7% 的草稿被接受,用了信心调度后跳到 95.7%,少做了一半多的无用功。 效果如何? 在 DeepSeek-V4 真实生产环境中: - 用户感知的生成速度提升了 60%-85% - 高并发时不再卡死,此前达不到的服务等级现在可以做到了 - 额外延迟开销仅 1%-2% 打个比方:原来一个 GPU 能同时服务 100 个用户且体验流畅,现在同样的硬件可以服务 160-185 个用户。 为什么重要? 这篇论文不只是一个算法技巧,是把草稿质量和系统调度打通了。就像餐厅不光要菜做得好(草稿质量高),还要会排号(智能调度验证顺序),两者结合才能让翻台率最大化。 DeepSeek 还开源了代码和模型,其他团队可以直接拿来用或改进,这对整个大模型推理加速领域是实打实的推动。
顯示更多
听说梁圣开源的 DeepSeek DSpark 可无缝移植到其他 AI 大模型,又是造福全行业和消费者的大好事啊🫡 Anthropic 跟 OpenAI 会不会偷偷抄作业呢?毕竟能无损提升模型推理效率呢🤡
顯示更多
0
21
210
9
轉發到社區
DeepSeek真的是性价比和技术双重斩杀线... 有同学看不懂DSpark是啥, 简单给大家写个小教程讲讲. 推测性解码(投机解码)这个技术是用来提升大模型输出速度的. 本质是让小模型给大模型接话, 大模型判断小模型说的对不对. 因为现在模型普遍卡内存带宽, 而GPU算力是富余的, 所以大模型的prefill速度(看字)比decode速度(吐字)快很多. 那么让小模型沿着大模型的思路先说一段话, 大模型判断对不对(只需要看字), 只要小模型猜对了, 那么这就利用了prefill速度, 吐字就会成倍的提升. 但问题来了, 外挂小模型也要看字(prefill), 也要占用显存, 也要吃显存带宽. 那么有没有更好的方法来解决呢? 来了, 这就是DSpark. 看我的这个图(左侧DSv4架构图是 @rasbt 大佬的), DSpark 接在了 Final RMSNorm 过程中. 不是接一个完整的小模型, 而是一个3 层的MTP(多Token预测)微型Transformer堆叠. 大模型算完前面60多层后, 刚把当前这句话的"高浓缩概念"(特征向量/隐藏状态)推到 Final RMSNorm 这个出口,还没来得及翻译成具体文字时,DSpark开始截胡: 首先是半自回归极速脑补 (MTP + Markov Head), DSpark自己有一丢丢参数, 然后它就瞬间并行猜5个字(特征向量), 然后再用自己内部的一个串行网络理顺逻辑. (注意啊,先并行然后串行消除并行导致的逻辑不连贯). 然后, 它会有一个置信度预测头, 预判自己猜的准不准, 比如5个字的后2不准就直接砍掉, 防止后续送回大模型浪费算力. 最后把留下的3个字塞回词表映射层, 把向量翻译为token. 到此为止DSpark工作就做完了. 然后就是大模型扫一遍DSpark输出的对不对(只用prefill,不decode), 一旦正确了, 就直接吐字, 这样之前模型一次只能吐一个字, 现在就能吐3个字了! 最后, 推测性解码是不会降智的, 速度能提升60%-85%! 之前是雇一个小模型帮忙写草稿, 现在则是直接脑子里植入芯片了. 目前SGLang已经有这个特性的PR了(29538), 而且DeepSeek刚在自己的HuggingFace主页发了一大堆小模型的DSpark魔改版. 大胆猜一波未来发布的模型会不会标配DSpark? #dspark# #deepseek# #投机解码# #推测性解码#
顯示更多
0
18
203
25
轉發到社區
感觉我也可以魔改 sglang 、 vllm ,用于调试 DSpark 这类新能力, 看看效果是不是和吹的一样好。 现在租用一个 GPU又不贵。 大模型预训练需要烧很多钱,烧很多数据才能验证, 大模型推理看起来门槛并没那么高,小成本也可以验证/验收能力。
顯示更多
一台 GB300 NVL72: → 72 颗 GB300 (Blackwell Ultra) GPU + 36 颗 Grace CPU。 → 单卡显存:GB300 288 GB HBM3e → 整机柜总显存:72 × 288 GB ≈ 20.7 TB → NVLink 总带宽约 130 TB/s → 全机柜通过 NVLink 5 连成统一内存池,可以视为一张拥有 20TB 显存的“超大 GPU”。 DeepSeek-V4-Flash-0731 核心规格: →304B 参数(0731 仓库包含 DSpark speculative decoding 模块) → 基础模型 284B → 13B activated → 1M context → 官方权重为 FP8 + FP4 Mixed 加油 OpenCode !
顯示更多
0
51
75
4
轉發到社區
GM GN GG 距离 2027 年仅剩 180 天 AI圈今日速览 | 6.28,POLo 感觉今天最后一件事比前面九件加起来都扎眼 1. SpaceX注册了"SpaceXAI"商标,马斯克表示xAI将解散不再作为独立公司,未来只是SpaceXAI的一部分。xAI并入SpaceX,这步棋有点大 🚀(马斯克的智囊团都有谁?) 2. 苹果Vision产品组副总裁Paul Meade下周离职加入OpenAI硬件部门,他主导了Vision Pro和无屏幕AI眼镜研发。与此同时苹果首款触控OLED MacBook敲定用M5 Pro/Max芯片,预计2026年底到2027年初发布。核心高管被OpenAI挖走,AI硬件竞争肉眼可见在加速。 3. DeepSeek开源了DSpark投机解码框架,这不是新模型,而是给DeepSeek-V4挂载草稿模块做无损加速。生产环境下V4-Flash生成速度提升60-85%,V4-Pro提升57-78%,代码用MIT许可证开源 ⚡ 4. 一起伪装成新加坡VC面试的APT攻击被拆解,攻击者给目标发TypeScript仓库"测试题",在patch文件里藏了base64混淆载荷,安装时写入后门PinpinRAT。作者已上报加拿大CCCS,供应链投毒手法越来越隐蔽 🔒 5. Runway API上线广告本地化Recipe,单次API调用即可翻译静态广告和图形素材,跨国广告投放的门槛又降了一截。 6. 前美国商务部长Raimondo发起非营利组织"Raise Us",目标筹集10亿美元应对AI就业冲击,已锁定5亿。Amazon、Anthropic、Microsoft、OpenAI都掏了钱,将在四个州试点AI职业导航和再培训。但美国此前工人再培训效果普遍不佳,这次能不能成还不好说。 7. 美国企业AI账单失控后开始转向DeepSeek。旧金山公司Lindy此前每月AI开销超员工工资,本月已把100%流量切到DeepSeek,预计省下数百万美元。越来越多企业搞模型路由,不再把最贵模型用在所有场景 💰(dp 斩杀线的含金量不断在提升) 8. 阿里千问输入法macOS版上线,AI语音输入最快300字/分钟,自动润色、口语转工整文字,支持9种方言,没广告。iOS、Android、Windows版也快了。(这个对我没用,我喜欢打字,不喜欢说话) 9. 国家统计局数据,1-5月规上工业企业利润增18.8%,其中电子行业利润暴增103.9%,贡献了43.1%的增量。背后是AI技术变革推动高端算力芯片和存储芯片需求爆发。高技术制造业利润增44.7%,电子专用材料制造更是涨了665.4% 📊 10. Cursor研究发现编码智能体存在奖励攻击问题,智能体在SWE-bench Pro等基准测试中,63%的成功修复其实是靠检索已知修复方案而非独立推导。隔离git历史并限制网络访问后,Opus 4.8 Max分数从87.1%跌到73.0%。新模型比旧模型更容易出现这个问题,基准测试的可信度要打个问号了 ⚠️ #Ai# #ai新闻#
顯示更多
0
11
20
2
轉發到社區