註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DSP
DSP 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DSP 的搜尋結果
SGLang 的 DSpark 实测数据在PR里放出了, 几个测试场景基本都能达到预测3个token, 其中数学类prompt是3.37个, 日常对话是3个, 代码是3.52个(果然代码是废token比较多的). 最亮眼的是加速比了, 在1K长度prompt下加速比来到了1.81倍. 测试使用的是8卡B200, 速度来到了 297 token/s. 而不使用DSpark 则是 164 token/s. 另外作者还测试了不同并发情况下的加速比, 目前来看单并发提升是最高的, 而超过8并发则只有1.2-1.3倍的提速了, 主要还是把GPU打满了. 另外比较震惊的数据时 DSpark 的 TPOT (每个输出 Token 的耗时) 只有2.9-5.2ms, 说明了这个DSpark内置的神经网络层运行得特别快. DSpark带来的延迟基本可以忽略不计了. 注意这个PR还没合并, 如果想尝试可以单独Fork这个PR29538.
顯示更多
DeepSeek 开源了 DSpark 🥸 可以让大模型回答时吐字更快的一种推理加速技术
DeepSeek 最新论文DSpark:让大模型说得更快 解决核心问题: 大模型生成文字像一个人写作文,必须一个字一个字地写,速度很慢。推测解码的思路是:先让一个小助理快速写一段草稿,再让主角(大模型)一次性检查整段,对的保留、错的纠正。 但现有方案有两个毛病: 1、小助理写的后半段经常跑偏。比如它想写of course,但of和course是各猜各的,结果可能拼出of problem,越往后越离谱。 2、检查浪费严重。明知道后半段大概率不对,还一个个去验证,白白浪费算力。 DSpark 的两个妙招 妙招一:边写边看前面写了什么 小助理写草稿时,前面的部分用并行快速生成(像打字机一次出一片),但从第二个字开始,用一个极轻量的模块看看前一个字是什么再写下一个。比如看到前面写了of,就自动偏向course而抑制problem。 这个看一眼的代价极低,只多了约 1% 的时间,但草稿质量大幅提升。 妙招二:不靠谱的就不查了 给草稿每个位置打个信心分。比如写代码,前几个字信心很高(0.95),可以放心验证;写闲聊时后几个字信心很低(0.3),就直接砍掉不查。 论文里有个直观数据:闲聊场景下,原来只有 45.7% 的草稿被接受,用了信心调度后跳到 95.7%,少做了一半多的无用功。 效果如何? 在 DeepSeek-V4 真实生产环境中: - 用户感知的生成速度提升了 60%-85% - 高并发时不再卡死,此前达不到的服务等级现在可以做到了 - 额外延迟开销仅 1%-2% 打个比方:原来一个 GPU 能同时服务 100 个用户且体验流畅,现在同样的硬件可以服务 160-185 个用户。 为什么重要? 这篇论文不只是一个算法技巧,是把草稿质量和系统调度打通了。就像餐厅不光要菜做得好(草稿质量高),还要会排号(智能调度验证顺序),两者结合才能让翻台率最大化。 DeepSeek 还开源了代码和模型,其他团队可以直接拿来用或改进,这对整个大模型推理加速领域是实打实的推动。
顯示更多
$MRVL 说重点,在DSP接近垄断 $AVGO 在交换机芯片、CPO研发垄断 CPO方面的领军。 $GLW 可以看。
听说梁圣开源的 DeepSeek DSpark 可无缝移植到其他 AI 大模型,又是造福全行业和消费者的大好事啊🫡 Anthropic 跟 OpenAI 会不会偷偷抄作业呢?毕竟能无损提升模型推理效率呢🤡
顯示更多
0
21
210
9
轉發到社區
推荐这个,Simon Willison 用 AIE 大会上看到的 DSPy 方法论来优化 Datasette Agent 的 SQL prompt——而且直接用 Fable 5 跑了一个异步研究任务。整个过程是"如何用 AI 改善 AI 的提示词"的绝佳范例。 Simon Willison 一直被提醒 DSPy 可能帮上忙,AIE 大会上的 keynote 让他决定动手试试。 具体操作:给 Claude Code 里的 Fable 5 发了一个异步研究任务——"pip install 最新 Datasette alpha、datasette-agent 和 dspy——然后用 dspy 评估和改进 Datasette Agent 的 SQL 系统 prompt。"Fable 选了 GPT 4.1 mini 和 nano 做测试,找到了几个有希望的方向。 最有意思的发现:schema 列表只给表名;"如果已经有信息就别调 describe_table"的建议导致列名遗漏。DSPy 优化后的 prompt 把描述数据库的命令分解为更小的步骤,让 agent 先列出列和行数再做查询。 整个过程记录在 GitHub: simonw/research/tree/main/dspy-datasette-agent-prompts 来源:@simonw, 2026-07-02 #DSPy# #Prompt工程# #Agent#
顯示更多
lite和cohr是一类,做eml, mrvl是dsp芯片
DeepSeek真的是性价比和技术双重斩杀线... 有同学看不懂DSpark是啥, 简单给大家写个小教程讲讲. 推测性解码(投机解码)这个技术是用来提升大模型输出速度的. 本质是让小模型给大模型接话, 大模型判断小模型说的对不对. 因为现在模型普遍卡内存带宽, 而GPU算力是富余的, 所以大模型的prefill速度(看字)比decode速度(吐字)快很多. 那么让小模型沿着大模型的思路先说一段话, 大模型判断对不对(只需要看字), 只要小模型猜对了, 那么这就利用了prefill速度, 吐字就会成倍的提升. 但问题来了, 外挂小模型也要看字(prefill), 也要占用显存, 也要吃显存带宽. 那么有没有更好的方法来解决呢? 来了, 这就是DSpark. 看我的这个图(左侧DSv4架构图是 @rasbt 大佬的), DSpark 接在了 Final RMSNorm 过程中. 不是接一个完整的小模型, 而是一个3 层的MTP(多Token预测)微型Transformer堆叠. 大模型算完前面60多层后, 刚把当前这句话的"高浓缩概念"(特征向量/隐藏状态)推到 Final RMSNorm 这个出口,还没来得及翻译成具体文字时,DSpark开始截胡: 首先是半自回归极速脑补 (MTP + Markov Head), DSpark自己有一丢丢参数, 然后它就瞬间并行猜5个字(特征向量), 然后再用自己内部的一个串行网络理顺逻辑. (注意啊,先并行然后串行消除并行导致的逻辑不连贯). 然后, 它会有一个置信度预测头, 预判自己猜的准不准, 比如5个字的后2不准就直接砍掉, 防止后续送回大模型浪费算力. 最后把留下的3个字塞回词表映射层, 把向量翻译为token. 到此为止DSpark工作就做完了. 然后就是大模型扫一遍DSpark输出的对不对(只用prefill,不decode), 一旦正确了, 就直接吐字, 这样之前模型一次只能吐一个字, 现在就能吐3个字了! 最后, 推测性解码是不会降智的, 速度能提升60%-85%! 之前是雇一个小模型帮忙写草稿, 现在则是直接脑子里植入芯片了. 目前SGLang已经有这个特性的PR了(29538), 而且DeepSeek刚在自己的HuggingFace主页发了一大堆小模型的DSpark魔改版. 大胆猜一波未来发布的模型会不会标配DSpark? #dspark# #deepseek# #投机解码# #推测性解码#
顯示更多
0
18
203
25
轉發到社區
现在炒股要学:CPO,PCB.NPO,MPO,LPO,FAU,OCS,CW光源,EML芯片,DSP, TEC, OEPCB,CCL, RCC, MLCC,HVLPGPU,CPU,NPU,DRAM,NAAD,铜箔,电子布,树脂,光纤,光棒,保偏光纤,硅片,玻璃基板,ABF载板,TGV,探针磷化铟,薄膜锯酸锂,碳化硅,金刚石,六氟化钨,氦气,铜钨钼锡锆,元素周期表
顯示更多
0
14
44
2
轉發到社區
蜘蛛侠面具遇上孕肚,反差感直接拉满
0
0
157
12
轉發到社區