註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 presence
presence 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 presence 的搜尋結果
OpenAI 发布 Presence:企业 AI Agent 上线后怎么管,会不会出错,它来管 当AI连上公司的订单系统、账单系统... 规则一改,会不会乱操作?权限开大了,会不会动到不该动的账户?上线前有没有用真实难单练过?线上翻车了谁负责改、改完会不会更糟? Presence 针对的,就是这一串问题。。。
顯示更多
0
10
12
1
轉發到社區
几条新闻放在一起看,AI 已经不满足于当聊天工具了,它开始争夺企业的运行层。 OpenAI 推出 Presence,把 Agent 接入企业内部系统,直接处理客服、销售和内部流程; 一边裁掉约 20% 的员工,一边继续押注 AI Work Platform;工业 AI 公司 Arrakis 则想把设备数据、ERP、供应链和企业知识整合成一套统一的 Operating System。 传统 SaaS 卖的是界面、账号和记录系统;下一代企业软件卖的是读取组织状态、作出判断,然后直接执行任务。 AI 不一定会消灭所有 SaaS,但一定会逼 SaaS 公司减少人力、重做产品,并重新思考按账号收费的商业模式。 以前软件帮人管理工作,以后的软件可能直接把工作做了。
顯示更多
OpenAI称,公司现在有75%的英语客服咨询,已经不需要转人工处理。 背后是一款刚推出的企业产品OpenAI Presence,这套系统在10天内又把转人工率降低了15个百分点。 它能先核验来电者身份,读取账户信息,按公司规则处理账单或服务问题,再执行已经批准的操作,遇到权限之外的问题,它才会转给真人。 企业可以限制它能看到哪些资料,哪些动作必须先获批准,系统上线后,Codex还会检查真实通话和转人工记录,提出修改方案,由团队测试后决定是否发布。 目前,软银正在测试它的自然日语电话对话能力。
顯示更多
建议给你的 Agents(包括 OpenClaw)都投喂如下提示词,好好排查下是否存在这波 axios 被投毒事件影响: 参考下面这个方法排查一遍我们的环境是否存在被投毒的 axios@1.14.1 与 axios@0.30.4,及恶意模块 plain-crypto-js,不能漏,确保排查全面: Check for the malicious axios versions in your project: npm list axios 2>/dev/null | grep -E "1\.14\.1|0\.30\.4" grep -A1 '"axios"' package-lock.json | grep -E "1\.14\.1|0\.30\.4" Check for plain-crypto-js in node_modules: ls node_modules/plain-crypto-js 2>/dev/null && echo "POTENTIALLY AFFECTED" If setup.js already ran, package.jsoninside this directory will have been replaced with a clean stub. The presence of the directory is sufficient evidence the dropper executed. Check for RAT artifacts on affected systems: # macOS ls -la /Library/Caches/com.apple.act.mond 2>/dev/null && echo "COMPROMISED" # Linux ls -la /tmp/ld.py 2>/dev/null && echo "COMPROMISED" "COMPROMISED" # Windows (cmd.exe) dir "%PROGRAMDATA%\wt.exe" 2>nul && echo COMPROMISED
顯示更多
0
25
321
70
轉發到社區
兄弟,我发现了一个特别容易出神图的海报公式。 真的不是再加几个“高级感、电影感、杂志感”这种废词。 我最近在研究这类复古海报,突然发现它最爽的地方是: 把一幅名画“拆了”,只拿走它最值钱的东西。 不是复刻《雾海上的漫游者》《睡莲》《神奈川冲浪里》,而是只提炼: 巨大英文单词 + 极小人物 + 大面积留白 + Swiss 排版 + 70 年代旧印刷质感。 一下就从“名画二创”变成了真正的概念设计海报。 提示词母版也直接送了,自己替换括号就行👇 3:4 conceptual retro editorial poster, inspired by 【名画母题/艺术流派】 but not directly reproducing it, reinterpret its composition, visual motif and emotional atmosphere as a modern conceptual poster. Large 【cream / ivory】 negative space on aged uncoated paper, giant uppercase word “【主标题】” in 【颜色】 bold condensed sans-serif typography, interacting with the scene through fog, water, architecture or foreground elements. Lower portion shows 【重新设计后的场景】 with a very small 【人物 / 小船 / 房子 / 物体】 as a scale anchor, creating a strong contrast between monumental typography and tiny human presence. Swiss modernist editorial layout, tiny ISSUE / DATE / POSTER SERIES metadata, thin rule lines, small poetic quote, bottom caption and issue number. Muted 2–4 color palette, 1970s European art magazine aesthetic, vintage offset printing, screen print texture, halftone grain, faded ink, subtle scratches, slight misregistration, aged paper fibers, matte finish. minimal, poetic, conceptual, museum poster, elegant, restrained, quiet but visually striking. no QR code, no watermark, no logo, no mockup, no social media overlay, no glossy commercial style, no neon cyberpunk, no 3D metallic text, no clutter 这套东西我越玩越觉得有意思。 AI 画图最怕的是“想画得漂亮”,一旦开始用设计逻辑控制它,味道马上就不一样了。
顯示更多
0
3
125
17
轉發到社區
我把自己用的Dashboard全删了。 先说清楚,这不是说互联网产品的Web UI和GUI都该消失。只是在我自己的工作方式里,它们已经没有存在的必要了。 我又用回了IRC。 服务器自己建,客户端自己写。Jabber和IRC我都用过,最后还是IRC最顺手。 频道直接按职责拆。 #operations负责执行# #research负责检索和证据# #publishing负责从草稿走到公开验证# #watchdog只盯阻塞和心跳# 每个昵称对应一个固定Agent。每条消息必须带task_id和state。状态也不允许随便写,只认received、in_progress、blocked、verified这几种。 谁接了任务,卡在哪一步,最后有没有真正完成,频道里一眼就能看到。历史消息天然就是日志,不需要再单独做一套trace页面。 权限放在服务器端。大文件不塞进消息流,只传路径、引用和哈希。 XMPP当然更完整,presence、认证、加密和扩展都很规整。但对我自己的Agent控制面来说,完整有时候就是重量。 我不需要再打开浏览器,点进五层菜单,然后盯着几块会变颜色的卡片。 我需要的是拿起键盘,发一句话,系统开始动。 文本就是界面。 频道就是工作流。
顯示更多
《哈什特·苏卜日报》报道,阿富汗巴达赫尚省多名居民称,中国企业在当地活动不断增加,并通过大型人员和设备营地限制居民接近矿产开采区,引发对自然资源遭到掠夺的担忧。报道呈现的核心矛盾是:采矿投资可能带来就业、基础设施和公共收入,但居民同时指称,当地人接近土地和矿产开采区受到限制,在一些情况下不获准自行开采,部分土地和环境也受到损害。 化名“奥米德”的居民称,中国企业利用先进技术寻找黄金储量,控制了富金矿区的主要部分,但每日黄金开采量仍不清楚。他指称,这些企业的大型设备昼夜运转;由于塔利班监督不足,企业没有遵守采矿规定,也没有充分顾及环境破坏、淡水资源受损和药用植物消失等后果。他认为,这些影响可能要数年后才会显现。 另一名化名“法里德”的居民称,中国企业借助先进设备扩大黄金开采规模,而当地居民大多仍依靠传统方法,能够使用的资源有限。他还指称,中国企业与塔利班官员合作,其开采活动造成部分土地受损、牲畜放牧区域缩小,并限制当地人进入相关土地和矿产开采区;在一些情况下,当地居民甚至不获准自行开采。 奥米德还转述,当地有人怀疑部分中国企业不只开采黄金,夜间可能还在开采或加工某些稀有矿产。不过,他明确表示,这些说法没有具体证据或文件佐证。这些猜测的主要依据是相关企业的机器在夜间运行。 报道引述的化名经济专家“谢卡布”认为,如果合同得到执行,中国在阿富汗矿业领域的存在将是一个具有两面性的问题:资本和外汇投入可能创造就业、建设基础设施、增加公共收入并推动关键矿产开发,同时也可能带来地缘政治风险、经济依赖和结构性依赖。如果缺少多个投资者和申请方参与,阿富汗就可能形成对单一投资方的依赖;原材料出口、谈判力量失衡以及承诺无法兑现的风险,会进一步加深这种依赖。 谢卡布认为,要让矿业合同真正惠及阿富汗,必须实行透明管理、遵守环境要求、在国内加工资源,并推动多个国际投资者参与竞争。报道还称,自塔利班接管阿富汗以来,中国投资者在该国越来越多,并日益寻求矿产开采机会。 原文:Badakhshan’s Gold: Expanding Chinese Presence Fuels Fears of Natural Resource Plunder Hasht-e Subh Daily|作者:Farhaad|2026-08-23
顯示更多
A股午盘结论: 今日涨停板 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 涨停69只,连板8只,封板率80% 焦点龙头:立新能源8天7板、五洲医疗20CM 4连板、爱丽家居4连板 涨停分布:脑机接口(爱朋医疗/南京熊猫)、AI算力(国际复材/风华高科)、锂电池(紫建电子/领湃科技)、CRO(昭衍新药) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 今日盘中重要消息汇总 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【政策/产业级】 1. 长鑫科技科创板上市:涨超530%,成交1200亿创纪录,市值3.6万亿成A股新一哥 2. 中东局势缓和,布油跌超5%跌破90美元 【行业级】 3. 宁德时代200-400亿回购注销(A股最大单笔),H1净利+42%,日赚2.4亿 4. 脑机接口科研突破+海外商业化,板块集体爆发 5. 光通信Q2业绩超七成预喜,CPO/PCB资金大幅流入 【公司级】 6. OpenAI发布Presence智能体平台→AI应用异动 7. 三星电机2亿美元AI服务器MLCC合同→风华高科涨停 消息评估:长鑫上市+宁德回购双核驱动,多头火力密集 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 尾盘操作建议 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 市场定性:进攻(放量普涨、主力大额回流、双主线清晰) 尾盘是否参与?干!但注意追高风险,等午后回踩分批建仓 方向建议: - 锂电/宁王链:回购+业绩超预期+8月排产高增(中风险) - 脑机接口:新主题首日爆发(高风险) - CPO/光通信:Q2业绩确定性高(中风险) - CRO/创新药:政策红利+估值低位(中低风险) 仓位建议:激进6-7成、稳健3-4成、保守1-2成 风险提示:午后放量能否持续、科创50内部分化、长鑫虹吸效应、油价地缘变数、反弹是否一日游
顯示更多
《无人着装 / Worn by No One》 币安九周年线上装置艺术展 An online installation exhibition for Binance's 9th Anniversary 这是一批被重新观看的币安官方周边。帽衫、球衣、围巾、包袋、鞋帽、运动装备……它们被从日常使用中抽离,置于白色展厅、绳索、冰、尘土、树脂与光线之间,成为一组关于物件、空间与关系的装置。 This exhibition reimagines official Binance merchandise. Hoodies, jerseys, scarves, bags, caps, shoes, and sports gear are removed from everyday use and placed into white spaces, ropes, ice, dust, resin, and light—becoming installations that invite a different way of seeing. 我们的大部分生活已经发生在线上。朋友、对话、工作、身份与信任,都停留在网页、软件、账户和屏幕之间。也因此,这些真实存在的衣服、包袋、帽子和道具,反而提醒我:身体、触感、空间,以及人与人的连接,依然值得被重新看见。 Today, much of our lives unfold online. As more of our relationships, identities, and memories move into digital spaces, these physical objects begin to carry a different meaning. They remind us that touch, space, and human presence still matter. 如果其中某一幅让你感到一点错愕、惊讶、不适、快乐,或者只是停留片刻,那也许就是它的价值。 If even one piece leaves you feeling surprised, unsettled, amused, or simply makes you pause for a moment, then perhaps it has already fulfilled its purpose. 线上展厅已上线 · The exhibition is now live 👉👉👉 @binance @binancezh @heyibinance @cz_binance
顯示更多
0
95
146
37
轉發到社區
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
顯示更多
0
46
33
2
轉發到社區