注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 0127武威好歩併せ
0127武威好歩併せ 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 0127武威好歩併せ 的推特
好几天了,网页版 VPN 终于充上值了,总算能上推特了。 Alpha 因为一直没有新币上线,也刷不了4倍积分了,在交易所。 今天就去钱包刷了一下 QQQB。 本来以为损耗不会太高,结果实际刷下来,比我想的还是高一点。 我滑点设的是 0.01。 如果用 200U 去刷 15 积分: U 损耗大概 0.4-1 USDT GAS 消耗约 0.003 BNB,折合 1.7 USDT 左右。 而且滑点设得比较低,经常会因为交易失败白白扣一笔 GAS。 所以全部算下来,一次 15 分的成本,大概在 2.1-2.7 USDT。 后来又试了 1000U 左右去刷同样 15 积分: U 损耗 1.07-1.58 USDT GAS 约 0.001 BNB,折合 0.57 USDT 左右。 总损耗差不多在 1.7-2.2 USDT。 为什么要算得这么细? 因为我感觉,整个 7 月到现在,大部分刷 Alpha 的人,不但没赚钱,反而亏钱。 既然本来就在亏,那每一笔成本就更得算清楚。 能省一点是一点。 至于为什么亏钱了还在刷? 因为我觉得,现在这种情况只是暂时的。 之前跟着币安做 Alpha,确实赚到过钱。 总不能赚钱的时候天天喊支持,遇到一段低谷,就拍拍屁股走人吧。 还是那句话,再等等,看看后面会不会有新的机会。
显示更多
0
15
17
1
转发到社区
7月2日 三场 #世界杯# 的预测: 1. 英格兰 vs 刚果(金):英格兰晋级。 90分钟比分:2-1 / 1-0 / 1-1 刚果(金)防守强度不错,但英格兰阵容更深,前场选择更多。 2. 比利时 vs 塞内加尔:比利时晋级。 90分钟比分:2-1 / 1-1 / 2-2 塞内加尔冲击力强,但比利时火力已打开,经验和球星能力占优。 3. 美国 vs 波黑:美国晋级。 90分钟比分:2-1 / 2-0 / 1-1 美国主场和速度优势明显,波黑对抗不差,但防线移动容易吃亏。 #WorldCup#
显示更多
0
103
220
10
转发到社区
【开云-8月2日 18点整 中超 青岛西海岸 vs 青岛海牛】 数据方面机构开出主队让0.5/1,给予实力的认可。青岛西海岸近10场比赛取得4胜4平2负,联赛排名第5,本赛季表现较为稳健。青岛海牛近10场仅1胜2平7负,联赛排名跌至第16位,近期状态低迷,攻防两端问题较为明显。作为同城德比,青岛西海岸无论是积分位置还是近期状态都占据明显优势,本场坐镇主场有望进一步拉开与对手的差距。综合来看,本场看好青岛西海岸主场取胜。 全场让球:青岛西海岸-0.5/1@2.00 全场大小:小2.5/3@1.97 推荐比分:2-0
显示更多
过去一周我们经历了: 1. 上周末AI放缓的恐慌 2. 清晰法案过山车,最后失败 3. 美联储会议 4. 日本加息 5. 三巫日 最后,所有资产回报: 标普-0.1% 纳指+0.7% 黄金+0.7% IGV+2.8% BTC+4.9% 芯片+1.1% RSP-1.2% 板块轮动比较明显,科技股,半导体很强,其他板块很弱,所以参与度很低。最难的9月份RSP跌了3%以上,标普-0.5%,感觉经历了那么多,指数站在原地,如果追涨杀跌,认为市场短期是对的,会很惨。周末愉快,今天没视频,周日见了
显示更多
0
62
389
4
转发到社区
终于看完了今天的4场比赛,最大感触就是弱队摆大巴,真的有机会。@Polymarket @predictdotfun @42space 能用瑞士银行理财,但用瑞士足球理财就掉坑里了。 昨天的预测,红黑参半,瑞士和土耳其杀我。 今天继续谈谈明天的4场比赛,在足球的世界里寻找最大确定性。 1.德国🇩🇪 vs 库拉索🇨🇼 这场没啥好说的,一边倒的大屠杀! 唯一看点“德国赢几个?” 库拉索连国足都能进它2球,是真没实力。这场可能出现极为悬殊的比分。 德国有个传统,能赢多少就赢多少,绝不放水,不少世界大赛的惨案比分都是德国足球制造的。 预测结果: 德国- 3.5 4球起步,极限比分7:0 2.荷兰🇳🇱 vs 日本🇯🇵 这场荷兰让不起球,日本有概率不败甚至赢球,走日本不败。 有意思的是,目前为止,亚洲球队 韩国、卡塔尔、澳大利亚都没输球,实力最强的日本别掉链子。 预测结果:日本+0.5 大2.5球 比分 1:1 1:2 2:2 3.科特迪瓦🇨🇮 vs 厄瓜多尔🇪🇨 类似巴西 vs 摩洛哥,这场又是非洲与南美足球之战,纸面实力,双方也势均力敌,堪称小号“巴西与摩洛哥”。 双方都以防守出名,历史首次碰面,保守为主。 预测结果: 科特迪瓦不败 进球不超过2球 比分 1:0 1:1 4.瑞典🇸🇪 vs 突尼斯🇹🇳 这场很有意思,国内足彩主任给出的是单场,存在爆冷可能。 由于F组还有荷兰、日本两支实力高一档的球队,本场比赛对于双方而言都堪称“出线生死战”,谁能拿下三分,谁就将在小组竞争中占据主动。 拿一分意义不大,双方必然是奔着分胜负去的。 但往往最不想要的结局偏偏会出现,会是平局吗? 预测结果: 瑞典不败 比分 1:1 1:0 注:以上分析只作分享,不做投资建议 #世界杯# #预测市场#
显示更多
0
67
73
3
转发到社区
🔥 【欧冠单场大势·资金链首发】 主让半一深盘卡在高水仓,奥胡斯今晚是强力碾压还是虚胖诱主? Let's start the engine 欧冠资格赛黄金档独狼首发开轰! 今晚中国足彩仅仅精选3场,这场半夜 12:30AM 开打的 Aarhus(奥胡斯) 主场死磕 Sabah Baku(沙巴巴库),就是今晚全网实战资金的第一蓄水池! The odds board reveals a cruel script 庄家的盘口语言极为毒辣,我们直接进入冷血的核心数据拆解: ⚡ Handicap Resistance(让球盘:半一高水的致命拉扯): 机构初盘直接给出主让半球/一球(0.5/1,水位0.85),但随着临场资金的疯狂试探,即时盘口主队在半一让步下被强行顶到了 0.85 的极度微妙区间,而客队受让的水位却一路下滑。 奥胡斯虽然坐拥魔鬼主场且名气在外,但机构强行摆出“半一”的深盘高姿态,却在水位上始终不肯给主队降水减压。 这种“强托深盘却给高收益”的操盘手法,在博弈论里属于标准的 trap bet(诱主盘)。 庄家正在利用主队的名气,疯狂吸引那些盲目砸千元跟盲盘的闲家资金进场接盘。 ⚡ The Deadlock of Correct Score(大小球与波胆的终极暗示): 再看底部的 Correct Score(波胆赔率),庄家的底牌暴露得清清楚楚! 全场大小球死死压在 2.5/3球 的超高门槛(大球0.99满水),这说明机构表面上在诱导大伙去投大球大胜。 但反观比分防范,主胜的 1-0(7.6)、2-0(7.7)、2-1(7.7) 竟然诡异地处于完全均等的极低赔率区间,而平局 1-1(7.3) 更是全盘比分的最低防线! 这直接泄露了庄家的临场真实意图:今晚客队绝非待宰羔羊,他们的长途大巴链式防守会极其顽强;主队在久攻不下的高压心理下,极易在下半场出现致命失误。 💡 The Smart Selection(临场实战策略): 今晚拒绝沦为主队流量的牺牲品!既然半一高水阻力重重,且 1-1 平局和 1-0 闷战的波胆被机构极限挤压,今晚大概率是一场奥斯胡得势不得分、死卡盘口的单边消耗战。 客队凭借坚韧的反击保住不败、或者直接死卡让球全赢盘的走势已经不可逆转。 💰 Final Picks(实战下注贴士): 👉 Asian Handicap: Sabah Baku (+0.5/1) 🛡️ 客队受让半一力保盘口(卡盘博全赢) 👉 Total Goals: Under 2.5/3 (全场小球) 📉 强行锁定 1-0 / 1-1 闷战结局 #中国足彩# #欧冠杯外围赛# #奥胡斯# #沙巴巴库# #足球贴士# #FootballPredictions# #BettingTips# #UCL#
显示更多
🔥 【单挑焦点·盘面降维】 一球深盘背后,奥林匹亚科斯是在名气诱客,还是隐藏了零封残暴剧本? Skip the gossip 直奔今晚深夜 02:00 最吸金的单场欧冠重头戏!作为传统希腊豪门的 Olympiacos(奥林匹亚科斯) 主场死磕荷甲新贵 NEC Nijmegen(奈梅亨)。This single match is full of traps(这场单固盘口极其诡异), 我们直接用最冷血的数据拆解: ⚡ Market Misalignment(让球盘:一球深盘的战意扭曲): 机构临场直接开出 Home Win (-1.0) 的深盘,主队水位卡在 0.95 的高水,客队则处于 0.95 均等水位。 表面上看,主队贵为传统欧战老油条且坐拥恐怖的魔鬼主场,让出一球看似理所当然。但实际上,两队在季前的状态和热身赛战术上并没有如此悬殊。 机构强行利用主队的“名气光环”筑起一球的超高门槛,其真实意图根本不是在防范主队大胜,而是在制造强弱悬殊的心理假象,借此将盲目崇拜豪门的闲家资金疯狂赶往主队,The upper hand is overheated(上盘已经热到发烫)。 ⚡ The Tightness of Correct Score(大小球与波胆的终极矛盾): 最毒辣的地方在于底部的 Correct Score(波胆赔率)。你们仔细看,全场大小球直接卡在 2.5/3 球 [INDEX],大球处于 0.95 的危险阻水区。 但反观比分防范,1-0(7.2)、2-0(6.9)、2-1(7.7) 的赔率极其反常地高度凝聚,2-0 更是全盘最低的 6.9! 这直接泄露了庄家的临场底牌:今晚客队一旦远征希腊魔鬼主场,战术势必是极端的长途死守; 主队纵有底蕴,在锋线尚未磨合至完美的阶段,想彻底打穿这个高水一球盘、净胜两球以上的概率被机构严重保留。 💡 The Smart Move(临场核心策略): 今晚拒绝沦为豪门流量的接盘侠!既然 2-0 零封的波胆被机构死死压低,而全场大球水位高企,今晚的剧本大概率又是一场类似昨天巴西杯的“主队控节奏小胜、死卡盘口”的单边沉闷局。 客队极具韧性的防守甚至有强行逼平拿走积分的可能 💰 My Final Selection(实战下注走向): 👉 Asian Handicap: NEC Nijmegen (+1.0) 🛡️ 客队受让一球力保盘口(卡盘博全赢) 👉 Total Goals: Under 2.5/3 (全场小球) 📉 强行锁定 1-0 / 2-0 / 1-1 闷战 #中国足彩# #欧冠杯资格赛# #奥林匹亚科斯# #奈梅亨# #单挑焦点# #FootballPredictions# #BettingTips# #Olympiacos#
显示更多
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
显示更多
0
46
33
2
转发到社区
【7月2日 6点整 智利杯 利马切 vs 科金博联合】 数据方面机构开出客队让0/0.5,给予实力的认可。利马切近期状态明显低迷,近10场仅取得1胜2平7负,攻防两端均缺乏稳定性,防守漏洞较为突出,整体抗压能力不足;科金博联合近10场6胜3平1负表现更为强势,攻守体系相对成熟,客场同样具备较强执行力与持续压制能力。综合对比双方状态与稳定性差距较为明显,本场客队在整体实力与比赛掌控力方面均占据优势,具备更高取分与赢球概率。 全场让球:科金博联合-0/0.5@1.78 全场大小:小2/2.5@1.94 推荐比分:0-2
显示更多
【7月2日 6点整 智利杯 利马切 vs 科金博联合】 数据方面机构开出客队让0/0.5,给予实力的认可。利马切近期状态明显低迷,近10场仅取得1胜2平7负,攻防两端均缺乏稳定性,防守漏洞较为突出,整体抗压能力不足;科金博联合近10场6胜3平1负表现更为强势,攻守体系相对成熟,客场同样具备较强执行力与持续压制能力。综合对比双方状态与稳定性差距较为明显,本场客队在整体实力与比赛掌控力方面均占据优势,具备更高取分与赢球概率。 全场让球:科金博联合-0/0.5@1.78 全场大小:小2/2.5@1.94 推荐比分:0-2
显示更多