注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 2026年上半期ベスコス
2026年上半期ベスコス 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 2026年上半期ベスコス 的推特
好日子要来了? 得益于欧洲市场的旺盛需求以及人工智能与数字化浪潮的推动,德国出口行业的景气指数在8月份迎来强劲反弹,跃升至四年半以来的最高水平。尽管德国对华出口依然承压,但多个关键工业制造板块的预期明显好转,有力支撑了整体经济增长。 慕尼黑的伊弗经济研究所(Ifo-Institut)周三公布的企业调查显示,8月份出口预期指数从7月份的负2.8点大幅跃升至正9.6点。这是自2022年2月俄罗斯对乌克兰发动侵略战争以来的最高值,同时也是自2020年6月以来的最大增幅。 “出口经济正在提速,”伊弗研究所调查主管沃尔拉贝(Klaus Wohlrabe)向路透社表示。数字化进程以及人工智能(AI)热潮正在为德国本土工业提供助力,因为在数据中心的建设中,诸多领域都需要用到德国的技术。“尤其是对欧盟国家的出口十分繁荣,而对中国的出口则继续显露疲态,”沃尔拉贝补充道。 电气与科技板块领跑 传统行业悲喜互现 在各行业中,电气设备制造商依然保持着极高的乐观情绪。数据处理设备以及电子与光学产品制造商同样表现出积极态度。分析指出,经济领域的日益数字化以及对人工智能的大规模投资在其中发挥了重要作用。 此外,处于危机中的汽车工业对其出口前景的看法也明显更加乐观。金属制品制造商中同样萌生了新的信心。相比之下,造纸业以及金属生产和加工企业的出口预期则出现下滑。 对外贸易此前已为第二季度的经济增长提供了支撑。德国联邦统计局最新公布的数据显示,第二季度德国国内生产总值(GDP)实现了0.3%的增长,连续第三次上升。 联邦统计局局长布兰德(Ruth Brand)向路透社表示,这再次归功于“良好的出口发展势头”。今年春季,德国商品和服务出口总额较前三个月增长了2.0%,这主要得益于商品出口增长了2.6%,而服务出口则与上一季度持平。
显示更多
2026年4月25日晚(當地時間),在華盛頓特區舉行的白宮記者協會(WHCA)晚宴上,坐在特朗普總統身旁(講台上)的亞裔女性是Weijia Jiang。 作為女性於1983年出生於中國廈門,在西弗吉尼亞州長大,是一位華裔美國記者。她目前擔任CBS新聞(CBS News)的高級白宮記者,並擔任2025-2026年度白宮記者協會主席,是該協會歷史上首位擔任此職的女性有色人種。 在本次晚宴發生槍擊事件時,魏佳表現得非常鎮定,冷靜地協助疏散並彙報現場情況,其毅然決然的表現被贊譽為『專業且勇敢』。然而,考慮到當前複雜的國際局勢,她作為華裔的特殊身份,以及在活動中與特朗普總統如此近距離接觸的情況,也引發了一些關於安全和政治敏感性的擔憂。 2026年4月25日夜(現地時間)、ワシントンD.C.で開催されたホワイトハウス記者協会(WHCA)の晩餐会で、トランプ大統領の隣(壇上)に座っていたアジア系女性は、ウェイジア・ジャン(Weijia Jiang)氏です。 彼女は1983年に中国・厦門で生まれ、ウエストバージニア州で育った中国系アメリカ人ジャーナリストです。現在はCBSニュースのシニア・ホワイトハウス特派員であり、2025-2026年度のホワイトハウス記者協会会長を務めています。彼女は同協会の歴史上、この職に就いた初めての有色人種女性です。 今回の晩餐会で発砲事件が発生した際、彼女は非常に落ち着いた様子を見せ、現場のパニックを抑えただけでなく、冷静に避難誘導や状況報告を行いました。その毅然とした対応は『プロフェッショナルで勇敢』と高く称賛され、彼女のリーダーシップがあらためて広く注目されました。しかし、現在の複雑な国際情勢を鑑みると、彼女が中国系という特殊な身分であること、そしてトランプ大統領とこれほど至近距離で接していたという状況については、安全保障や政治的な過敏性の観点から、一部で懸念の声も上がっています。
显示更多
智利再次下调2026年铜产量预测至527万吨,较上年减少2.6%,低于上一季度预测的530万吨和更早的560万吨,主要因为国有铜业公司及必和必拓旗下矿山上半年产量异常疲弱。矿石品位下降和运营受阻使全球铜矿产量今年预计仅增长0.2%,明显落后于1.9%的需求增速,电气化、电网和数据中心扩张因而缺少供应缓冲。智利铜业委员会已把今年铜价预测由每磅5.55美元上调至5.95美元,并预计产量2027年回升5.2%至555万吨。 来源:Bloomberg
显示更多
🌏《全球金融市场核心事件一览》 📅 2026年8月12日(周三) 兄弟姐妹们,这两天的资讯和行情很关键哦,因为美国的CPI数据要出来了。 1、今日核心焦点 🔥 全球市场屏息等待今晚美国7月CPI数据,这将是美联储9月议息会议前最关键的通胀读数,也是自7月美联储主席凯文·沃什召开聚焦通胀新闻发布会以来的首个重要通胀数据。 2、今日重点关注事件 🥇 北京时间20:30|美国7月CPI通胀数据 这是本周最重要的宏观数据。市场预计7月CPI年增率3.4%,略低于6月的3.5%;核心CPI年增率预计从2.6%降至2.5%。按月来看,整体CPI月增0.1%,核心CPI上涨0.2%。 市场影响路径: (1)若通胀同步走弱→加息预期进一步回落→利好风险资产和黄金; (2)若通胀展现粘性→市场乐观预期面临修正→扰动全球市场情绪; 机构分歧明显:摩根大通认为核心CPI月增0.22%尚不足以推动9月加息;花旗认为若再次出现偏弱数据可能基本排除9月加息;美银则警告若核心服务价格重新加速,美联储仍可能保留加息选项。 🏦 中国人民银行MLF与公开市场操作 受央行8月初开展5000亿元3个月期买断式逆回购操作影响,市场关注8月中旬MLF到期与续作安排,以及对下半年流动性支持力度的评估。 🛢️ 霍尔木兹海峡局势 美伊谈判继续牵动能源市场神经。巴基斯坦国防部长周二表示美伊“接近达成某种安排”,但特朗普向伊朗提出全面新要求令协议前景蒙上阴影。市场对能否立即恢复航运持怀疑态度,油价连续第四个交易日上涨,WTI收于$83.20/桶。 3、隔夜市场回顾 美股:三大指数全线收跌,道指跌0.11%报53,975.98点,纳指跌0.32%报26,605.36点,标普500跌0.06%报7,753.11点。市场在CPI数据前保持谨慎。 美元指数:小幅上涨0.02%,收于99.828。 黄金:从两个月高位回落,盘中一度触及$4,434.84(6月5日以来最高),随后因油价反弹和CPI前观望情绪回落,收于$4,368.81,跌幅约0.5%。 比特币:跌破$64,000至一周低点,仍在$62,000-$66,000区间盘整,ETF资金流入与矿企/企业抛售相互抵消。 原油:WTI上涨1.3%至$83.20/桶,布伦特上涨1.4%至$88.91/桶,连续第四个交易日上涨。 4、今日关注时间表 ⏰ 20:30|美国7月CPI数据(本周最关键数据,定调9月加息预期); ⏰ 待定|欧佩克月度原油市场报告; ⏰ 待定|IEA月度原油市场报告。 5、本节总结 📌 今日是8月最具分量的数据日,CPI定调美联储9月加息路径,黄金在$4,400关口拉锯,油价的反复波动为通胀数据增添不确定性,数据落地前保持观望,等待方向明确。
显示更多
一、美股债券总分类(共7大类别,含国债分档+企业债+红利固收类ETF) 大类1:利率债(美国国债,无信用风险,只受利率波动影响,AAA零违约) 1)超短期国库券(现金等价物,0–3个月,短期利率债) • 底层:T-Bill短期国库券 • 代表ETF: SGOV(0–3月美债)、BIL(1–3月国库券)、VBIL • 久期:<0.3年,几乎不受加息冲击,等同于高息现金。 2)短期国债(1–3年,短期利率债) • 底层:1–3年期T-Note • 代表ETF: SHY(iShares 1–3年国债)、VGSH(先锋短债国债)、SPTS 3)中期国债(3–10年,中长期利率债主力) • 细分两档: ①3–7年:IEI、SCHO ②7–10年:IEF、VGIT(最主流中期利率债) 4)长期国债(10年以上,长久期利率债) • 10–20年:TLH • 20年以上超长债:TLT(市场标杆长债)、EDV(25+年零息债,波动极大) 5)全期限综合国债 • 代表:GOVT,覆盖全曲线美债,不押注期限。 6)通胀保值国债(TIPS,抗通胀国债) • 代表:VTIP(短端TIPS)、SCHP、TIP(全期限通胀债) 大类2:信用债(企业债,在无风险利率基础上加信用溢价,分两大档) (A)投资级企业债(BBB及以上评级,低违约,稳健固收) 1. 短端企业债(1–5年):IGSB、VCSH 2. 中端企业债(5–10年):IGIB 3. 长端企业债(10年+):IGLB 4. 全期限综合投资级:LQD(行业龙头)、USIG (B)高收益债(垃圾债,BB及以下评级,高票息,强周期属性) • 综合高收益:HYG、JNK、USHY(三大龙头) • 短久期高收益(降低利率风险):SHYL 大类3:全市场综合债券(利率债+投资级企业债+MBS打包,固收底仓) • 标杆:AGG、BND(全球两大总债ETF,久期≈6年,均衡配置) 大类4:MBS住房抵押债(政府机构背书,介于国债与企业债之间) • 代表:MBB、GNMA,波动小于企业债,票息略高于国债。 大类5:市政债(Muni,美国地方政府债,利息免征联邦所得税,高收入人群专属) • 代表:MUB(全国市政债)、SUB(短期市政债) 大类6:浮动利率债(对冲加息,票面利率随Libor重置) • 国债浮息:TFLO • 企业浮息:FLOT 大类7:高股息固收替代(你要求加入的高股息ETF,属于权益类收益工具,非纯债券) 不属于债券,但常被用来替代债券吃稳定现金流: 1. 高股息大盘:SCHD、VYM、HDV 2. 公用事业类(类债资产,波动极低):XLU、UTIL 3. REIT不动产(永续现金流,久期极长,利率敏感):VNQ 二、核心品种横向对比(风险、利率敏感度、收益、股债相关性) 品种分类 核心标的 久期 信用风险 加息表现 降息表现 和股市相关性 当前票息水平 超短期国库券 SGOV/BIL 0.2年 无 几乎不跌 小幅横盘 极低 4.7%~5.2% 短期国债(1–3Y) SHY/VGSH 1.8年 无 小幅回撤 小幅上涨 负相关(避险) 4.3%~4.6% 中期国债(7–10Y) IEF 7.5年 无 明显下跌 大幅上涨 负相关 3.9%~4.2% 长期国债(20Y+) TLT 17年 无 深度回撤 大涨 强负相关(熊市对冲神器) 3.6%~3.9% 投资级企业债 LQD 7年 低 中等回撤 上涨(利率+信用双利好) 弱正相关 4.8%~5.3% 高收益垃圾债 HYG/JNK 4年 高 小幅波动 上涨,但更看经济 高度正相关(熊市会跟股票一起跌) 6.5%~7.5% 综合总债底仓 AGG/BND 6年 中低 温和回撤 稳步上行 弱负相关 4.4%~4.8% 高股息权益 SCHD/VYM —(权益) 行业风险 震荡 看盈利 中等正相关 3.8%~4.5% 三、关键规则总结 1. 利率债只吃久期风险,无违约;期限越长,价格对美联储利率越敏感:TLT波动≈IEF的2.5倍,≈SHY的8倍。 2. 企业债=无风险利率+信用溢价:投资级跟随利率为主;高收益跟随经济周期为主,衰退期会暴跌,不能用来对冲股市。 3. SGOV/BIL是加息周期现金池;TLT是降息周期主力;LQD是经济平稳期增强收益的首选;AGG/BND适合做固收底仓。 4. 高股息ETF是权益资产,熊市没有国债的避险属性,只能当作“债券替代品”,不能等同于固收。
显示更多
分享一下2026我最常用的AI产品。 自去年8月之后,时间又过了大半年,我觉得我又可以来分享一下我现在最常用的AI产品了。 AI圈的变化,实在是太快了。 毕竟,马上五一假期了。 我相信很多朋友肯定不出去玩,要在家里学AI的对吧?肯定的吧! 所以咧,出一期这个,也能帮大家,在五一假期学习AI。 坦诚的讲,我用的大部分都是海外版的产品,因为从能力和质量上来说,目前海外版的一些产品确实能力更强,但也更贵。 但考虑到很多人的不方便,所以如果国内有水平差不多的,我也会推荐一个国内的产品,方便大家使用,如果某项能力差很多的,我就不推荐了。 那么,咱们开始。 1. 知识问答: GPT-5.5(幻觉极低) 豆包(国内) 2. 内容创作与知识管理: Claude Opus 4.6(独一档的夯,别用Opus 4.7,真的拉) DeepSeek V4 Pro(国内) 3. 数据分析: Codex + GPT-5.5 Claude Code + GLM-5.1(国内) 4. 前端设计: Gemini 3.1 Pro Kimi K2.6(国内) 5. 架构规划: Claude Code + Claude Opus 4.7 Claude Code + GLM-5.1(国内) 6. 代码开发执行: Codex + GPT-5.5 Claude Code + GLM-5.1(国内) PS:我现在一般是cc + Opus 4.7做完规划以后,Codex + GPT-5.5去进行详细开发和执行。 7. 深度研究: ChatGPT DeepResearch 豆包(国内) 8. 图片与平面设计: GPT-image-2(独一档的夯) 即梦Seedream-5.0-lite(国内) 9. 视频生成与编辑: Seedance 2.0(运动质感) 可灵3.0(电影质感,原生4k夯爆了) PS:两个都是国内的。 10. 音乐生成: Suno v5.5 MiniMax Music 2.6(国内) 11. 3D生成: TripoAI 12:AI输入法: 豆包输入法(语音输入夯爆了) 13:AI硬件: 飞书录音豆(帮我拿我自己每天的语音对话Context进飞书会议纪要) GetSeed录音卡(帮我每天发芽获得新的认知) 14:AI热点资讯获取: AIHOT(我自己做的,浓缩了三年做AI自媒体的经验,五一我在家里再优化一下成本和服务器还有安全啥的,预计五一节后可以给所有人免费开放使用,做都做了,不如给大家一起玩) 感觉我几乎常用的就这些了,有点想不起来别的了。。。 如果大家有自己想知道的其他场景的好用的AI产品,也可以在评论区提问,玩了这么多,知无不言。 大概就是这样。 大家五一快乐! 如果没啥大热点的话,那咱们节后再见啦!
显示更多
0
78
525
90
转发到社区
我还说估计能到3000万美元,现在已经突破3400万美元了,估计到结束4000万美元,超募10倍应该问题不大 为啥大家都这么看好树莓 Boundless 呢? 有点好奇,我试着从技术优势的角度研究一下Boundless,希望对你了解该项目有所帮助 作为ZK系重要项目@boundless_xyz凭借其技术创新与生态布局展现出的特点 技术优势——通用zkVM架构 基于RISC-V指令集构建的zkVM(R0VM 2.0),支持任意通用程序编译为ZK证明,突破传统EVM兼容性限制,开发者可使用Rust等语言直接开发 成本优势——跨链验证协议 通过多链原生合约部署,实现跨链分布式证明市场,开发者无需离开原有生态即可调用ZK算力,验证成本降低至0.0012美元/笔 正向反馈激励——PoVW激励机制 首创可验证工作量证明,将ZK计算周期数加密上链,按实际工作量分配$ZKC奖励,实现公平透明的算力市场 核心优势 通过GPU优化与内核重构,以太坊全链证明年成本从1.7亿美元降至50万美元,降幅达340倍 生态协同 与Eigen Layer、Lido等30+项目深度合作,覆盖ZK Rollup、DeFi、跨链桥等场景,日均处理2.6万亿计算循环 开发者友好 提供反向荷兰拍卖机制与标准化API,使ZK集成周期从数月缩短至数小时,支持无Gas限制的链下计算 @Tinaliu333 @RiscZeroCN @boundless_xyz
显示更多
0
15
19
3
转发到社区
一天卖130亿 昨天的文章不是查了国际银价百年走势嘛,我今天想起了另一个角度,就是黄金白银汇率过去100年的走势,也有相关的统计。如下图,起点也是1915年,至今110年。 1970年之前的数据不够具体,所以k线复现的能看出来也不够细节,1970年之后肉眼可见的不一样。 过去110年黄金白银的汇率波动也不小,低的时候到过10附近,高的时候接近120,所以并不能简单的做黄金白银行情联动,彼此偏差的幅度已经足以让那些上杠杆的人家破人亡。 目前黄金白银最新的汇率在74,从历史上看是一个中偏上的位置,但只看近5年、近10年并不高。我个人觉得黄金白银汇率还有进一步下跌的空间,不包,纯直觉。 另外今天还有一个小发现和大家分享一下,我之前不是多次在公众号上提到过黄金etf(518880)嘛,我发现另一个黄金etf(518850)更好,原因是后者下调过管理费,只收0.2%,比前者的0.5%便宜。两个etf底层资产和策略都是一样的,但如果长期持有的话,每年差0.3%。 我有200多的518880,每年7000-8000呢,苍蝇腿也是肉,回头我把仓位调一下。 …… 今天a股的成交量继续萎缩,全天加起来只有1.59万亿,和之前牛市峰值相比已经接近腰斩。从盘面来看主要是买盘萎缩,炒概念的资金远不如前几个月活跃,当时像寒武纪一天能成交250亿以上,今天只有62亿。这当然是消极信号,没有这些较为激进的交易者搭台唱戏,整个a股的流动性也会退化。 今天场内为数不多的亮点是海峡两岸板块,福建发布了12条惠台政策,资金拉升了福建相关个股,但幅度也没到2%。两岸概念从我刚入市的那年就开始炒,我以前也掺合过,在一个叫厦门港务的票上赚过两个涨停,但终究的这个概念都是昙花一现,从来都没真正支棱起来过。我觉得主要原因是两岸的互动并没有真正的良性变化,更多时候都是我们单方面的释放善意,然后民进_党处处提防统战,所以资金炒着炒着觉得没趣就自己熄火了。 除了两岸概念,其它前期板块今天都扑了,也没啥大不了的利空,就是没钱,全场没钱。 目前大盘已经摆脱了向下通道,但也没有回到上升通道,处在中间区域,头上有ma20、30、60这三条均线压着,脚下有ma5和ma10托着,用白话形容就是短期成本和中期成本互相碰撞纠缠的状态,由于成交量一直“低血糖”,无法提供足够的动能,想要同时突破3条中期均线的压制很难。 老乡们不能再走了,再走人心就散了。 …… 1、六大行全面停售5年期大额存单,目前3年期的缺货,2年期的利率1.4%。由于房价不利,后续多半还要降息,目前的存款利率还得往下降,前几年锁了5年大额存单的赚到了,但这种好事以后没了。谁要嫌银行收益低就来炒股,躺赚不允许。 2、万科债连续下跌,今天收盘我看了一下好几个都在25左右,这是市场对债券真实价值的定价。这几天陆陆续续有人留言说能不能散户买一点,赌小额刚性兑付。可是我都好几年没听过公开债的小额刚兑案例了,官方在刻意弱化这方面的预期。另外万科的债务规模这么大,很可能不会专门照顾小额债权人,我建议不要冒这个险了,值博率一般。 3、中国药品价格登记系统上线,给医药商业一个全国统一的官方价格标签,有利于医药销售,还能吸引外资新药进来 + 帮国产创新药出海,销量利润双增长。这事不改医保价,不降药价,纯增量利好,所以今天医药商业板块+2.6%。 4、昨天热度颇高的豆包智能手机今天也降温了,中兴通讯高开低走收跌1.7%。我今天又补看了第二批6-7个演示视频,说实话也没有很打动我,都是一些轻应用场景,都预设了一个用户自己忙的顾不上看手机,必须单独让ai去操作,但同时又对ai的操作结果不放心,需要随时去看去纠正。像是我们家里假装不看小孩,然后偷偷用手机记录他走路,喝水,吃东西。 我还是昨天那句话,我们在手机上没有极度不想干,但又不得不干的事情可以交给ai做,如果你觉得我说的不对,可以在这一段划线评论举例子反驳我。 5、今天听说有一个深圳的豪宅盘湾云玺,一天爆卖130亿,我看了新闻,结果发现这个盘子是超高层住宅,而且层数越高价格越高。55层以上的户型都是1.3亿起,单价25万+/平米,最顶层5亿一套。 不太理解深圳的顶豪是怎么想的,住超高层住宅真的不担心消防问题吗。现实中一旦超过18层起火,消防的应对措施就很困难,你这50多层要是着了,119就算来了也束手无策。 像它这样的超高档楼盘物业费肯定不低,不用担心长期维护问题,但更多的普通人真的要尽量避开超高层楼盘,年久失修,物业费拖欠严重,20-30年后一大堆问题。 今晚就到这吧,最近先不发射了,看看情况。
显示更多
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
显示更多
0
46
33
2
转发到社区