注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 260531薫風が導く星の彼方より
260531薫風が導く星の彼方より 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 260531薫風が導く星の彼方より 的推特
【A股盘中】📊 2026年7月8日 周三 14:30实时快照 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ ⚠️ 本报告基于今日盘中实时数据,数据截止14:30 一、盘中盘面速览 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 截至14:30,三大指数表现分化: • 上证指数:小幅上涨 (+1.43%) • 深证成指:小幅下跌 (-0.85%) • 创业板指:大幅上涨 (+0.85%) • 科创50指数:涨近2% 市场整体呈现"沪强深弱"格局,创业板和科创板表现强势。 成交量方面,个股涨跌比为1500:3700(约28%上涨),市场整体涨少跌多,分化明显。 【市场情绪判断】:偏多/震荡 科技主线继续独撑赚钱效应,但个股分化加剧,操作难度加大。 二、板块涨跌实时排行 📈📉 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【涨幅前五板块】 1. 云计算:+4.18%(涨停潮,浪潮信息、网宿科技等涨停) 2. AI服务器:+3.5% 3. 算力:+2.8% 4. 半导体:+2.1% 5. 数字经济:+1.8% 【跌幅前五板块】 1. 医药商业:-2.1% 2. 房地产:-1.8% 3. 银行:-1.2% 4. 保险:-0.9% 5. 消费:-0.6% 【板块轮动节奏】 今日市场风格偏向进攻型,科技主线(云计算、AI服务器、算力)成为资金主攻方向,权重蓝筹表现相对疲软。 三、盘中资金流向 💰(截至14:30数据) ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【主力资金净流入TOP5行业】(数据来源:东方财富) 1. 电子:+38亿元(机构资金大幅流入) 2. 计算机:+25亿元 3. 通信:+18亿元 4. 传媒:+12亿元 5. 机械设备:+8亿元 【主力资金净流出TOP5行业】 1. 医药生物:-15亿元 2. 电力设备:-12亿元 3. 有色金属:-9亿元 4. 房地产:-7亿元 5. 银行:-5亿元 【主力资金净流入TOP5个股】 1. 浪潮信息:+8.5亿元 2. 中科曙光:+5.2亿元 3. 科大讯飞:+3.8亿元 4. 紫光股份:+3.1亿元 5. 拓维信息:+2.6亿元 【资金属性判断】:机构主导 + 游资配合 四、今日涨停板分析 🔥 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【涨停板概况】 • 涨停数量:约40只(截至14:30) • 主要分布:云计算、AI服务器、算力等科技方向 【涨停原因分类】 • 业绩驱动(60%):浪潮信息中报预增226%-288% • 政策催化(25%):AI产业政策持续加码 • 事件驱动(15%):巨头算力投资加速 【重点涨停股】 • 浪潮信息:一字涨停,封单120万手,净利润预增226%-288% • 网宿科技、深信服:20cm涨停 • 紫光股份、云赛智联、数据港:10cm涨停 【封板强度评估】:强 五、今日盘中重要消息汇总 📰 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【消息1:浪潮信息业绩预告超预期】 • 内容:预计上半年净利润26-31亿元,同比增长226%-288% • 催化板块:云计算、AI服务器 • 消息级别:行业级 【消息2:云计算ETF持续吸金】 • 内容:云计算ETF华夏(516630)近3日吸金近1亿元 【消息3:AI算力需求持续高增长】 • 内容:开源证券指出AI驱动云计算进入新一轮增长周期 六、尾盘操作建议 ⚡️ ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 【今日市场定性】:进攻 【尾盘是否参与?】:✅ 干 【如果参与,买什么方向?】 1. 云计算/AI服务器(首选)- 逻辑:业绩验证+政策催化+资金共识 2. 算力概念(次选)- 逻辑:算力需求持续旺盛 3. ETF配置(稳健)- 云计算ETF华夏(516630) 【仓位建议】 • 激进投资者:3-5成仓,聚焦云计算核心标的 • 稳健投资者:1-2成仓,关注ETF或低位科技股 【风险提示】 1. 云计算板块短期涨幅过大,注意回调风险 2. 中报业绩披露密集期,警惕业绩不及预期 3. 科技股波动加大,注意仓位控制 4. 市场分化严重,务必精选个股 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 请关注、转发、收藏,华尔街观察团队将持续跟踪相关消息、解读量化数据,基于WSV模型,给出股票、黄金、债券(ETF)大类资产及板块(ETF)轮动量数据,个股案例研究,为您提供超前布局机会。 ⭐️⭐️⭐️ 文章所载内容信息参考,不构成任何投资建议或操作指南。信息基于公开公告整理和量化数据机器学习计算,文章信息与数据的真实性、完整性、有效性不承担任何责任。历史数据不代表未来、案例分析不代表收益承诺。投资者据此操作,风险自担。投资有风险,入市需谨慎。 数据获取时间:2026-07-08 14:30
显示更多
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
显示更多
0
46
33
2
转发到社区
两个 prompt 状态在置信度上可以几乎完全一样,同样的扰动打上去,一个纹丝不动,一个直接崩掉。 作者是 GitHub 上的一个匿名账号,这是他唯一的公开仓库,实验是和 ChatGPT 一起做的。 Prompt-State Response Geometry(提示-状态-响应几何) 这不是一篇论文。 它是一个小爱好项目,起点是一个简单的问题: 只靠改 prompt,能不能让 LLM 更可靠地回忆起事实信息? 几天之后,我们到了一个自己也没预料到的地方。 主要观察是: 几乎一致的局部置信度,并不意味着几乎一致的扰动响应几何。 我们分享代码和原始输出,是因为这个实验足够小,可以直接检查;也因为比起假装自己有了最终答案,我们更愿意让别人来复现、拆解、扩展或解释它。 我们不宣称发现了新的 transformer 机制、幻觉检测器,或者语言模型的某种普遍性质。 核心对照 最终实验只改变同一组证据多重集的顺序。 在每个证据族内部: • 证据值完全一致 • 各值出现次数完全一致 • 逐条证据行完全一致 • 任务字符长度完全一致 • 基线 token 长度完全一致 • 配对的两边还会逐条件审计 token 长度是否相等 最重要的是: 配对是在任何扰动结果被打分之前,用基线置信度统计量选出来的。 因此之后的扰动结果不可能影响哪些状态被配对。 这种结果盲选的配对方式,是我们认为最终实验比早期探索版本更有用的主要原因。 基本想法 假设一个模型正在预测某个 token。 我们可以用一些局部统计量来描述这个预测,比如: • 目标 token 的概率 • 对数几率 • 熵 • rank 我们开始对一个不同的问题感兴趣: 如果两个 prompt 状态在这些局部置信度统计量上看起来几乎一样,当周围上下文发生一点变化时,它们的反应也相似吗? 在这个受控的 Granite 实验里,它们经常不相似。 我们发现有用的一个心智模型是: • 置信度是一张快照 • 扰动响应是附近的地形 两个点可以有相同的海拔,却有完全不同的周围地貌。 起点:Gemma 这个更广泛现象的第一个版本,出现在我们折腾 Gemma 4 26B-A4B 的时候。 当时我们用的是 llama.cpp / GGUF 配置,在观察事实回忆的边界。 其中一个例子是 Rust 的创造者: Graydon Hoare token 路径里有一个边界: Graydon Ho | are 模型对名字的靠前部分可以极其稳定,而最后延续部分的概率在伴随 prompt 下会剧烈变化。 例如,从 Graydon 延续到 Ho 的概率一直维持在接近饱和的水平,而从 Graydon Ho 延续到 are 的概率,会视周围 prompt 状态的不同,从极高置信度掉到个位数。 一开始我们几乎怀疑一切: • 采样 • llama.cpp • 量化 • prompt 模板 • KV/cache 行为 • 分词 • 或者只是一个奇怪的、模型特有的伪影 于是我们不再把 Gemma 的结果单独当作强证据,转而去搭一个更干净的设置。 Gemma 的观察和最终的 Granite 实验不是同类对照复制。它们在架构、模型家族、后端、模型规模等细节上都不同。 我们只把 Gemma 当作一条汇合证据:我们看到的更广泛的 prompt 状态敏感性,显然不是最终 Granite 设置独有的。 这个仓库里精确的随机顺序配对实验,是在 Granite 上做的。 受控的 Granite 设置 我们换成了: ibm-granite/granite-4.1-3b 用原生的 Hugging Face Transformers,配置是: float32 attn_implementation="eager" use_cache=False 不采样 不用 GGUF 不量化 teacher-force 的 next-token 打分 这从之前的设置里拿掉了好几个活动部件。 合成任务 我们造了一个临时性的虚构记录任务,用四个可能的值: Igor Sysoev Igor Sokolov Igor Smith Igor Petrov 目标延续是: Igor | Sy 我们 teacher-force: " Igor" 然后给: " Sy" 打分。 证据由重复出现的虚构记录组成,例如: K7 -> Igor Sysoev K7 -> Igor Smith K7 -> Igor Sysoev K7 -> Igor Petrov ... 在一个证据族内部,只有这些证据行的顺序变化。 最终验证里不使用记录编号,所以重排不会悄悄改变逐行记录的字面内容。 随机顺序验证 最终实验用五个证据数量族: 6 / 1 / 4 / 1 4 / 3 / 1 / 2 5 / 0 / 5 / 4 5 / 4 / 1 / 2 6 / 5 / 3 / 0 每个族采样: 768 个互不重复的随机排列 总共: 3840 个基线 prompt 状态 脚本在打分之前先做结构检查。 结果盲选的配对 我们不会先看扰动结果、再挑看起来有趣的配对。 配对只从基线测量里选。 默认标准是: rank = 1 P(correct) 在 0.80 到 0.995 之间 delta log-odds 的绝对值 <= 0.01 delta entropy 的绝对值 <= 0.02 配对选择发生在扰动打分之前,选中的配对在每个族内部互不重叠。 冻结下来的选择保存在: results/selected_pairs.json 扰动 配对冻结之后,同样的 12 个伴随扰动被施加到每一对的两个状态上: repeat LUMA repeat NOVA repeat KITE repeat 4827 copy LUMA copy NOVA copy KITE copy 4827 write LUMA write NOVA write KITE write 4827 这些是小的伴随任务,不改变虚构的 K7 证据本身。 对每个状态,我们测量目标 token 的对数几率相对它自己的基线移动了多少。 这给出一个 12 维的响应向量: [dLO_1, dLO_2, ..., dLO_12] 对每一对配对,主要的比较指标是: profile MAE 也就是两个响应向量之间逐条件的平均绝对差。 最终结果 随仓库附带的随机顺序验证产出了: 配对数量 N:20 基线 delta LO 中位数:0.00079255 profile MAE 均值:2.9246 profile MAE 中位数:2.2979 profile MAE 最大值:10.0046 配对的基线可以极其接近。 比如有一对大约是: 基线 P(correct): 93.613813% 93.614706% delta log-odds: 0.0001493 而它的扰动 profile MAE 是: 2.8936 另一对的基线对数几率差只有大约: 0.00107 profile MAE 却大约是: 10.00 在若干对里,一个状态在多数甚至全部扰动下丢掉了 top-1 的位置,而它基线配对的一方没有。 所以,在这个设置里: 把局部预测匹配得非常接近,并不能保证这个预测对附近上下文变化的响应方式也被匹配。 一个简单的样本内对照 对第一版 README 的一个有用的批评是:「2.92,跟什么比?」 不需要再跑一次模型,我们就能回答其中一部分。 被选中的集合有 40 个状态:5 个证据族,每族 8 个。 我们把 20 对结果盲选的置信度配对,跟同样这 40 个状态里族内的其他配对做了比较。 • 配对数量:匹配配对 20,族内其他配对 120 • profile MAE 均值:匹配配对 2.9246,族内其他配对 3.0348 • profile MAE 中位数:匹配配对 2.2979,族内其他配对 2.1155 在这个选中的集合里,非常紧的置信度匹配并没有让扰动响应 profile 比族内其他配对明显更相似。 我们不把这解释为「置信度不包含任何信息」。这是在已经选出来做 profile 打分的 40 个状态之间做的描述性、条件化的比较,不是对全部 3840 个基线状态的总体层面统计检验。 但它让那个窄结论更容易陈述了: 匹配这些局部置信度统计量,不足以决定扰动响应 profile。 对数几率与概率饱和 这个项目更早的版本用被截断的概率计算对数几率。这在概率接近饱和时,数值上可能产生误导。 最终实验不用那个指标。 对数几率直接从 logits 计算: target_logit - logsumexp(all_other_logits) 指标的运算全程在 float64 里完成。 一些被扰动的状态仍然会接近概率饱和,所以即使没有旧的数值 bug,大的对数几率也会自然出现。 作为描述性的敏感性检查,我们把被扰动的对数几率截断在 99.99% 置信度对应的量级。 • 原始 profile MAE 均值:2.9246 • 截断后 profile MAE 均值:2.7263 效应变小了一点,但没有消失。 这个截断检查是对随附输出的离线分析,不属于配对选择的一部分。 我们认为这意味着什么 我们不认为置信度没用。 在早期的探索性实验里,置信度和敏感性经常按预期的方向相关:高置信度的预测总体上比不确定的预测更稳定。 这里更窄的观察是: 局部置信度统计量看起来并不能唯一地决定局部扰动行为。 两个状态按这些指标可以看起来几乎一样: P(correct) log-odds entropy rank 却在同一组扰动下有着非常不同的响应 profile。 因此,如果我们关心的是一个状态在附近上下文变化下如何表现,单张局部置信度快照可能是一个不完整的描述。 与 prompt 敏感性的关系 prompt 敏感性本身不是新东西。 众所周知: • prompt 措辞有影响 • few-shot 示例顺序有影响 • 上下文顺序有影响 • 语义相似的 prompt 可以产出不同的输出 我们的实验问的是一个更窄的问题。 不是只问: 改 prompt 会改变预测吗? 而是问: 如果两个 prompt 状态在当前预测边界上已经看起来几乎一样,它们对之后同样的扰动,反应也相似吗? 我们受控的 Granite 结果表明答案可以是:不。 我们刻意不做比这更强的原创性声明。 这不证明什么 这个仓库不证明: • 幻觉检测器 • 所有 LLM 的某种普遍性质 • 新的 transformer 机制 • 证据顺序总是有影响 • 某一种排序策略全局更好 • 置信度没用 • 事实记忆特别脆弱 • post-training 造成了这个效应 确切的内部机制未知。 可能的解释涉及位置、注意力历史、上下文表征、残差流状态,或者完全别的东西。 我们没有把这个机制分离出来。 重要局限 最终的受控实验仍然是窄的。 一个受控模型 精确的随机顺序配对实验是在 ibm-granite/granite-4.1-3b 上做的。 Gemma 4 26B-A4B 更早显示了这个更广泛的现象,但精确的随机顺序设计没有在它上面复现过。 一个合成任务 最终实验用的是: Igor Sysoev Igor Sokolov Igor Smith Igor Petrov 其他的 token 几何或合成任务可能表现不同。 一类扰动 这 12 个扰动是手工设计的。 它们不是从所有可能的伴随 prompt 里随机抽样的。 匹配的是汇总统计量,不是完整分布 配对按目标概率/对数几率、熵和 rank 匹配。 我们没有匹配完整的基线 next-token 分布。 因此两个状态可以有相似的目标置信度汇总,却在对手 token 上的详细分布不同。 更严格的未来对照可以直接匹配或约束完整分布的散度。 描述性结果 这个仓库专注于展示和复现这个观察。 我们不提供正式的推断统计,也不宣称一个总体层面的效应量。 我们为什么停止测试 总还有下一个可能的对照。 我们可以测: • 另一个模型家族 • 另一组名字 • 另一个合成任务 • 随机扰动族 • 不同的 token 边界 • 隐藏状态相似度 • 完整 next-token 分布匹配 • 更大的排列集合 到某个点,我们认定更有用的做法是:发布一个最小可复现的版本,让别人来攻击它。 如果这个观察在更好的对照下消失了,那是有用的。 如果它在别处复现了,那也是有用的。 复现实验 这个仓库刻意只包含一个主实验脚本: 运行: python 默认运行每个证据族采样: 768 个排列 并把输出写到: random_order_validation/ 脚本支持 checkpoint,中断的运行可以恢复。 更大的排列搜索: python --n-per-family 1500 随附结果的生成环境 随附的输出是用这些生成的: Python: 3.14.4 PyTorch: 2.12.0+rocm7.14.0 Transformers: 5.14.1 HIP: 7.14.60850 GPU: AMD Radeon RX 7900 XT 模型: ibm-granite/granite-4.1-3b 模型设置: float32 eager attention use_cache=False ROCm 版 PyTorch 通过普通的 device = "cuda" 接口暴露 GPU。 仓库内容 README.md LICENSE requirements.txt .gitignore results/ final_summary.json selected_pairs.json baselines.jsonl profiles.jsonl run_output.txt baselines.jsonl 是基线排列扫描。 selected_pairs.json 是冻结下来的结果盲选配对。 profiles.jsonl 是扰动打分。 final_summary.json 是最终的配对级指标和结构审计。 run_output.txt 是那次运行的原始终端输出。 关于讨论与回应 这是一个爱好项目,不是一个我们打算无限期维护的研究计划,也不是一篇我们打算无限期辩护的论文。 我们分享代码、原始输出、方法和局限,这样实验可以被检查,而不需要信任我们本人。 我们可能不回应评论、issue、私信、辩论请求,或者每一个被提议的后续实验。 没有回应不应该被解释为同意、不同意,或者对某个批评有效性的表态。 如果你发现了实验的问题,那是有用的。挑战这个结果最有用的方式是:复现它、改代码、跑一个更强的对照,或者给出一个反例。 我们没有这个仓库会成为长期研究项目的预期。如果有什么值得加的,我们可能更新它;也可能就让它保持原样。 AI 协作 这个项目是仓库主和 ChatGPT 协作开发的。 最初的方向来自仓库主: prompt 设计能让 LLM 更可靠地回忆起信息吗? 从那以后,随着意外行为不断出现,项目反复转向。 仓库主在本地跑模型,通过质疑实验选择、发现设置问题、否决死胡同、推动更干净的对照来引导调查,包括在后端和采样问题变得重要之后,离开 llama.cpp。 大部分实验代码和大部分详细的定量分析,是由 ChatGPT(OpenAI)在交互式会话中产出的。 ChatGPT 也根据实验历史、代码和记录的结果写了这份 README,经仓库主审阅和指导。 所以这个仓库不应该被读成: 「一个人类研究员写了所有东西,偶尔用 AI 自动补全。」 那不准确。 更好的描述是: 我们交互式地探索了这个问题:仓库主提供了最初的想法、本地执行、怀疑和方向;ChatGPT 提供了大部分代码、定量分析和实验迭代。 我们明确披露这一点,因为没有理由隐藏它,尤其是在一个关于语言模型的项目里。 代码和原始输出都在仓库里,所以谁都不用信任我们两个中的任何一个。 请复现它、拆掉它、简化它,或者找到一个更好的解释。 做这些事不需要我们的参与。 许可证 这个仓库以 The Unlicense 发布。 意图很简单: 用它、抄它、改它、fork 它、扩展它,或者扔掉它。 不需要我们许可。 模型、PyTorch、Transformers 和其他第三方依赖的许可证与条款仍归它们各自所有。 原文: #LLM# #PromptEngineering# #AI实验#
显示更多
【开云-9月18日 19点35分 中超 浙江队 vs 武汉三镇】 (本场赛事红包雨🧧敬请周知!) 数据初盘开出主队-0.5/1,说明机构对浙江队实力的认可。浙江队目前25轮9胜6平10负积28分暂列第10位。球队近期战绩起伏较大,近10场比赛3胜2平5负,上一轮客场1-2不敌天津津门虎。不过球队主场进攻火力尚可,此前曾在主场6-0狂胜云南玉昆、3-2力克大连英博。武汉三镇目前25轮5胜11平9负积21分深陷降级区暂列第15位。球队胜率较低,但防守端具备较强的韧性,近4轮联赛取得3平1胜保持不败。但进攻端中介能力较差,中前场推荐效率不高。两队近10次各类赛事交手,浙江队取得7胜1平2负,占据绝对心理优势。综合分析,本场看好浙江队主场取胜。 全场让球:浙江队-0.5/1@1.94 全场大小:大3.5@1.98 推荐比分:3-1
显示更多
✨世界杯32强淘汰赛首战✨ 南非VS加拿大 03:00生死战打响! 当前看点 南非能否延续黑马气势爆冷晋级? 加拿大主场优势+亚洲盘0.5-1 能否稳稳拿下? 大小球2.5/3 热度拉满, 今早谁能率先晋级16强? 滑动看完整赔率 #2026ワールドカップ# #L组# #英格兰# #赔率分析# #世界杯#
显示更多
【开云-9月19日 22点整 英超 布莱顿 vs 阿森纳】 (本场赛事红包雨🧧敬请周知!) 数据初盘开出全场让球:布莱顿+0.5/1,机构倾向客队优势。英格兰超级联赛第5轮,主队2胜1平1负积7分排名第5,球队防守能力相对较弱,整体表现欠缺稳定性。客队新赛季四战全胜位居联赛榜首,球队攻防兼备,韧性十足,状态火热,实力毋庸置疑。两队近十场交锋阿森纳6胜2平2负占优,近三场对绩更获全胜,近年实力相对更强,综合分析本场看好客队继续连胜节奏。 全场让球:阿森纳-0.5/1@1.91 全场大小:小2.5/3@1.86 推荐比分:0-2
显示更多
🔥神级师兄预测+模型+实战双验证干货来了💥 📌 英格兰 vs 刚果民主共和国 🇬🇧 vs 🇨🇩 ✅ 推荐:让平 / 让负 🎯 比分参考:1-1、2-1、0-1 📊 模型数据:英格兰胜率70% / 平19% / 刚果12% 预期进球 2.20-0.97 主方向:英格兰胜,优势明显! 主比分:2-0(9.5%) / 2-1(9.2%) / 3-0(8.4%) 防冷:1-1(8.8%) 大比分空间:英格兰赢2球+概率46% 风险:强队别押死单一比分,大胜/穿盘更稳! 📌 比利时 vs 塞内加尔 🇧🇪 vs 🇸🇳 ✅ 推荐:主不败(平 / 主胜) 🎯 比分参考:1-1、2-1、2-2 📊 模型数据:比利时45% / 平26% / 塞内加尔28% 预期进球1.67-1.29 主方向:两边接近,不适合重仓!比利时不败谨慎看好 主比分:2-1(9.3%) / 1-0(8.1%) 防冷:1-1(11.6%) 风险:塞内加尔反击威胁大,冷门概率不低 📌 美国 vs 波黑 🇺🇸 vs 🇧🇦 ✅ 推荐:美国胜 🎯 比分参考:2-0、2-1、3-1 📊 模型数据:美国38% / 平28% / 波黑34% 预期进球1.23-1.76 主方向:两边接近!美国不稳,波黑拿分空间很大 主比分:2-1(6.6%) / 1-0(5.6%) 防冷:1-1(11.3%) 风险:平局+波黑不败都要重点提防 📈 今日模型最终方向总结: ✅ 英格兰:胜方向强推(最稳) ⚠️ 比利时:不败(谨慎) ⚠️ 美国:不败(谨慎) 冷门提醒:比利时和美国方向都有被拖平甚至爆冷的可能,塞内加尔、波黑不可小觑! 分析结合最新模型概率+实战推荐,双重验证!
显示更多
0
118
307
24
转发到社区
🌏《全球金融市场核心事件一览》 📅 2026年8月12日(周三) 兄弟姐妹们,这两天的资讯和行情很关键哦,因为美国的CPI数据要出来了。 1、今日核心焦点 🔥 全球市场屏息等待今晚美国7月CPI数据,这将是美联储9月议息会议前最关键的通胀读数,也是自7月美联储主席凯文·沃什召开聚焦通胀新闻发布会以来的首个重要通胀数据。 2、今日重点关注事件 🥇 北京时间20:30|美国7月CPI通胀数据 这是本周最重要的宏观数据。市场预计7月CPI年增率3.4%,略低于6月的3.5%;核心CPI年增率预计从2.6%降至2.5%。按月来看,整体CPI月增0.1%,核心CPI上涨0.2%。 市场影响路径: (1)若通胀同步走弱→加息预期进一步回落→利好风险资产和黄金; (2)若通胀展现粘性→市场乐观预期面临修正→扰动全球市场情绪; 机构分歧明显:摩根大通认为核心CPI月增0.22%尚不足以推动9月加息;花旗认为若再次出现偏弱数据可能基本排除9月加息;美银则警告若核心服务价格重新加速,美联储仍可能保留加息选项。 🏦 中国人民银行MLF与公开市场操作 受央行8月初开展5000亿元3个月期买断式逆回购操作影响,市场关注8月中旬MLF到期与续作安排,以及对下半年流动性支持力度的评估。 🛢️ 霍尔木兹海峡局势 美伊谈判继续牵动能源市场神经。巴基斯坦国防部长周二表示美伊“接近达成某种安排”,但特朗普向伊朗提出全面新要求令协议前景蒙上阴影。市场对能否立即恢复航运持怀疑态度,油价连续第四个交易日上涨,WTI收于$83.20/桶。 3、隔夜市场回顾 美股:三大指数全线收跌,道指跌0.11%报53,975.98点,纳指跌0.32%报26,605.36点,标普500跌0.06%报7,753.11点。市场在CPI数据前保持谨慎。 美元指数:小幅上涨0.02%,收于99.828。 黄金:从两个月高位回落,盘中一度触及$4,434.84(6月5日以来最高),随后因油价反弹和CPI前观望情绪回落,收于$4,368.81,跌幅约0.5%。 比特币:跌破$64,000至一周低点,仍在$62,000-$66,000区间盘整,ETF资金流入与矿企/企业抛售相互抵消。 原油:WTI上涨1.3%至$83.20/桶,布伦特上涨1.4%至$88.91/桶,连续第四个交易日上涨。 4、今日关注时间表 ⏰ 20:30|美国7月CPI数据(本周最关键数据,定调9月加息预期); ⏰ 待定|欧佩克月度原油市场报告; ⏰ 待定|IEA月度原油市场报告。 5、本节总结 📌 今日是8月最具分量的数据日,CPI定调美联储9月加息路径,黄金在$4,400关口拉锯,油价的反复波动为通胀数据增添不确定性,数据落地前保持观望,等待方向明确。
显示更多
【开云-8月6日 1点整 欧协资 布兰 vs 阿波罗利马索尔】 数据方面机构开出主队让0.5/1,给予实力的认可。布兰近期状态较为稳定,近10场取得5胜1平4负,球队整体具备一定竞争力,尤其主场作战时能够发挥出更强的比赛节奏和进攻能力。阿波罗利马索尔近10场取得6胜1平3负,近期表现同样不错,但球队客场适应能力和防守稳定性仍需考验。欧洲协会联赛资格赛中,主场优势往往会对比赛走势产生重要影响,布兰在熟悉的场地和战术体系下更容易掌握主动。综合双方近期表现来看,布兰整体优势略占上风。综合分析,本场更看好布兰主场取胜。 全场让球:布兰-0.5/1@1.82 全场大小:小2.5/3@1.78 推荐比分:1-0
显示更多
【开云-6月29日 1点整 冰岛超 哈夫纳夫约杜尔 vs 韦斯特曼纳】 数据初盘开出全场让球:哈夫纳夫约杜尔-0/0.5,机构倾向主队稍占优势。冰岛超级联赛第12轮,主队1胜3平7负积6分排榜尾,近十一场主场未尝胜绩,表现甚差,状态持续低迷。客队3胜2平6负积11分排名第9,斩获三连胜,前场把握能力有所提升,近期状态火热,愈战愈勇。两队近十场交锋韦斯特曼纳4胜3平3负稍占优势,近年整体实力略胜一筹,综合分析本场看好客队可以守住指数。 全场让球:韦斯特曼纳+0/0.5@1.90 全场大小:小3.5@1.75 推荐比分:1-1
显示更多