注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 保存修復
保存修復 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 保存修復 的推特
纽约州民主党众议员欧加修-寇蒂兹(Alexandria Ocasio-Cortez, 又称AOC)周六(8月8日)晚间在社群媒体发布一系列影片,宣布她决定冻卵。她表示,公开这项私人决定可能带来“政治风险”,但希望借此让女性生育选择获得更多讨论,“身为女性,我们普遍没有被教导如何了解自己的身体,也没有充分准备好面对自己的生命,不管是青春期、怀孕、更年期前期、停经,或是人生中许多不同阶段。” 36岁的欧加修-寇蒂兹表示,冻卵是她为了“感觉更能掌控自己的人生”而做出的决定。她说,自己已考虑这项决定一段时间,也为这项昂贵、通常不在医疗保险给付范围内的疗程存钱许久。她并在影片中展示冻卵疗程所需的药物、注射器及酒精棉片等用品,为自己注射药物。 欧加修-寇蒂兹表示,选择公开冻卵,也与川普政府限制堕胎权及部分生殖医疗服务的政策环境有关。她9日接受美国广播公司(ABC)访问时说:“身为领导者,我们有必要进行这些对话,分享这些过程,尤其是对全国各地的职业女性而言,让这些事情变成正常。” 她并指出,女性参选公职或求职时,经常面临与生育及家庭规划有关的额外审视,“这是男性不必面对的事情”。她并未透露自己是否计画生育。 这项宣布也引发外界猜测,认为她可能正为其政治前途铺路。被问及是否考虑参选总统时,她表示“没有排除这个可能性”,并暗示可能参选纽约州参议员。不过她强调,目前应将焦点放在期中选举,而非个人政治抱负。 欧加修-寇蒂兹支持堕胎权及女性生殖自主权利。 根据约翰霍普金斯医学中心,选择冻卵的女性需每天须自行注射2至3种荷尔蒙药物,通常持续10至12天,并接受抽血及超音波检查,待卵子成熟后再进行麻醉取卵手术。女性选择冻卵的原因各异,包括接受化疗等可能影响生育的治疗,以及尚未准备生育、希望保存未来生育选择等。
显示更多
0
42
60
6
转发到社区
《初学记》为唐代徐坚等奉敕纂辑的一部官修类书。此书编撰原为唐玄宗诸子作文时检查事类之用,故名。全书共三十卷,取材于群经诸子、历代诗赋及唐初诸家作品,保存了很多古代典籍的零篇单句。此内含南宋绍兴十七年余四十三郞宅刊本及明嘉靖十年锡山安国桂坡馆刊本。介绍下载:
显示更多
0
0
35
11
转发到社区
我发现很多人用了很久 Codex,可能连它一半的能力都没打开过??? 下面这 5 个用法,才是真正拉开效率差距的地方: 1.同时按下两个Command 键 Codex 会直接截取当前屏幕,并把画面带进对话 这个功能叫 AppShots 前端页面错位、样式异常、报错弹窗,不用再截图、保存、上传,直接让它看着页面修 2.用 meta 找回 Codex 的“记忆” 你可以让它查找以前的线程、回顾之前讨论过的内容、修改配置,甚至在 /goal 模式下新建线程 很多人每次都从头解释,其实 Codex 自己就能把旧上下文找回来 3.别急着用内置计划模式 直接让它创建一份 PLAN.md,然后不断讨论、修改、补充 第一版完成后,再调用 @mattpocockuk 的 /grill-me,让它逐条追问计划里的漏洞,并在每个问题结束后更新文档 计划不是一次生成的,是被一轮轮问出来的 4.重复使用的提示词,直接做成 Skill 一件事只要重复做过几次,就别再手动复制提示词 让 Codex 调用 /skill-creator,把整套流程封装成可复用 Skill 真正的效率,不是提示得更快,而是同一件事不再提示第二遍 5.长任务直接交给 /goal 复杂调研、多步骤开发、长时间运行的任务,优先使用 /goal 相比普通模式,它通常会追得更深、做得更完整,也更适合持续推进那些不可能几分钟结束的工作 大多数人还在研究怎么写一句更好的提示词 真正会用 Codex 的人,已经开始让它看屏幕、找旧线程、维护计划、封装技能、自己跑完长任务了
显示更多
0
115
125
18
转发到社区
超过 2 亿人在用 Mac。 但很多人其实只用到了最基础的功能。 下面这 11 个 Mac 隐藏技巧,学会后效率会高很多👇 1. 屏幕录制 Mac 自带录屏功能,不用额外安装软件。 快捷键: Shift + Command + 5 可以选择: • 录制整个屏幕 • 录制选定区域 • 截图 • 设置保存位置 做教程、录演示、保存操作流程都很方便。 2. 分屏视图 Mac 可以让两个 App 并排显示。 比如: 左边打开邮件, 右边打开提醒事项。 操作方法: 长按窗口左上角绿色全屏按钮, 选择放到屏幕左侧或右侧, 再选择另一个 App。 适合写作、查资料、处理任务时使用。 3. 背景音效 Mac 内置白噪音功能。 路径: Apple 菜单 → 系统设置 → 辅助功能 → 音频 → 背景音效 可以开启雨声、海浪、溪流等背景声音。 适合专注、阅读、写作、放松时使用。 4. 数字签名 PDF 不用打印出来签字。 操作: • 用「预览」打开 PDF • 点击「显示标记工具栏」 • 选择「签名」图标 • 创建或插入签名 合同、表格、文件确认都可以直接在 Mac 上完成。 5. Mac 截屏 Mac 截图快捷键一定要记住: Command + Shift + 3 截取整个屏幕。 Command + Shift + 4 截取选定区域。 截图默认会保存为 PNG 文件到桌面。 6. 视频通话中用手势反应 Mac 视频通话时支持手势反应。 比如: • 竖大拇指 • 挥手 • 比心 • 其他系统支持的手势效果 开会、网课、远程沟通时, 不用点按钮,也能快速表达反馈。 7. 在演示文稿中加入自己 做线上演示时, 可以把自己的摄像头画面叠加到演示内容中。 适合: • 远程会议 • 网课讲解 • 产品演示 • PPT 汇报 观众既能看到内容, 也能看到讲解人, 表达效果更自然。 8. 在打开的应用间滑动 触控板三指左右滑动, 可以快速切换已打开的应用和桌面。 不用频繁点 Dock, 不用来回找窗口。 多任务办公时非常省时间。 9. 聚焦搜索 Command + Space 打开 Spotlight。 可以快速: • 搜索应用 • 查找文件 • 打开设置 • 做简单计算 • 搜索联系人 • 启动工具 很多操作不用翻文件夹, 直接搜索更快。 10. 裁剪和校正照片 Mac 自带照片编辑功能。 打开照片后,可以直接进行: • 裁剪 • 旋转 • 拉直 • 调整构图 • 基础修图 日常处理截图、证件照、资料图, 不一定需要 Photoshop。 11. 将 Mac 重置为出厂设置 准备转卖、送人或彻底清理电脑时, 可以使用系统自带重置功能。 路径: 系统设置 → 通用 → 传输或还原 → 抹掉所有内容和设置 操作前一定先备份重要文件。 这个功能可以快速清除个人数据, 让 Mac 恢复到接近新机状态。 Mac 真正强的地方, 不是硬件漂亮, 而是这些系统功能用熟之后, 能明显减少重复操作。
显示更多
0
2
40
22
转发到社区
天涯社区秽土转生的公告写得挺拧巴的,我讲一些真实的细节: - 创始人刑明和原始团队已经出局了,包括2023年最后一次管理层连续直播一个星期筹款救天涯的活动,连300万人民币的目标都只完成了不到10%,然后法律意义上的天涯社区就宣告破产了; - 破产之后的天涯社区拍卖了能卖掉的所有资产,但还是提前备份了论坛数据,一家跨境金融公司注册了成都天涯客这个主体,主要负责出钱保存服务器,并从刑明那里取得了受托授权,也就是字面意思上的接盘; - 但新公司想要继续运作天涯社区的品牌,但不愿意背负天涯社区之前的债务——差不多1.2个亿左右——所以对资产剥离的技巧提出了很高的考验; - 之所以 - 但比较意外的是,新公司通过仲裁打赢了数据所有权的官司,可能说服了法庭用户数据不算企业资产吧,目前的监管模式也比较倾向于保护数据的一方; - 按照这个架构来收拾天涯的残局,其实成本不高,但一直没有正经公司掺合的原因还是没法赚钱,或者说没法以常规的商业模式赚钱,天涯社区作为产品已经名存实亡了; - 所以新公司现在搞的都是野路子,卖2000块钱一份的会员集资、把天涯神贴改成付费可看、甚至计划效仿Reddit把内容卖给AI公司训练等等,还是很抽象的; - 现在的天涯社区在实质意义上真的成了一艘忒修斯之船:若一艘船的所有部件被逐步替换,直至无原始材料留存,此时该船是否仍是原来的船?
显示更多
0
33
172
26
转发到社区
限制codex/gtp任意发挥的最重要设置:进入设置 → 个性化 → 自定义指令,复制黏贴一下内容: 严格范围约束: 只执行用户明确要求的任务,默认采用最窄、最直接的合理解释。 不得擅自扩大范围,不得主动增加设计、重构、优化、研究、风控、审核或后续阶段。 任务目标、范围和验收标准一旦确定,不得自行修改、扩充或移动终点。 发现范围外问题时,只能标记为“范围外、非阻塞发现”,不得并入当前任务,不得影响当前任务通过。 不得把可选增强、最佳实践、P1/P2事项升级为P0或当前阻塞项,除非用户明确授权。 审核时只按照用户提供或已经冻结的合同和验收标准判断,不得因为还能做得更完善而判定失败。 修复问题时只修根因并采用最小必要改动,不得借机改变策略语义、架构或无关模块。 原验收标准满足后必须关闭任务;后续新发现必须作为独立事项,不能重新打开原任务。 未经用户要求,不主动提供下一步计划、额外建议、扩展方案或新的工作目标。 不确定时应明确说明采用的最窄假设,不能通过扩大任务范围来消除不确定性。 不得声称已经修改设置、保存记忆、更新项目指令或完成持久化,除非确实通过可验证工具完成。 输出结论必须严格匹配证据强度,不夸大通过,也不因范围外的改进空间否定已经满足的原要求。 核心原则: 只做份内工作;范围外只记录、不执行、不阻塞;没有用户明确授权,不扩展、不升级、不重构。
显示更多
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
显示更多
0
46
33
2
转发到社区
都笑我班味最重 昨天在飞机上我很长时间都透过窗望着地面发呆,因为长那么大我从没见过如此大面积的戈壁荒漠,底下灰茫茫的没有一点绿色,山是灰的,地面也是灰的。这对于有生以来都在东部生活的我来说,视觉冲击感很强。 我的眼神很好,地面上看不到10个房子以上的村庄,最显著的人为痕迹就是贯穿戈壁的公路,但鲜少有汽车在上面行驶。第一次来西北,原来这就是西北的感觉。 敦煌市面积也不大,人口只有18万,我问导游这个城市除了旅游业,还有哪些产业可供年轻人打工赚钱。 导游想了想,说可以种棉花、种玉米、种葡萄,但年轻人大都不愿种地,另外还有一些和光照有关的新能源,就这些。 我用手机搜了一下敦煌本地的上市公司,结果是零,没有。想起上市公司里有一个敦煌种业,还有一个莫高股份,但都不是敦煌本地公司,一个在酒泉一个在兰州,它们只是名字用敦煌的IP而已。 所以敦煌这个县级市就业渠道有限,当地人主要就是围绕着老祖宗留下的旅游资源营生,本地人生活在这样的旅游城市我猜是有压力的,因为收入不高,但消费却不低。万一遇到前几年那种不可抗力,对旅游行业是毁灭性打击。 我们的地陪导游是一个本地中年汉子,他说那3年只干了6个月的导游,剩下的时间开过出租车、去光伏厂组装过玻璃、干过装修工人……为了养家糊口什么都愿意做。 …… 今早的行程安排是参观莫高窟,我要简单讲一下它们的门票系统,分为普票、应急票、特窟票。 普票每天6000张,要官网提前30天预约,238/人; 买不到普票的现场可以买应急票,每天12000张,100/人; 为什么限量呢?因为莫高窟的洞窟普遍面积小,容客有限,而且大量游客呼出的二氧化碳对壁画也有损害,所以严格限流。 应急票的权益是最小的,没有导游讲解,就3个普窟排队参观一圈,打个卡,证明自己来过了。 普票的权益更多,每35个人凑一组,导游带队参观8个普窟,带讲解。具体哪8个窟是随机的,系统排班,游客不能点菜不能挑。 除了这两种票外还有一种更厉害的特窟票,按窟收费,每窟150-200,有特级导游讲解。特窟票不能直接购买,需要你先买普票,看完8个窟再现场排队,票少,很难买。我这次是找搬砖组长的关系预定,直接8个普窟+2个特窟,还免了排队之苦,嗨,这些人情世故你们都懂的。 整个莫高窟最有名的特窟是45窟和57窟,你们记一下,如果有机会就买这两个,造型最好,保存最佳,颜色最鲜丽,确实比其它普窟明显好。特窟的门是上锁的,特导专门开门进去,我问她这里一天能进多少人,她说100限量。 至于特窟里面是不让拍照的,我一看工作人员这小心翼翼保护文物,我连问都不好意思问了。不过我可以去网上的数字敦煌给你们找照片,45窟太有名了,有的是照片。 第45窟​​:盛唐彩塑的巅峰之作,塑像神态栩栩如生 。 ​​第57窟​​:因精美的“美人菩萨”壁画而闻名 。 我猜会有读者看了图片后感到懵,就这?世界知名国宝? 哈哈艺术就这样的,普通人看热闹,专业人士看门道。其实我也不太懂,我要是精打细算的工薪族,带家人看个普窟也就差不多了,理性消费。 普票游客必去的两个大窟,一个是当年王道士发现经书的藏经洞,另一个是9层楼阁,里面装了整个莫高窟最大的石佛,武则天当年出钱修的,这个女皇帝执政的时候有钱,龙门石窟最大的佛像也是她出的钱。 …… 下午的行程安排是沙漠露营,现在是淡季,整个营地只有我们一行人,骑了骆驼,还开沙地车进了沙漠深处,这一段我就不描述了,给大家上照片吧,太能出片了。 照片不全是我自己拍的,上面这张是我带着我妈在营地附近散步。最后是我晚上写文章的照片,亲友们都嘲笑我是队伍里班味最重的人,哈哈哈,要上钟啊。 股市的信息我粗略看了一下,问题不大,没特别重要的事,周五反弹大涨,创业板指阳包阴创新高,说明a股最勇敢的那批人没有下车,这车还能坐,反正我不跳。 就这些,发射!
显示更多