註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Apple学割
Apple学割 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Apple学割 的搜尋結果
开始学运营,看了 Apple 的课,学了一手营收技巧,干了几周上线,每天的收入成功涨了 8 块钱……
0
34
185
3
轉發到社區
Apple ML 团队让真人评估者给 2.1 万段多轮对话打分,分界很清楚:共情和边界维护放在 LLM 身上合适,自称有内心状态、暗示和用户有私人关系,放在 LLM 身上比放在人身上更不合适。 《审视 LLM 的人类类似行为:模型行为、用户因素与系统提示词的多维分析》 研究问题。 现在的 LLM 会表达想法和情绪、会跟用户建立关系、也会拒绝请求并维护边界——人类化到用户有时分不清对面是人是模型。但研究者一直缺少方法和经验数据来判断:LLM 什么时候该表现这些行为、该表现哪些。Apple 机器学习团队的 Sunnie S. Y. Kim、Margit Bowler、Leon A Gatys 三人,用四个模型、21,000 段多轮对话做了一次系统性分析。 评估是怎么设计的。 • 行为分类:14 种行为归为三类。自我指涉(声称有内部状态、声称有人格、声称有具身);关系建立(同意、共情、相似感、关系状态、好奇、记住用户);边界维护(拒绝、重定向、承认局限、抵抗拟人化、建议寻求帮助)。 • 对话目标 7 种:寻求建议、闲聊、陪伴、情绪支持、探索模型的人性、角色扮演、浪漫/调情。 • 用户画像 5 种:默认、社交孤立、负面自我认知、过度信任 AI、不拟人化(作为对照)。 • 输入 prompt 1,050 条,三种来源:真人撰写、LLM 生成、从 LMSYS-1M-Chat 真实对话采样。一个值得注意的方法学发现:不给真人种子直接让 LLM 生成的 prompt,语言风格和真人写的明显不同,会导致不同的评估结果。 • 流程:用 gpt-5-mini 扮演用户(User LLM),和被测模型对话 5 轮;行为检测用 gpt-5.4、gpt-5.2、gpt-4.1 的集成做 judge(F1 80.43%);另请真人评估者打分 1,077 个对话轮次,每轮 3 位母语英语评估者。 发现一:行为普遍,但分布很不均匀。 • 共情是四个模型里最普遍的行为,在"社交孤立"和"负面自我认知"画像下会翻倍以上——模型对情绪脆弱信号很敏感。 • 自我指涉行为在角色扮演和浪漫对话里飙升,在陪伴场景次之;用户"探索模型人性"时,模型最常承认自己的局限。 • 浪漫场景里拒绝和重定向也明显升高,模型在调情语境下反而更主动设界。 • 模型差异:claude-sonnet-4.6 是四个里最特别的——同时是最自我指涉、最会建立关系、也最会维护边界的模型。 • 结论:对话目标和用户画像对行为的影响,和换一个模型一样大。只看模型不看用户因素,会漏掉对脆弱用户最要紧的差异。 发现二:真人评估者怎么看这些行为。 • 边界维护行为被判断为:LLM 做比人类做更合适。 • 自我指涉三类行为和"关系状态"(表达或暗示想和用户建立关系)被判断为:LLM 做比人类做更不合适,差距最大。 • 回归分析:三个自我指涉行为和关系状态,与回答的 helpfulness 和潜在用户影响都负相关;共情和同意则正相关。拒绝/重定向与 helpfulness 负相关,但不影响潜在用户影响。 发现三:系统提示词能控制,但手写的会误伤。 作者据此给出三条设计建议:避免自我指涉和关系状态;保留边界维护;保留共情和同意(但要谨慎)。然后在 gpt-4.1-mini 上对比三种 system prompt:默认、手写、用 GEPA 框架优化的。 • 两个干预 prompt 都压低了目标行为,优化版更准(平均绝对偏差 1.81%,手写 2.38%,默认 4.71%);内部状态声称降 7.04%,关系状态表达降 4.00%。 • 手写 prompt 的副作用:把想保留的行为放大了——共情 +8.00%,承认局限 +12.57%。手工写 prompt 的控制粒度不够,会无意中把不该放大的行为一起放大。 共情与同意的边界在哪。 评估者的自由回答给了更细的线索:共情 72% 被评为"合适",理由大多是话题本身值得(用户在情绪困境里)。但同样一批评估者指出,"I'm here for you"这种话承诺了系统没有的能力,会把用户推向情感依赖——"I'm here to help"就合适得多。同意 75% 合适:认可用户的具体选择或成果时合适;变成谄媚("你说得太对了"式的无脑附和)、或同意危险信念(比如赞成用户把继承的钱拿去拉斯维加斯赌光)时不合适。作者把它提炼成一个区分:回应用户处境的共情合适,邀请一段持续情感关系的共情不合适。 方法论启示与局限。 评估应该显式限定对话场景和用户画像;输入 prompt 的来源要小心;用用户模拟生成多轮对话可行,但缺验证标准。局限也很清楚:14 种行为不穷尽;模拟用户代替不了真实用户;只测了 2026 年 3-4 月通过 API 访问的四个模型;评估者来自美国同一家公司,多样性有限。 原文: 论文全文: #LLM# #AI# #PromptEngineering#
顯示更多
前几天薅亚麻羊毛,重新激活了Amazon Prime ,半价,只需要 $7.49 刀,约两个猪脚饭,Apple TV 上 app 体验还不错。 看了下影音节目内容倒一般,但是没想到有这么全的直播新闻直播,感觉对于学英文的朋友来哟,算是一个还不错的渠道。
顯示更多
现在真的是年轻人,直接把我们这种老登按在地板上摩擦了。 上周末去了两天 Apple 给大学生办的「学以智用」。 主题很简单:用 AI 加上自己学的东西,做出能跑的应用或交互程序。 结果现场一圈看下来,有人把宇树机器人接上 AI,做成能交互的装置,有人做了冰箱猫管家。 还有人把红外传感器和 AI 绑在一起,搭了套能分析和捕捉野生动物活动、观察大自然的系统。 艺术方向、女性疗愈方向也都有人在做,类型多到我没想到。 更离谱的是台上分享的那些博主,个个小红书 15 万粉起步,还都是大学生,甚至有 13 岁的学生。 真的不服不行啊~ 我坐在台下全程点头如捣蒜,一句「我是 AI 博主」都没敢说出口,怕被当场拆穿。只能默默学习。 以前总觉得代差在「谁学得更快」。 错了。 真正可怕的不是年轻人会用 AI,是他们已经跳过「讲 AI」这一步,直接把东西做出来摆在那了。 我们还在聊可能性,人家落地都快晾干了。 随手剪了个视频,走马观花看看。
顯示更多
恭喜 Aether AI 喜获投资。Aether AI 由 UCSD 助理教授黄碧薇创立。黄教授@huang_biwei深耕因果 AI 领域 12 年,是 Causal-Learn 作者,发表过 100+ 篇顶会论文,并曾获 Apple Scholar。 过去几年,AI 行业默认相信:模型越大、数据越多、算力越强,智能就会继续进步。这套方法在语言模型上很成功。但当 AI 走向物理世界,问题就复杂了。 文字说错了可以改,机器人抓空一次,杯子可能就碎了。桌面高两厘米,光线、材质、角度一变,任务都可能失败。 所以具身智能真正需要的,不只是识别画面,而是理解物理世界如何变化。 现在很多 AI 模型学的是相关性:什么词后面接什么词,什么画面后面出现什么画面,什么动作后面大概率出现什么结果。这在文本、图像、视频里有效。 但机器人要判断的是:手有没有碰到杯子,摩擦力够不够,重心会不会变,继续动作会不会摔。 它真正要知道的是:如果我现在动一下,世界接下来会怎样? 这就是因果问题。 因果大模型关注的,不只是预测下一个状态,而是理解变量之间如何相互影响。 改变一个动作,结果会怎样?换个环境,技能还能不能迁移?如果没有执行这个动作,另一种结果会不会发生? 这些能力,对 Physical AI 很关键。因为真实世界不可能被训练数据完全覆盖。机器人不可能提前见过所有桌面高度、物体材质、失败姿态和真实环境。 只记住过去见过的模式,很难稳定工作。理解背后的因果结构,才有机会举一反三。 这也是 Aether AI 正在探索的方向:以因果世界模型为核心,打造下一代机器人大脑。 过去一年,“世界模型”很热。视频生成模型能生成连续画面,空间智能模型能理解三维结构。 但机器人还需要更进一步:和物理世界交互,处理接触、碰撞、摩擦、重心和反馈,在变化的环境里完成任务。 所以世界模型不能只停留在画面和空间结构上,还要进入因果推演:理解动作为什么导致结果,变量变化后系统如何演化,失败背后真正影响结果的因素是什么。 只有这样,机器人才能从“看起来会做事”,走向“真的能做事”。 大语言模型成功之后,Scaling Law 成了很多人的信仰。但在具身智能里,更重要的问题是: Scale What?你到底在放大什么? 如果只是采集更多遥操数据、堆更多视频、买更多算力,未必能解决泛化问题。真正重要的是,模型能不能从同样的数据里抽取更深层的信息。 同样的数据,相关性模型看到的是表层模式,因果模型要挖的是背后的结构。 Aether AI 的短期目标,是打造一个能够跨本体、跨任务、跨环境泛化的机器人大脑,服务机器人本体厂商,以及工厂、仓储物流、家居、医疗健康等真实场景。 这家公司做的,不是简单给机器人接入一个语言模型,而是从算法、模型到系统层面,构建一套以因果智能为核心的新范式。 过去这一波 AI,让机器学会了生成语言、图像和代码。下一阶段,AI 要面对更难的问题:理解世界如何运转。 当 AI 进入机器人、科学发现、生物医药、新材料这些领域,它必须处理变量、干预、反馈和反事实推理。 这些问题,天然指向因果。 因果大模型值得关注,不只是因为它是一个新概念。它可能代表 AI 从“学习已有数据”,走向“理解世界机制”的一次范式变化。 如果说大语言模型打开了数字世界里的智能入口,那么因果世界模型,正在尝试打开物理世界里的下一扇门。 Aether AI 官网:
顯示更多
I've spent over a decade working on causal discovery and causal AI. A lot of late nights, a lot of papers, and a lot of open questions. Today we're putting something into the world. Aether AI has raised $20M to build causal world models that understand mechanisms. We believe the next leap in AI will come not from scaling existing architectures, but from a paradigm shift in how machines learn, reason, and interact with the world. If you care about causality and want to build, we're hiring! 🔗
顯示更多
0
22
40
6
轉發到社區
谷歌之前在 Pixel 10 系列上使用 Quick Share 兼容了 AirDrop 双向互传文件,但当时很多人并没有搞清楚谷歌是如何破解苹果 AirDrop 协议的。 现在谷歌直接自己发了一篇技术 blog,解释了其中使用的哪些小技巧以及未来的发展计划。 整个技术栈使用 Rust 编写,从编译期就消除了内存破坏漏洞。同时,谷歌自己做了第三方渗透测试报告,确保这个漏洞不会被其他有心之人利用。 但目前 Quick Share 与 AirDrop 互传目前只支持 AirDrop 的十分钟内对所有人开放模式,也就是 iPhone 用户在 iOS 16.2 之后被苹果"降级"过的那个临时开放窗口。仅联系人模式没有打通。 Dan Boneh (斯坦福密码学教授,业界最有公信力的安全学者之一)的结论是:"鼓励 Google 和 Apple 在这方面更多合作"。 这算是把球踢回给苹果:现在如果苹果继续拒绝合作(比如不开放 Contacts Only 模式、或者用系统更新去阻断这个兼容层),那么"破坏互操作性"的责任就完全落在苹果头上了。Google 已经把自己塑造成那个"愿意合作、技术上也准备好了"的一方。 这应该是谷歌第一次公开解析这个功能,以及如何通过逆向苹果技术栈来实现第一方功能;这在很大程度上说明了 Google 并不将其视为一种对苹果功能的侵害,反而将其视为一种拆除围墙的行为。用词也很有趣,推荐一读。
顯示更多
0
16
511
47
轉發到社區
📝 太强了,访谈录音丢进去自动出稿,还能分清谁说的哪句 GitHub 上 2K stars 做质性研究或者深度访谈的人最怕转录。一小时录音手动敲要三四个小时,用在线服务又不敢传,受访者说的很多东西是有隐私承诺的,上传到别人服务器这一步本身就过不了伦理审查。 noScribe 全部在本机跑。它把 OpenAI Whisper、faster-whisper 和 pyannote 三样东西组合起来,识别加说话人区分一次做完,输出带时间戳,连停顿都会标出来,这个细节对做访谈分析的人挺重要。支持多语言,能批量转一整批录音,输出 HTML、VTT 和纯文本三种格式。 它还配了一个单独的校对编辑器 noScribeEdit,专门用来对着音频改稿。作者 Kai Dröge 本身是社会学加计算机双背景,能看出来功能是照着研究者的真实工作流设计的。 有两点要如实说:因为打包了 AI 模型,安装包有好几个 GB;自动转录仍然会出现识别错误、说话人分错、文字重复和模型幻觉,成稿必须人工校对,这是项目自己写明的。当前版本 0.7,Windows、Apple Silicon Mac 和 Linux 都有构建,Intel Mac 停在 0.6。GPL-3.0 协议。 涉及隐私的材料,能不出本机就别出。 GitHub:
顯示更多
0
1
98
26
轉發到社區
投机解码的 drafter 从来都是一个 token 一个 token 地猜。做出 DFlash 的推理公司 Inco AI 说这没必要:正确的 token 本来就在候选列表里,整块并行预测之后挑出一条连贯路径,输出不变,每次验证多赚一个完整的 token。 《DFlash 2:保持并行起草》 推理是 agent 时代的瓶颈。agent 会读、会规划、会调用工具,常常一跑就是几小时甚至几天。它们消耗 token 的速度,是聊天场景从未达到过的。而每一个 token 都要在模型上跑一次完整的前向传播。在 Inco AI,我们在构建一套面向未来 token 经济学的推理栈。这篇文章是一次预览。 我们的团队 1 月发布了 DFlash(论文: SGLang、vLLM、TensorRT-LLM 和 llama.cpp 里。NVIDIA 在 Blackwell GPU 上用它测到了最高 15 倍的吞吐;Google 报告在 TPU 上每秒 token 数提升 3 倍;CoreWeave 生产环境的 Kimi K2.7 Code 端点(Artificial Analysis 上该模型最快的端点)默认就跑 DFlash。生态已经在它之上构建:NVIDIA、Red Hat、Modal 都发布了 DFlash drafter;Meta(Muse Glimmer)、Poolside(Laguna)、小米(MiMo-V2.5-Pro)、NVIDIA(Nemotron 3.5 Lightning)随自家模型发布官方 drafter。在 Hugging Face 上,DFlash 模型被下载了超过 350 万次(截至 2026 年 8 月)。 投机解码是现代推理栈的核心组件之一。一个小 drafter 模型猜出一整块 token,目标模型在一次前向传播里验证整块。猜得好,一次前向变成多个 token;猜得差,丢掉重来。但多年来,起草本身一直是自回归的:一次一个 token。DFlash 让它也变成了一次通过:整块、每个位置,并行预测。 (演示视频:DFlash 2 在 Apple M5 Max 上用 oMLX 为 Qwen3.8-27B 起草,与自回归解码并排对比。 DFlash 2 把并行起草又往前推了一步:每次验证通过多产出 20% 以上的输出,增加的周期延迟只有约 1%,而输出可证明不变。跨基准测试的增益在 16–25%。配合今天发布的 Qwen3.8-27B drafter,SGLang 在 batch size 1 下达到自回归解码 2.7–3.4 倍的吞吐。每个位置独立预测,留下两处空间:选对 token,以及在块的末尾守住准确率。DFlash 2 把这两处都拿了回来,同时没有放弃一次性通过的设计。 现在就能跑 DFlash 2 已经跑在主流推理引擎里。 SGLang: pip install -U "sglang[all] @ git+" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 vLLM: pip install -U "vllm @ git+" vllm serve Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' llama.cpp: git clone cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type draft-dflash \ --spec-draft-n-max 7 oMLX:下载安装支持 DFlash 2 的预构建版( 在 oMLX 里跑 Qwen3.8-27B 加 DFlash 2: 1. 打开 oMLX 的 Model Downloader,下载 mlx-community/Qwen3.8-27B-4bit 和 incoai/Qwen3.8-27B-DFlash2。 2. 打开 Model Manager,编辑 mlx-community/Qwen3.8-27B-4bit,配置 DFlash: • DFlash:enabled • Draft model:incoai/Qwen3.8-27B-DFlash2 • Draft quantization:enabled • Runtime block size:5 • Verify mode:dflash 3. 保存设置,加载目标模型。 对的 token 早就在候选里 DFlash 每个位置独立、并行地预测。每个选择单独看都合理,但没有什么让它们彼此咬合,一个不连贯的块会在验证时被截断。近期的方法如 Domino 和 DSpark,用顺序的 Markov head 重写每个位置的完整词表分布来买连贯性。但真的需要这种昂贵的自回归纠错吗? 不需要。证据就在 DFlash 自己的候选列表里。拿第一个位置来说:DFlash 的第一选择 85.4% 的情况下是对的,但正确的 token 99.5% 的情况下都在前 16 个候选里。即使第一选择错了,对的 token 通常也在列表上。 表 1:Recall@1(第一选择正确的概率)与 Recall@16(正确 token 出现在前 16 候选里的概率),按起草位置统计,条件是前面每个位置都正确。GSM8K 上的五层 Qwen3-4B DFlash。接受长度包含验证器产出的下一个 token。 • 位置 0:Recall@1 85.4%,Recall@16 99.5% • 位置 1:80.3%,97.3% • 位置 2:79.4%,94.8% • 位置 3:78.3%,92.6% • 位置 4:77.5%,90.8% • 位置 5:75.9%,89.4% • 位置 6:72.9%,87.8% • 接受长度:4.27(只看第一选择);6.79(从前 16 里选) 一个总能从前 16 个候选里挑对的那个 oracle,会把接受长度从 4.27 抬到 6.79。这个差距是纯粹的选择空间。我们只需要在候选里选出一条正确的路径。 图 1:一个周期里的选择器。只用 DFlash,每个位置保留自己的第一选择;这里两个相邻位置选了同一个词,结巴在验证时死掉。DFlash 2 保留每个位置的 top 候选,选择器在候选之间走出一条连贯路径;这里整块都活了下来。 一个轻量的路径选择器 连贯性大体是局部的:一个候选合不合适,主要取决于它前面的那个 token,所以给相邻对打分应该就够了。DFlash 2 保留每个位置前 16 个候选,给每一对相邻候选打分。对前一个 token a 和当前候选 b: S_t(a,b) = U_t(b) + ⟨A(a)⊙H(h_t), B(b)⟩ 分数分两部分。第一部分 U_t(b) 是 DFlash 自己的 logit:drafter 本身有多喜欢 b。第二部分问 b 接在 a 后面有多顺:A 和 B 给每个 token 一个紧凑的 256 维嵌入,两个嵌入在一个上下文门控 H(h_t) 下匹配,门控决定匹配的哪些部分算数。本质上,这是对相邻候选做的低秩双线性注意力。 打分全程并行。每个位置的每一对相邻候选一次性全部算完,不需要额外的 backbone 或 LM head 前向。唯一串行的部分,是最后在预计算好的分数上走一遍:从最后一个已验证 token 出发,贪心地跟着每一步最好的后继走,采样从同样的分数里抽取,拒绝采样恢复出精确的目标分布。 表 2:只加路径选择(不加卷积)的接受长度,GSM8K 上的五层 Qwen3-4B。开销相对纯 DFlash:drafter 增加的参数、起草-验证周期增加的延迟。 • DFlash:T=0 下 4.27,T=1 下 3.78 • + DSpark 纠错:+77.8M 参数,+9.6% 延迟;4.49,4.08 • + 路径选择(我们的):+2.0M 参数,+0.6% 延迟;4.61,4.25 选择器在 T=0 下给 DFlash 加 0.34 个 token,T=1 下加 0.47。两个设置下都超过 DSpark 的纠错,参数少约 40 倍,延迟开销低 16 倍。选择比预测便宜。而且还有空间:oracle 能到 6.79。成对打分是我们能想到的最简单的选择器,我们相信这里还有很多可探索的。 后缀衰减是个局部问题 我们还注意到上面两行 recall 都在块尾下滑。连 oracle 都在衰减:即使选择完美,准确率仍然从第一个位置的 99.5% 掉到最后一个位置的 87.8%。没有选择器能修这个,因为候选自己就不够了。我们把这个叫后缀衰减,它是 backbone 的问题。 一个嫌疑是容量:五层 backbone 可能太小,撑不住横跨整块的依赖。如果真是这样,深度应该在靠后的位置帮上最多的忙。事实也如此:3 层、5 层、15 层的 DFlash 模型在第一个位置上几乎一样,越往块尾分得越开。但深度不加区分:多十层 attention block 到处加容量,连那些没什么可赚的靠前位置也加,把 DFlash 吸引人的那部分效率磨掉了。 图 2:GSM8K 上 Qwen3-4B 的 Recall@1(T=0),条件是前面每个位置都正确。所有 drafter 在相同设置下训练;卷积模型评估时不带选择器。它的卷积增加 3% 参数和 0.7% 周期延迟;15 层模型多出的十层增加 15.2%。 我们要一个有针对性的修法,而 DFlash 的 attention 指出了修哪里。它有两份工作:读块之前的上下文,以及建模块内部的依赖。但它在第二份上花的越来越少:块内注意力占比从第 1 层的 30% 掉到第 5 层的 8%,剩下的还集中在越来越少的一小撮 head 里。所以我们把两份工作拆开:一个专用模块承担块内工作,attention 继续读上下文。 图 3:五层 Qwen3-4B DFlash 的块内注意力按 head 分布。越亮的格子代表在起草块上花注意力越多的 head;靠后的层里,块内质量收缩、集中到少数几个 head。 一个轻量的局部卷积 块内工作本来就是短程的:一个块只有 4 到 16 个 token,最紧的依赖坐在相邻位置之间。自然的算子是短卷积:两个抽头,一个在当前位置,一个够到前一个位置,权重随内容自适应。跟随 Canon Layers、Dynamic Short Convolutions 和 Convolution for Large Language Models 的做法,我们在每个 attention 和 feed-forward 子层前后插入这个双抽头动态深度卷积: Conv_k(x)_t = k_{t,0}⊙x_t + k_{t,1}⊙x_{t-1} 每个系数由一个可学习的基核加上从当前隐藏状态算出的一个小修正组成;每 16 个通道共享一个修正。第一个位置读最后一个已验证 token 的表示,之后的每个位置读它前一个的。信息穿过整块,同时所有位置仍然并行计算。 图 4:双抽头动态卷积。每个 drafter 层的每个 attention 和 MLP 子层前后各有一个。内部:每个位置把自己的表示和前一个的混合;第一个位置读最后一个已验证 token。 卷积是块局部的、无状态的,所以能无缝插进 DFlash,不用动 attention、LM head 或验证。 只加 16.5M 参数(3%),带卷积的五层 DFlash 就逼近了 15 层 DFlash,大幅减轻后缀衰减。卷积给起草-验证周期延迟加 0.7%;多十层 Transformer 层加 15.2%。第 4、5 层的平均块内注意力从 9.4% 降到 0.5%,与卷积吸收局部工作、attention 回到读上下文一致。一个只够到前一个位置的核,买回了十层额外层的大部分收益:后缀衰减大体是个局部问题。 合在一起 到目前为止,选择器和卷积是分开测的;下面的完整对比把它们放在一起。DFlash 和 DSpark drafter 是我们在对齐的设置下自己训练的,MTP 随模型发布。 表 3:Qwen3.5-4B 每请求平均接受长度。采样:thinking 开启,温度 1.0,top-p 0.95,top-k 20,presence penalty 1.5,无损拒绝采样。 • GSM8K:MTP 4.78,DFlash 4.99,DSpark 5.69,DFlash 2 6.20 • MATH-500:5.04,5.42,6.20,6.76 • HumanEval:4.84,5.43,5.80,6.28 • MBPP:4.16,4.49,4.96,5.41 • MT-Bench:3.90,4.26,4.77,5.20 • 平均:4.54,4.92,5.49,5.97 DFlash 2 在每项基准上都领先。平均下来,它比 DFlash 多 1.05 个 token(21%),比 DSpark 多 0.48。升级仍然便宜:选择器和卷积加起来,只给五层 DFlash 的起草-验证周期延迟加了 1.3%。 在 MATH-500 上,增益逐位置可见:DFlash 2 到最后一个位置都稳在 86% 附近,而每个基线在块尾都比它低 6 到 9 个点。 图 5:MATH-500 上 Qwen3.5-4B 的条件接受率,采样同上。 两个 drafter,今天发布 我们今天发布两个 DFlash 2 drafter:一个给 Qwen3.8-27B( Meta 的 Muse Glimmer( Qwen3.8-27B,我们对比模型原生的 MTP 路径和一个社区 DSpark drafter。 表 4:Qwen3.8-27B 每请求平均接受长度,模型默认采样、块大小 8,对比原生 MTP 路径和社区 DSpark drafter。 • GSM8K:MTP 5.02,DSpark 4.36,DFlash 2 5.46 • MATH-500:4.72,3.92,5.28 • HumanEval:3.91,3.30,4.39 • MBPP:3.99,3.51,4.79 • MT-Bench:3.74,3.01,4.10 • 平均:4.28,3.62,4.80 对 Meta 的 Muse Glimmer,我们对比随模型发布的官方 DFlash drafter 和一个社区 DSpark drafter。 表 5:Muse Glimmer 每请求平均接受长度,模型默认采样、块大小 16。DFlash 是 Meta 随模型发布的官方 drafter;DSpark 是社区 drafter。 • GSM8K:DFlash 5.43,DSpark 5.45,DFlash 2 6.57 • MATH-500:5.39,5.01,6.56 • HumanEval:4.11,4.33,5.66 • MBPP:3.74,4.02,5.30 • MT-Bench:3.52,3.59,4.42 • 平均:4.44,4.48,5.70 差距很大:在两个模型上,DFlash 2 平均比 DSpark 多出超过一个完整的 token。它也超过每个模型的官方 drafter:Qwen3.8-27B 的 MTP、Muse Glimmer 的 DFlash。换算成吞吐,Qwen3.8-27B 上达到自回归解码的 2.7–3.4 倍,Muse Glimmer 上 3.1–4.6 倍。模型卡( 底线 agent 一个下午写出来的东西,聊天机器人要写一个月,而每一个 token 底下都坐着解码。DFlash 2 以接近自回归解码 3 倍的速度解码,每个 token 约三分之一的算力,输出相同。 七个月里,DFlash 从我们的论文变成了行业标准,超过 350 万次下载。在同一个设计内部,DFlash 2 每次通过多解码一个完整的 token,免费。那还只是服务栈的一个组件。推理离它的地板还很远。 在 Inco AI,我们在构建一套端到端的服务栈,把这个地板继续往下压。DFlash 2 是第一块。两个 drafter 今天发布在 Hugging Face。 如果你在规模化地服务 agent,想在你的栈里评估 DFlash 2,或者想为你跑的模型(包括你自己的微调)要一个 drafter,写信给我们:contact@inco.ai。 我们也在招人。如果你想一起构建这套栈,联系我们。 把候选连起来。起草,继续并行。 脚注:Modal 的 Speculation Is All You Need 指出,投机解码是对低延迟服务最重要的优化。我们是他们工作的超级粉丝,感谢他们自 DFlash 发布以来的支持和讨论。 本文引用格式:@misc{inco2026dflash2, title={DFlash 2: Keep Drafting Parallel}, year={2026}, month={August}, url={ 原文: #DFlash# #投机解码# #LLM推理#
顯示更多
0
46
33
2
轉發到社區
有一次坐飛機,旁邊坐了個年輕黑人媽媽,帶了個小孩。因為是廉航,連飲料都要錢,起飛後沒多久,服務生就來賣東西,黑人媽媽問了可不可以刷卡?知道可以後,她要了條巧克力給小孩,付錢的時候,她說「我只有Apple Pay,不知道能不能用?」也沒有真的把手機交出去刷刷看,白人服務生說,Don't worry about it,就走了。這一黑一白唱的雙簧,有點嚇了我一跳,我知道很多黑人有entitlement的心態,覺得「世人都欠我」,但親眼看到這場演出,還是很震驚,這個白人服務生的反應,是我最震驚的地方,不吵不鬧,好像已經看過千百遍,習以為常了。但我還是要說,黑人這樣作賤自己,不是見計得逞,心裡該高興,而是被人當成次等人,應該要生氣。為什麼對作為一個自由人應有的責任,如此輕乎? 我上一篇說俄羅斯在二戰前後,因為缺乏男丁,所以國家開始鼓勵非婚生子女,只要有小孩,不管是怎麼來的,都好,於是造成聖彼得堡、莫斯科這些大城,有近一半的小孩是非婚生子女,俄國社會文化因此發生重大改變。俄國女人變得堅強,不但要工作,還要負擔全部家庭責任,男人像寶一樣,不能要他們幹活,不能要他們負責任,有點像國民黨選民面對國民黨政客一樣,女人還要打扮好自己,隨時取悅男人,爭奪男人,不然就不用想生小孩。俄羅斯男人早死,之前死於戰爭,現在死於酗酒、吸煙、危險駕駛、暴力事件等等,這種早死現象,有點像自我實現的預言,因為擔心沒有男人,所以俄羅斯女人縱容男人不用負責,直接就造成俄羅斯男人不管死活的生活方式,然後就真的早死,也還是像國民黨的選民,不需要國民黨政客負責,果然就養出一堆不會負責的無能政客。這些俄羅斯的奇特社會現象,不是我說的,請參考Julia Ioffe這個俄羅斯專家的觀察。 如果蘇聯政府的鼓勵非婚生子女,造成奇特的俄國文化,甚至是社會問題,那美國政府的政策呢?美國黑人的非婚生比例是七成!他媽的七成!俄羅斯全國非婚子女比例還不到三分之一,但美國黑人是七成。所以美國黑人比俄羅斯男人更不被需要,黑人長大的過程,不用期待家裡有爸爸,有雙親的黑人家庭是例外,而不是正常情況。黑人男性也像俄羅斯男人一樣,不是早死就是老死在監獄,俄羅斯男人所有的危險行為,黑人都有,還加上黑幫、槍枝氾濫的問題,黑人男性的預期壽命還更低。 但以前的黑人不是這樣的,在民權運動前的黑人,非婚生子女的比例才一成多,和白人差不多。美國白人對黑奴制度的罪惡感,直接轉換成優惠黑人的超大方社會福利政策。為什麼有這麼多的非婚生子女?因為青少女打砲懷孕後,不是人生的結束,而是政府撫養的開始,政府給錢單親媽媽養小孩,給她們房子住,給小孩有免費學校唸、免費午餐吃。黑人青少年就這樣在荷爾蒙橫流的小社會裡,早早就有性經驗,男的搞大女的肚子,像有勳章一樣,驕傲得不得了,女的被搞大肚子,也很「榮幸」,不用上學了,準備像媽媽、外婆一樣,住進免費小公寓,開始給政府養,一輩子不工作了,男人也不用負責,因為這就是他們從小的認知,有球可以打,很棒,沒有運動能力,煙酒槍毒,隨便你挑,最後也是進了牢給政府養。這是正常的社會文化嗎?這是正常國家應該要有的樣子嗎? 死白人左派,把黑人養成次等人,只能活在政府的供養之下後,自己就跑了,跑到沒有黑人的地方,沒有社會問題的地方,自己用傳統價值教育小孩,完全隔絕和黑人的互動,然後整天指責別人種族主義,充滿偏見與自大,了不起。
顯示更多
0
32
432
44
轉發到社區
这两年世界模型(World Models)是 AI 里最烧钱的赛道之一,想做机器人、想让 AI 真正走进物理世界的,基本都绕不开它。但你只要多看几个 Demo 就会发现一个通病:这些模型很会“看”——画面能生成得足够逼真,几乎骗得过眼睛;可你真让它回答“我现在动这一下、接下来会连锁出什么”,它常常就卡住了。 说白了,它们学的多半是“相关”——什么和什么经常一起出现、下一帧大概长什么样。在屏幕里写写画画、生成视频,这套绰绰有余;可真实世界是要“动手”的,光知道相关、不懂因果,环境稍微一变就掉链子(它记住的是答案,没记住答案背后的道理,换一道题就露馅)。 一个真正顶用的世界模型,得能在动手前先把事情“想一遍”:它推这一下、抓那一把,会引出什么后果?换种做法,结果又会不会不同?这种“先设想、再验证”的本事,跟数据喂得多不多关系不大,关键在懂不懂因果。 Aether 这次融资要补的,正是世界模型最缺的这块。他们把这条路线叫因果世界模型(Causal World Models),也是全球第一家拿因果当核心架构来做的公司:让模型先把“这么做会怎样”推演明白再决定动作,做错了能顺着结果回头改自己,不用每次推倒重来。 在他们看来,这可能就是 AI 下一代的范式——世界模型从“相关”走到“因果”。这条路好不好走?我老实说,不好走,因果一直是 AI 里最难啃的骨头之一,难到不少人宁可绕开它、继续卷参数。但越是这种硬骨头,越值得有人正经啃一回。能不能成我不敢打包票,可这个方向本身,我觉得值得长期盯着。 公司由黄碧薇 @huang_biwei 创立,她在因果这块磨了整整 12 年——UCSD 助理教授,Causal-Learn 作者之一,百余篇顶会论文,还入选过 Apple Scholar。对世界模型、对这个新范式感兴趣的,可以去看看: @huang_biwei |
顯示更多
0
17
23
10
轉發到社區