註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DFlash
DFlash 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DFlash 的搜尋結果
终于 speculative decoding(先支持 dflash) 在 llama cpp 合并了
有没有可能未来的趋势是 dense + dflash,而不是 sparse moe
0
10
19
0
轉發到社區
想买Mac运行大模型? 这是劝退贴 其实估算方法很简单, 现在买 MacStudio 哪怕运行 Qwen3.6-27B 4bit 量化版本, 然后开 DFlash 使用Qwen的内置投机解码, 也就飙到 65token/s. 而现在普遍大模型都能跑到 40 token/s. 如果专门买 MacStudio M3 Ultra 96G 运行大模型, 如果把设备售价 (32999) 换算成使用API, 以 GLM-5.2 为例, 每百万token 28块, 一台 MacStudio 的价格大概能买到 32999/28 = 1178M token. 而为了输出这些token, 买到的 MacStudio 运行 Qwen3.6-27B 要持续运行 209天. 也就是说回本周期至少是200天不间断运行. 然后运行模型才是纯赚. 这还是没算电费和不直接买API而是买套餐的情况.而且, 最重要的是这还是在运行一个只有27B的小模型. 如果真的买512G的 MacStudio (108749, 而且好像已经断货了), 然后运行量化版本的 GLM-5.2, 速度就会跌到只有 17 token/s, 回本周期大概在 7 年左右... 对于现在1.5个月模型就发新版本的情况下, 普通用户自用是绝对不划算的. 所以大部分用户买 coding plan 会更划算, 如果像我一样要测新模型, 直接租卡也会比直接买划算很多. 当然, 如果你本身就有Mac或者显卡, 那么空闲的时候(比如睡觉的时候)让它跑大模型运行任务, 反而是划算的. #本地大模型# #mac# #qwen36# #glm52#
顯示更多
0
110
149
11
轉發到社區
Meta正式发布了Muse Glimmer ♾️ Meta 又放了一个能真正在家里电脑上跑起来的开源智能代理模型,而且还挺能干活的。 简单说就是:你可以直接把它下载到自己的电脑(Mac 或带高性能 GPU 的 PC)上跑,不依赖云端,就能当智能代理用。 核心亮点: 通过量化把模型压到 20GB 以下,再配合轻量级 DFlash 推测解码技术,生成速度够快,支持流畅的实时对话和多步代理操作。 在同类尺寸模型(比如 Gemma4-31B、Qwen3.6-27B)的代理相关基准测试里表现很强,特别擅长工具调用、多步推理、代码生成和端到端任务完成。 官方演示里,它只收到一句自然语言提示,就自动完成了:发现本地 Home Assistant 设备 → 查询 API → 从零写一个响应式 HTML/CSS/JS 控制面板 → 部署本地服务器并验证。整个过程都在本地跑完。 模型权重以 Apache 2.0 宽松许可在 Hugging Face 开放下载,技术博客和开发者资源也同步放出。这是 Meta 继续走「开放科学」路线的又一次动作,让普通用户和开发者都能在自己的硬件上跑比较强的本地代理模型。
顯示更多
多数人觉得 OCR 卷到头了,无非拍照转文字。但腾讯混元刚开源的 HyOCR-1.5 跳出了这套路子——1B 参数纯视觉端到端模型,在 OmniDocBench v1.6 上以 94.74 分拿下端到端第一,推理速度还提了 6.37 倍。 传统 OCR 流水线要拼接检测、识别、版面分析多个模型,慢且重。HyOCR-1.5 一个模型端到端输出,还用了 DFlash 投机解码:并行猜测多条解码路径,快速筛最优结果,让推理大幅加速。在 Transformers 上快 6.37 倍,vLLM 快 2.14 倍,最后单页文档端到端推理只要 1.408 秒。原先处理百页要几分钟,现在半分钟搞定,成本跟着跳水。 更关键的是全栈开源。模型权重、训练代码、推理流程全部开放,没有 API 调用费,数据不离开本地。对天天要处理合同、发票、古籍的团队来说,这种又快又省还不泄露数据的方案,每月可能省出一个人力成本。 它的适用面也没局限在中英文。通过 Agentic Data Flow,HyOCR-1.5 扩展到了 331 种语言、古文字识别,还能做多图问答。128K 上下文窗口加上 4K 分辨率,长图、竖排文档都能直接处理,不用切块、不用额外对齐。 当然,开源不等于「无脑能用」。虽然 1B 参数消费级显卡就跑得动,但装环境、跑 Demo 还是需要一点技术底子。社区已经有热心人封装一键包,不过暂时不够傻瓜化;追求「上传即得结果」的朋友,可以蹲一下腾讯混元后续的云服务。 但我觉得,这款模型最大的价值不是技术指标——而是它把「高质量、低成本、全栈可控」这三件事同时装进了一个能跑在任何机器上的 1B 小模型中,让普通团队也能用上以前大厂才烧得起的 OCR 能力。开源给了杠杆,试错的门槛已经很低。 怎么踩上这个杠杆?👉 普通用户:关注腾讯混元公众号,先看技术细节,把云服务上线消息存下来。开发者:去 GitHub 搜 JevenYu/HyOCR,拉模型跑 Demo,立刻替换掉项目里那条慢速 OCR 管道。产品经理/创业者:拿几张你最痛苦的文档测一测速度、精度和成本,说不定下一个垂直文档处理工具的原型就出来了。
顯示更多
0
48
231
47
轉發到社區
刚看了个视频,最近新出的 Qwen3.6 27B 大家都跑了吗?用单卡 4090 原生跑,速度才 20 Token/秒,写个代码慢得让人想砸键盘。 但他疯狂折腾了各种优化,直接把速度干翻了近10倍!这有点牛逼了,给大家说下他的优化方法。 干货全在这: 1️⃣ 4bit量化:速度直接翻倍,画质(精度)几乎不掉。 2️⃣ MTP投机解码:让显卡火力全开,一路飙到 108 Token/秒! 3️⃣ 最新黑科技 DFlash:借用AI生图的思路搞文本,峰值直接干到 184 Token/秒,快到起飞! 最牛的是现在有个叫 TurboQuant 的技术,能把缓存无损压缩 4 倍。就算你只有 24G 显存,也能跑满 200K 的超长上下文!但是哈,这是优化KV Cache的,场景优化现在不是很好... 等生态起来吧 别整天喊算力焦虑了,只要优化弄得好,你的电脑就是个小型数据中心! 不知道大家跑的时候有没有去优化,后面都试试。 你的跑出来是多少? #AI# #AIAgent#
顯示更多