Register and share your invite link to earn from video plays and referrals.

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
Joined December 2014
433 Following    10.9K Followers
在 24GB M5 MacBook 上运行了 Qwen3.8-27B,使用 llama.cpp 的 MTP 推测解码,Token速率从 7.16 → 10.47 token/s,相当于获得了 1.46倍 的 tokens/秒提升。 那么MTP推测解码到底是个什么玩意呢? 首先要搞明白一个点,大模型的文本生成目前始终还是以找规律预测的形式来一个 token 一个 token 的生成,这种简单的思想,就叫做自回归。意思就是模型的推理始终是以上一个字出现结果后,再出现下一个可能的结果的字。 比如,对于同一个字“你”,下一个字可能是“好”,也有可能是“吃”,这种方式带来的缺点就是,始终是等待上一个词出现后才能出现下一个...... 那什么是 MTP?MTP简称投机解码(Multi-Token Prediction),自 2024 年开始,MTP 加速推理就只干了一件事,那就是多 Token 预测。 说人话就是:大模型还是那个大模型,它不会一口气写出整段答案。前面先让很轻的 MTP 模块顺着往下猜后面几个字,当成草稿;然后大模型再一次性核对这些字对不对——对的留下,从第一个不对的地方自己重写。小模块负责打草稿,大模型负责验收,一次前向就能往前走好几个字,所以推理更快。内容和原来一个字一个字生成的一样,不是另写几份答案再汇总。 目前国内的主流大模型,Qwen、DeepSeek、GLM、Kimi、Xiaomi 等等均已支持这种技术,而且 在 vllm和sglang 中要使用也非常简单。 MTP到底什么时候开,请看截图,截图内容仅供参考,正在自学中
Show more