登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
参加 December 2014
433 フォロー中    10.9K ファン
很多人经常听到一个词:自回归模型(Autoregressive Model)。 其实很好理解: 一个字一个字往后猜,每次生成新的内容,都要参考前面已经生成的内容。 比如: 「今天天气很」 ↓ 预测下一个 Token:「好」 ↓ 变成「今天天气很好」 ↓ 再继续预测下一个 Token 整个过程就是: 已有 Token → 预测下一个 Token → 把新 Token 加回输入 → 再预测 GPT、Claude、Gemini、Llama、Qwen、DeepSeek 等大多数文本生成模型,本质上都是自回归模型。 它的优点是生成质量高、上下文连续性好。 但缺点也很明显: 传统自回归解码通常是串行的。 Token 1 → Token 2 → Token 3 → …… → Token 1000 后面的 Token 要依赖前面的 Token,所以生成速度会受到限制。 这也是为什么现在会出现 MTP、Speculative Decoding、DFlash、FreeToken 这类技术。 它们很多都在尝试解决同一个问题: 一次只生成一个 Token 太慢,能不能一次多预测几个? 一句话总结: 自回归模型 = 一边看前文,一边逐 Token 往后写。
もっと見る
在 24GB M5 MacBook 上运行了 Qwen3.8-27B,使用 llama.cpp 的 MTP 推测解码,Token速率从 7.16 → 10.47 token/s,相当于获得了 1.46倍 的 tokens/秒提升。 那么MTP推测解码到底是个什么玩意呢? 首先要搞明白一个点,大模型的文本生成目前始终还是以找规律预测的形式来一个 token 一个 token 的生成,这种简单的思想,就叫做自回归。意思就是模型的推理始终是以上一个字出现结果后,再出现下一个可能的结果的字。 比如,对于同一个字“你”,下一个字可能是“好”,也有可能是“吃”,这种方式带来的缺点就是,始终是等待上一个词出现后才能出现下一个...... 那什么是 MTP?MTP简称投机解码(Multi-Token Prediction),自 2024 年开始,MTP 加速推理就只干了一件事,那就是多 Token 预测。 说人话就是:大模型还是那个大模型,它不会一口气写出整段答案。前面先让很轻的 MTP 模块顺着往下猜后面几个字,当成草稿;然后大模型再一次性核对这些字对不对——对的留下,从第一个不对的地方自己重写。小模块负责打草稿,大模型负责验收,一次前向就能往前走好几个字,所以推理更快。内容和原来一个字一个字生成的一样,不是另写几份答案再汇总。 目前国内的主流大模型,Qwen、DeepSeek、GLM、Kimi、Xiaomi 等等均已支持这种技术,而且 在 vllm和sglang 中要使用也非常简单。 MTP到底什么时候开,请看截图,截图内容仅供参考,正在自学中
もっと見る