TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI 🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
Joined December 2014
433
Following
10.9K
Followers
AI少年
@aehyok
2026.08.16 07:20
在 24GB M5 MacBook 上运行了 Qwen3.8-27B,使用 llama.cpp 的 MTP 推测解码,Token速率从 7.16 → 10.47 token/s,相当于获得了 1.46倍 的 tokens/秒提升。 那么MTP推测解码到底是个什么玩意呢? 首先要搞明白一个点,大模型的文本生成目前始终还是以找规律预测的形式来一个 token 一个 token 的生成,这种简单的思想,就叫做自回归。意思就是模型的推理始终是以上一个字出现结果后,再出现下一个可能的结果的字。 比如,对于同一个字“你”,下一个字可能是“好”,也有可能是“吃”,这种方式带来的缺点就是,始终是等待上一个词出现后才能出现下一个...... 那什么是 MTP?MTP简称投机解码(Multi-Token Prediction),自 2024 年开始,MTP 加速推理就只干了一件事,那就是多 Token 预测。 说人话就是:大模型还是那个大模型,它不会一口气写出整段答案。前面先让很轻的 MTP 模块顺着往下猜后面几个字,当成草稿;然后大模型再一次性核对这些字对不对——对的留下,从第一个不对的地方自己重写。小模块负责打草稿,大模型负责验收,一次前向就能往前走好几个字,所以推理更快。内容和原来一个字一个字生成的一样,不是另写几份答案再汇总。 目前国内的主流大模型,Qwen、DeepSeek、GLM、Kimi、Xiaomi 等等均已支持这种技术,而且 在 vllm和sglang 中要使用也非常简单。 MTP到底什么时候开,请看截图,截图内容仅供参考,正在自学中
Show more
0
0
5
17
2
Forward to community
Most Popular Users
Tibo
@thsottiaux
771.5K Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Serenity
@aleabitoreddit
1M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
197.6K Followers
New York Post
@nypost
4.2M Followers
OpenAI
@OpenAI
5.4M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.2K Followers
Bitcoin Archive
@BitcoinArchive
1.8M Followers
SpaceXAI
@SpaceXAI
2.1M Followers
Anthropic
@AnthropicAI
1.8M Followers
First Squawk
@FirstSquawk
569.2K Followers