TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
小墨同学
@xiaomovps
🚀 AI Spark 联合创始人|企业 + AI 🧠 日常分享 AI / Agent 实践 🌐 传家宝VPS站长
Joined September 2022
392
Following
9.3K
Followers
小墨同学
@xiaomovps
2026.08.30 04:05
一个 124B 的大模型,现在居然已经有人在 Mac 上跑到 30+ tokens/s 了。 最近我在看蚂蚁百灵刚开源的 Ling-3.0-Flash,本来第一反应也是:124B,这东西和普通人本地部署应该没什么关系。 结果仔细看了一圈,发现它还真不是传统意义上的 124B。 我在我自己的Mac里就把它跑起来了,没想到速度还真的很不赖,虽然不是跑的最大参数的模型。 让我觉得有意思的点: 模型很大,但每生成一个 Token,真正参与计算的参数其实很少。 这也是为什么我觉得它这次本地部署特别值得看。 1、本地部署门槛比想象中低 现在社区 GGUF 的 Q4 大概在 70~80GB,96GB 统一内存已经可以进入比较实用的范围。 有人用 M2 Max 96GB 跑 IQ4_XS,短上下文大概能做到 35 tokens/s,30K 上下文还有 24 tokens/s 左右。 单台 128GB DGX Spark 跑 INT4,也能接近 40 tokens/s。 这个速度已经不是单纯“能跑起来”,而是真的可以拿来干活了。 2、它不是单纯为了本地聊天做的小模型 Ling-3.0-Flash 本身就明显偏 Agent 场景。 它做了大量 Coding Agent、General Agent、Deep Research 环境训练,原生支持 Tool Calling、Thinking、长上下文。 官方模型卡甚至直接提到了 Claude Code、Qwen Code、Hermes Agent、OpenClaw 这些 Harness。 本地模型真正有价值的地方,应该不是陪你聊天,而是能不能接进 Agent 里面长期干活。 3、它的架构本身就很适合本地 Agent 124B 总参数,但是只有 5.1B Active Parameters。 再加上 MoE、MTP、Prefix Cache 这些设计,核心思路其实很清楚: 尽可能保留大模型容量,同时把每次推理真正需要的计算量压下来。 前面我还说千问3.8 27B模型,我跑不起来,现在百灵这个小模型就让我跑起来了。 后面我可以对接到我的Pi,处理一些简单文本工作完全可以胜任。
Show more
小墨同学
@xiaomovps
2026.08.30 00:39
0
0
1
2
1
Forward to community
Most Popular Users
Unipcs (aka 'Bonk Guy') 🎒
@theunipcs
291.5K Followers
Tibo
@thsottiaux
595.8K Followers
Elon Musk
@elonmusk
241.6M Followers
lauren
@poteto
90.8K Followers
Grok Bot
@bot
246K Followers
nobi
@0xnobi
19.8K Followers
ClaudeDevs
@ClaudeDevs
682.3K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
۟
@MINHxDYNASTY
93.4K Followers
Serenity
@aleabitoreddit
1M Followers
Déborah
@dvorahfr
195.2K Followers
𝔹𝕃𝕍ℂ𝕂𝕃!𝔾ℍ𝕋
@BLVCKLIGHTai
70.4K Followers
Grok
@grok
9M Followers
Claude
@claudeai
1.8M Followers
OpenAI Developers
@OpenAIDevs
407.7K Followers