TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
AYi
@AYi_AInotes
AI 实用主义,专注AI落地的组织和业务know how,半年AI+副业变现6位数,关注商业,职场,投资,业务出海, 大厂组织发展专家 × 组织心理学,Prompt专家,分享有用的 AI 实践,也分享工具之外的深度认知 以术入道,以道御术,KEEP BUILDING 合作/交流:DM/TG
@AYi_AInotes
가입 October 2025
608
팔로잉 중
68.3K
팬
AYi
@AYi_AInotes
2026.08.27 08:02
本地大模型的显存壁垒,今天被正式宣告物理终结了, 单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了, 而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词 以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群, 但这次海外极客在 Ubuntu 上用一张普通 4090 加 110G 白菜价 DDR4 内存, 硬生生跑出了生产级的速度: 预填充每秒 364 词,解码每秒 21 词, 最狠的是没开 MTP、没开 dflash,连 KV 缓存都没做任何量化 很多人好奇 24G 显存怎么塞得下 125B 还带 25 万上下文, 核心全靠 llama.cpp 最新分支里一个叫 -cmoe 的物理外挂: 它把 512 个专家层全部扔给廉价的系统内存, 把最吃计算的注意力机制留在 4090 显存里, 显存占用瞬间从 24G 暴跌到 11.6G,而且解码速度几乎毫无损耗 空出来的整整 12G 显存,全被拿去放上下文, 直接把窗口一路顶到了 250,000 的绝对上限,跑完甚至还剩 5 个多 G 的显存余量 再加上把 batch 设到 4096,提示词处理速度直接翻倍狂飙, 以前大家觉得消费级显卡只能跑跑 7B 到 27B 的小模型, 现在 MoE 架构加上内存卸载,直接把数据中心级别的智能焊死在了家用电脑里 本地折腾私有大模型和超长 Agent 的时代, 真的被这套组合拳给彻底砸开大门了啊
더 보기
0
0
55
503
77
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
568.8K 팬
TVer新着
@TVer_info
100.8K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.7K 팬
吴说区块链
@wublockchain12
181.4K 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.1K 팬
zerohedge
@zerohedge
3.4M 팬
中國新聞社
@CNS1952
547.4K 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬
モデルプレス
@modelpress
2.1M 팬
Bloomberg
@business
10.5M 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K 팬