TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
沉浸式翻译
@immersivetran
参加 May 2023
0
フォロー中
0
ファン
沉浸式翻译
@immersivetran
2026.07.15 07:30
一台 25GB 内存的普通电脑,跑起了 744B 的 GLM-5.2。 之前我们聊过 GLM-5.2 的 1M 上下文、聊过它对 AI 定价逻辑的冲击。今天聊一个更极端的问题:这个 744B 的庞然大物,最低能在什么样的机器上跑起来? GitHub 上一个叫 colibrì(蜂鸟)的项目给出了答案:约 25GB 内存的消费级机器。不用 GPU,不用 Python,整个引擎是一个约 2400 行的 C 文件,零依赖。 它的思路利用了 MoE 架构的本质: 744B 参数里,每个 token 真正激活的只有约 40B,其中逐 token 变化的路由专家只有约 11GB。于是—— 1️⃣ 稠密部分(注意力、共享专家)int4 量化后约 9.9GB,常驻内存 2️⃣ 21,504 个路由专家(约 370GB)放在硬盘上,按需流式读取 代价是什么?作者在 README 里写得异常坦诚:冷启动每个 token 要从磁盘读约 11GB,速度只有 0.05–0.1 token/秒。翻一句话可能要几分钟。 "This is not fast."——但它证明了一件事:跑通一个 744B 前沿模型,不一定需要机房,一台“比一个 H100 风扇还便宜”的机器就够了。 大模型的门槛,正在被各种意想不到的方式拆掉。 🔗:
もっと見る
0
0
2
13
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
吴说区块链
@wublockchain12
181.5K ファン
First Squawk
@FirstSquawk
569.2K ファン
Bloomberg
@business
10.5M ファン
ファミ通.com
@famitsu
1.4M ファン
モデルプレス
@modelpress
2.1M ファン
billboard
@billboard
16.8M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.2K ファン
一劍浣春秋
@chee828
0 ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
cv usk
@cv_usk
416 ファン