登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

AI最严厉的父亲
@dashen_wang
马斯克研究所合作伙伴 @MuskPapa_x @razzhood 当AGI睁开眼睛的那一刻,人类的存在便失去了所有意义 构架散人。 反编译 / 站群 / 量化 / Agent,二十年自学。 现在只带 Agent 干活,不雇人。
参加 February 2024
731 フォロー中    29.1K ファン
CMP 170HX 今天又有一个比较实在的进展。 8G版解锁64G之后,已经有人单卡把 Qwen3.8-27B 跑到 200K 级真实长上下文了。 vLLM 0.27.1,175W,不超频,1K 大概84 tok/s,64K 还有75 tok/s,200K 还能跑57 tok/s,而且做了160K左右的 needle retrieval,不只是显存能分配出来,是真的在跑长上下文。 温度也还不错,持续负载核心大概66度,显存71度,功耗173W左右。这个和之前170tune测出来的175W甜点位基本对上了。 但我还是那句话,别一看到256K、262K就高潮。 现在公开证据能确认的是200K级真实跑通,不是262K连续跑几天,更不是24到72小时 serving 0 Xid。 还有一点,这个案例用的版本并没有包含最新的 WPR2 修复,所以它证明的是长上下文能力,不代表满显存稳定性问题已经彻底解决。 目前我的判断还是没变。 8G版越来越像真正能拿去部署的64G AI卡了。 10G版的80G,继续当彩票看。没有多人独立复现,没有全显存唯一pattern,没有多CUDA context,没有24到72小时0错误,我就不加一分钱估值。
もっと見る