TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
GitHubDaily
@GitHub_Daily
💡 挖掘开源的价值 🧑🏻💻 坚持分享 GitHub 上高质量、有趣、实用的教程、AI工具、前沿 AI 技术 🧐 A list cool, interesting projects of GitHub. ✏️ 公众号:GitHubDaily
参加 May 2023
205
フォロー中
83.3K
ファン
GitHubDaily
@GitHub_Daily
2026.07.30 10:02
在机房里跑大模型,算力卡各有长短,有的擅长计算,有的擅长吐字,混在一起用会损耗资源。 想把它们分开到两地机房各干各的,但又有新问题,中间那一堆算好的数据传起来很慢。 最近无问芯穹在 WAIC 上公开的跨集群异构推理架构 PDD,正好解决了这个问题。 该架构能把首 Token 的等待时间最高可降低 51.5%,更让 Token 成本爆降近 40%。 技术报告: 做法有点像接力跑。数据先在本地机房交给一个「替补」,替补立刻开始吐字,屏幕上马上有反应。 后台再慢慢把数据传到外地机房,传完就把话头接过去,替补退场,中间几乎感觉不到卡顿。 最巧的是交接,替补不传一大堆数据,只把几 KB 的小信息发过去,外地那头自己重算一遍。 而内容重复度高的请求直接走外地,占了七成以上,替补实测只干 6.2% 的活。 正在研究如何让大模型推理降本增效的开发者,这份技术报告可以查看一下。
もっと見る
0
0
19
7
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
TVer新着
@TVer_info
99.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.9K ファン
New York Post
@nypost
4.1M ファン
一劍浣春秋
@chee828
230.9K ファン
モデルプレス
@modelpress
2M ファン
ファミ通.com
@famitsu
1.4M ファン
AKB48公式
@AKB48_staff
289.4K ファン
NMB48 Official
@nmb48_official
133.7K ファン
フレッシュ撮影会【公式】
@fresh_akiba
94.3K ファン
乃木坂46
@nogizaka46
2M ファン
HKT48
@hkt48_official_
150.8K ファン
STU48
@STU48_official_
103.9K ファン
INI
@official__INI
508.3K ファン
22/7(ナナブンノニジュウニ)
@227_staff
64.3K ファン