註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

GitHubDaily
@GitHub_Daily
💡 挖掘开源的价值 🧑🏻‍💻 坚持分享 GitHub 上高质量、有趣、实用的教程、AI工具、前沿 AI 技术 🧐 A list cool, interesting projects of GitHub. ✏️ 公众号:GitHubDaily
加入 May 2023
205 正在關注    83.3K 粉絲
在机房里跑大模型,算力卡各有长短,有的擅长计算,有的擅长吐字,混在一起用会损耗资源。 想把它们分开到两地机房各干各的,但又有新问题,中间那一堆算好的数据传起来很慢。 最近无问芯穹在 WAIC 上公开的跨集群异构推理架构 PDD,正好解决了这个问题。 该架构能把首 Token 的等待时间最高可降低 51.5%,更让 Token 成本爆降近 40%。 技术报告: 做法有点像接力跑。数据先在本地机房交给一个「替补」,替补立刻开始吐字,屏幕上马上有反应。 后台再慢慢把数据传到外地机房,传完就把话头接过去,替补退场,中间几乎感觉不到卡顿。 最巧的是交接,替补不传一大堆数据,只把几 KB 的小信息发过去,外地那头自己重算一遍。 而内容重复度高的请求直接走外地,占了七成以上,替补实测只干 6.2% 的活。 正在研究如何让大模型推理降本增效的开发者,这份技术报告可以查看一下。
顯示更多