AMD 已签约收购多伦多 AI 芯片公司 Taalas,想解决一个很实际的任务:让代码助手、
AI Agent 这类大量生成文本的服务,回答更快,推理成本更低。
Taalas 的办法很激进:把模型权重直接固化进芯片,省掉频繁从外部高带宽内存搬数据的时间和功耗。
其首款 HC1 跑 Llama 3.1 8B,自测达到每位用户约 1.7 万 token/秒。
但这个数字不能直接理解成所有模型都能快十倍。测试用的是较小且已经过时的模型,还采用激进的 3/6 位量化;
Taalas 自己也承认,输出质量比 GPU 基准有所下降。
更麻烦的是选择权。GPU 可以换模型,专用芯片却把效率押在一个模型上。模型若有较大改动,就得重新流片;
LoRA 这类小规模微调仍能保留,但赶不上如今模型频繁更新的节奏。
所以它最适合的不是普通公司试用新模型,而是模型已经稳定、调用量巨大,愿意用前期制造成本换长期推理成本的平台。
AMD 买到的是一条更便宜、更快的生成通道,也把“选错模型后怎么办”的风险交给了客户。
顯示更多