老实说,算力的弹性定价被忽略了。
凌晨三点的 GPU 和中午一点的 GPU,跑一个 token 的成本其实不一样。
前者在空转,后者在排队。可模型服务商几乎都是全天同一个价。
这很奇怪。电按峰谷定价,云计算有 spot instance,唯独推理这个正在变成公共事业的东西,价格全天一条直线。
推理算力是不可存储的易腐资源。一台 GPU 凌晨空转,这个算力不会存下来留给中午用,它直接消失了。
一条直线价格意味着没有任何价格信号去把需求从高峰挪到低谷。想省钱的人没有便宜时段可以选,服务商也只能为永远存在的高峰留足冗余。
我判断下一个会出现的,是推理算力的分时定价。批处理、训练、离线 eval 这些不讲究延迟的任务,会慢慢被赶到夜间去。
谁先把弹性价格做出来,谁就能把闲置算力变现,同时把高峰成本降下来。
顯示更多