가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

seekinganythingbutalpha
@ivanalog_com
Focus on 1) Technology and Dividend Blended 2) Drawdown protection. Check highlights and articles. No investment advice. Now building ModelDock
가입 October 2011
753 팔로잉 중    16.5K 팬
DS 和 Qwen 出世以前,其实我是不太相信这一点的。因为 OpenAI、Anthropic 两家的模型大小、激活参数和真实 serving 成本都不透明,外界只能猜。 但最近 Qwen、DeepSeek 这类公开权重模型的本地和云端 serving 数据越来越完整以后,这笔账已经可以自己算了。 结果其实很惊人。 以 27B dense 为例,本地 4090 的纯输出成本大约在 0.6 美元/MM,典型读写混合以后,大约只有 0.1 美元/MM。到了 B200 production serving,纯输出成本已经可以压到 0.1 美元/MM 左右,输入输出合计则进一步进入几美分/MM 的区间。 所以现在的问题已经不是“AI 很贵”。 恰恰相反,AI 作为生产资料,已经便宜得有些离谱。 而且本地卡还只是生产级硬件能力的边角料。B200、B300 这种机器一旦进入高并发 serving,通过 batching 把模型权重读取成本摊到大量请求上,单位 token 成本会远低于单用户本地推理。 这也是为什么最近半个月消费级显卡的翻倍式上涨值得重视。大家开始重新认识这些机器的经济价值。以前一张显卡主要是一件消费电子产品,现在它越来越像一台可以持续生产机器智力的小型生产设备。 更重要的是,这个成本下降并不是单纯来自硬件。 模型本身也在发生变化。 Qwen 27B 这种 dense 模型,已经能用几十 B 参数进入过去旗舰闭源模型才能达到的能力区间。DeepSeek 则通过 MoE 进一步把总知识容量和每个 token 实际需要计算的参数量拆开。 也就是说,模型正在变得越来越“智力密集”。 每一个 B 参数承载的有效智力越来越高。 所以现在同时发生了两件事: 模型越来越聪明。 模型越来越便宜。 这才是最反常识的地方。 通常一种商品质量越来越高,成本也会越来越高。但 AI 目前恰恰相反。智力质量快速提高,而单位智力的生产成本却在快速下降。 这也是为什么 DeepSeek 涨价以前的定价,现在回头看,没有当时想象得那么疯狂。它的官方 output 价格已经很低,高缓存 workload 的实际 blended price 更低。OpenCode 当时再补贴一层以后,我实际看到的价格甚至到了几美分/MM。 过去看起来像补贴出来的不可持续价格,现在拿 production serving 成本重新计算以后,会发现它距离硬件经济极限并没有想象得那么远。 所以长期真正值得思考的可能不是: AI 价格最终会不会跌得很惨? 而是: AI 的成本会不会跌得比价格更快? 如果未来 Opus 级甚至更高的机器智力,市场竞争把售价打到 0.1 到 0.2 美元/MM,但生产成本已经下降到几美分,那么这个行业依然可以维持很高的毛利。 卖价暴跌,并不等于经济性恶化。 甚至完全可能相反。 而价格真正进入 0.05 到 0.10 美元/MM 以后,另一个更大的变化才会开始出现。 这个价格已经低到,很多生产系统不会再认真考虑“要不要省 token”。 理性的策略会逐渐变成: 继续算。 继续生成方案,继续搜索参数,继续验证,继续失败,继续重做,把以前因为智力太贵而无法充分探索的问题空间全部打开。 到了这个阶段,token 就不再像一种消费品。 它更像电力、算力或者工业原料。 只是它生产的东西,是智力。 所以我立正站好,加仓 $ORCL
더 보기