DeepSeek 下一代还能不能超过 Kimi K3?
我把这个问题丢给了 Apodex。实际跑完后,主要情景的发生概率约 60%,但大概率只会领先 5%–15%,不会碾压。
这里的超过主要指综合评测、推理和代码,不代表每个维度都领先。
因为 超过 这个词太虚了。
代码强算超过,还是 Agent 强算超过?长上下文、多模态、推理能力和调用成本,权重又该怎么分?
这次我先把口径定死:主要看公开综合评测,以及推理和代码能力,不代表每个维度都领先。
按 Apodex 这次整理的公开信息,Kimi K3 当前在综合能力、Agent、长文本检索和多模态上更占优势。
DeepSeek V4 的长处则是代码、推理、调用成本,以及对国产算力的适配。
所以这道题并不是谁全面压过谁,而是 DeepSeek 下一代能不能补齐短板,同时守住自己的优势。
两边的信息其实是打架的。
已经发布的第三方评测更支持 Kimi K3,DeepSeek 的资金、算力和架构路线则更有利于下一代。
Apodex 的取舍是:判断当前差距,优先看已发布评测。预测下一代,再看资金、算力、架构和团队这些硬变量。没有官方确认的参数和发布时间传闻,一律不算核心证据。
它把接下来的胜负拆成了四个变量:
1. DeepSeek 能拿到多少算力和资金
2. Engram 这条架构路线能不能继续跑通
3. 团队扩张后还能不能保持迭代速度
4. 国产芯片能不能接住下一轮训练和推理
对我来说,这些变量比一张未经确认的跑分截图更有参考价值。
基于这些变量,它给了三种情景:
60%:DeepSeek 下一代温和领先 Kimi K3。
30%:两家长期互有胜负。
10%:DeepSeek 研发延期或架构遇到瓶颈,Kimi 继续领先。
这三个数字是情景发生概率。它对整套判断的置信度是 65%,因为下一代模型的参数、数据和训练细节还没有公开。
Apodex 最终没有押 DeepSeek 重新一家独大。
我最开始觉得这个判断有点保守。把四个变量拆开之后再看,它更看好 DeepSeek + Kimi 长期双头竞争。
即使 DeepSeek 下一代综合跑分超过 K3,也很可能只是推理和代码重新领先。到了真实使用里,开发者还是会按场景选模型,不会所有任务只用一家。
我觉得这次回答里最好的一段,是它主动写出了自己会在什么情况下改口。
如果 DeepSeek 新模型继续延期、团队出现明显波动,60% 会降到 30%–40%。
如果官方公开下一代技术路线,第三方评测又在代码、Agent 和浏览任务上全面领先,这个概率才会上升到 75%–80%。
AI 预测最容易写成算命:给一个很准的数字,说完就跑。
但一个预测如果没有证据、失效条件和回来对账的时间点,70% 和 40% 其实没多大区别。
按 Apodex 公布的信息,这套方法在 FutureX 实时预测 benchmark 上拿过领先排名。不过我更在意的,还是它愿意把判断过程和改口条件摊开。
我先把这个时间戳留在这里:
这次用 Apodex 跑出来的主要情景是:DeepSeek 下一代约有 60% 概率在综合评测、推理和代码上超过 Kimi K3。整套判断的置信度是 65%,更长期的格局可能是双头竞争。
等 DeepSeek 正式发布,我们回来对账。
如果你也想看它怎么拆信源和不确定性,可以自己拿一道还没有答案的问题试试:
#
Apodex#