Register and share your invite link to earn from video plays and referrals.

泊舟
@bozhou_ai
AI Coding / Agent 实战派 帮编程新手和老板用 AI 把想法做成工具、产品和内容 分享教程、工具和 AI 资讯 合作 V:bozhou_ai
Joined October 2023
791 Following    29K Followers
DeepSeek 下一代还能不能超过 Kimi K3? 我把这个问题丢给了 Apodex。实际跑完后,主要情景的发生概率约 60%,但大概率只会领先 5%–15%,不会碾压。 这里的超过主要指综合评测、推理和代码,不代表每个维度都领先。 因为 超过 这个词太虚了。 代码强算超过,还是 Agent 强算超过?长上下文、多模态、推理能力和调用成本,权重又该怎么分? 这次我先把口径定死:主要看公开综合评测,以及推理和代码能力,不代表每个维度都领先。 按 Apodex 这次整理的公开信息,Kimi K3 当前在综合能力、Agent、长文本检索和多模态上更占优势。 DeepSeek V4 的长处则是代码、推理、调用成本,以及对国产算力的适配。 所以这道题并不是谁全面压过谁,而是 DeepSeek 下一代能不能补齐短板,同时守住自己的优势。 两边的信息其实是打架的。 已经发布的第三方评测更支持 Kimi K3,DeepSeek 的资金、算力和架构路线则更有利于下一代。 Apodex 的取舍是:判断当前差距,优先看已发布评测。预测下一代,再看资金、算力、架构和团队这些硬变量。没有官方确认的参数和发布时间传闻,一律不算核心证据。 它把接下来的胜负拆成了四个变量: 1. DeepSeek 能拿到多少算力和资金 2. Engram 这条架构路线能不能继续跑通 3. 团队扩张后还能不能保持迭代速度 4. 国产芯片能不能接住下一轮训练和推理 对我来说,这些变量比一张未经确认的跑分截图更有参考价值。 基于这些变量,它给了三种情景: 60%:DeepSeek 下一代温和领先 Kimi K3。 30%:两家长期互有胜负。 10%:DeepSeek 研发延期或架构遇到瓶颈,Kimi 继续领先。 这三个数字是情景发生概率。它对整套判断的置信度是 65%,因为下一代模型的参数、数据和训练细节还没有公开。 Apodex 最终没有押 DeepSeek 重新一家独大。 我最开始觉得这个判断有点保守。把四个变量拆开之后再看,它更看好 DeepSeek + Kimi 长期双头竞争。 即使 DeepSeek 下一代综合跑分超过 K3,也很可能只是推理和代码重新领先。到了真实使用里,开发者还是会按场景选模型,不会所有任务只用一家。 我觉得这次回答里最好的一段,是它主动写出了自己会在什么情况下改口。 如果 DeepSeek 新模型继续延期、团队出现明显波动,60% 会降到 30%–40%。 如果官方公开下一代技术路线,第三方评测又在代码、Agent 和浏览任务上全面领先,这个概率才会上升到 75%–80%。 AI 预测最容易写成算命:给一个很准的数字,说完就跑。 但一个预测如果没有证据、失效条件和回来对账的时间点,70% 和 40% 其实没多大区别。 按 Apodex 公布的信息,这套方法在 FutureX 实时预测 benchmark 上拿过领先排名。不过我更在意的,还是它愿意把判断过程和改口条件摊开。 我先把这个时间戳留在这里: 这次用 Apodex 跑出来的主要情景是:DeepSeek 下一代约有 60% 概率在综合评测、推理和代码上超过 Kimi K3。整套判断的置信度是 65%,更长期的格局可能是双头竞争。 等 DeepSeek 正式发布,我们回来对账。 如果你也想看它怎么拆信源和不确定性,可以自己拿一道还没有答案的问题试试: #Apodex#
Show more