我很吃惊居然没有人注意到DeepSeek已经有了自己的Benchmark。
这张 V4 Pro 0813 的成绩表里,DeepSeek 还藏了一套自己的 Agent Benchmark。
DSBench-FullStack
DSBench-Hard
这两套都不是公开 Benchmark,而是
@deepseek_ai 自己内部做的测试集。
FullStack 测完整的全栈开发能力,Hard 则专门放高难度 Agent 任务。
早在六月 DeepSeek 就已经悄悄挂出了单独的 Benchmark (
现在随着 V4 系列的更新,DSBench 已经连续出现在官方成绩表里。
而且它测出来的模型排序还挺有意思。
DSBench-FullStack:
Fable 5:77.2
Kimi K3:73.7
Opus 4.8:71.6
DeepSeek V4 Pro 0813:71.1
但到了 DSBench-Hard:
Opus 4.8:71.7
Fable 5:68.3
DeepSeek V4 Pro 0813:67.2
Kimi K3:63.0
也就是说,在 DeepSeek 自己定义的高难 Agent 任务里,Opus 4.8 反而超过了更新的 Fable 5。
结果本身我倒不会太早下结论,毕竟是内部 Benchmark,题目、数据分布、Harness 都还没有完全公开。
但我觉得 DSBench 这件事本身挺值得关注。
一个实验室自己造什么 Benchmark,其实也暴露了它现在到底在优化什么。
DeepSeek 最近明显越来越重视 Agent、Coding Agent 和 Harness。
现在模型有了,DeepSeek Harness 也已经开始露出来,DSBench 很可能就是他们内部训练和评估 Agent 的另一块基础设施。
现在就差一个问题:DSBench 到底会不会开源。
如果后面 DeepSeek 把 DSBench + DeepSeek Harness 一起放出来,那比单纯再开一个模型有意思得多。
相当于连他们做 Agent 的尺子和工具,也一起给你放到桌子上了。