Register and share your invite link to earn from video plays and referrals.

Max For AI
@MaxForAI
Head of hype @lobehub Prev @listenhub @Sapient_Int 没啥好看的,也就发点AI相关的内容🫡 同名小红书4万粉丝,公众号01Founder(长文首发) 观点仅代表个人 更多请访问网站⬇️(欢迎商务、合作
Joined September 2023
3K Following    40.4K Followers
我很吃惊居然没有人注意到DeepSeek已经有了自己的Benchmark。 这张 V4 Pro 0813 的成绩表里,DeepSeek 还藏了一套自己的 Agent Benchmark。 DSBench-FullStack DSBench-Hard 这两套都不是公开 Benchmark,而是 @deepseek_ai 自己内部做的测试集。 FullStack 测完整的全栈开发能力,Hard 则专门放高难度 Agent 任务。 早在六月 DeepSeek 就已经悄悄挂出了单独的 Benchmark ( 现在随着 V4 系列的更新,DSBench 已经连续出现在官方成绩表里。 而且它测出来的模型排序还挺有意思。 DSBench-FullStack: Fable 5:77.2 Kimi K3:73.7 Opus 4.8:71.6 DeepSeek V4 Pro 0813:71.1 但到了 DSBench-Hard: Opus 4.8:71.7 Fable 5:68.3 DeepSeek V4 Pro 0813:67.2 Kimi K3:63.0 也就是说,在 DeepSeek 自己定义的高难 Agent 任务里,Opus 4.8 反而超过了更新的 Fable 5。 结果本身我倒不会太早下结论,毕竟是内部 Benchmark,题目、数据分布、Harness 都还没有完全公开。 但我觉得 DSBench 这件事本身挺值得关注。 一个实验室自己造什么 Benchmark,其实也暴露了它现在到底在优化什么。 DeepSeek 最近明显越来越重视 Agent、Coding Agent 和 Harness。 现在模型有了,DeepSeek Harness 也已经开始露出来,DSBench 很可能就是他们内部训练和评估 Agent 的另一块基础设施。 现在就差一个问题:DSBench 到底会不会开源。 如果后面 DeepSeek 把 DSBench + DeepSeek Harness 一起放出来,那比单纯再开一个模型有意思得多。 相当于连他们做 Agent 的尺子和工具,也一起给你放到桌子上了。
Show more