注册并分享邀请链接,可获得视频播放与邀请奖励。

beyond5188
@Meta888_hk
加入 March 2022
0 正在关注    0 粉丝
🔎0.1分的差距,57倍的价格,DeepSeek V4 Pro正式版诠释“性价比之王” 凌晨突袭,DeepSeek V4 Pro正式版把性价比玩明白了。 8月12日深夜,DeepSeek官网API文档悄然更新,旗舰模型V4 Pro从预览阶段正式转正,版本号定格为DeepSeek-V4-Pro-0813。没有发布会,没有倒计时,连更新日志都没来得及写。但数据不会说谎,这款模型用一张成绩单,把“比我强的没我便宜,比我便宜的没我强”这句话,刻在了大模型竞赛的牌桌上。 性能:距离全球第一,只差0.1分 先说硬指标。V4 Pro正式版沿用了预览版的MoE架构,1.6万亿总参数、每个Token激活490亿参数,支持100万Token上下文窗口和384K最大输出。架构没变,但后训练下了狠功夫。 最惊艳的来自Agent相关评测。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分。全球第一的Anthropic Fable 5,为88.0分,差距仅0.1分。相比预览版72.1分,三个月跃升了15.8分。 再看其他维度。AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分。软件工程能力测试DeepSWE从预览版的12.8分飙升至62.7分,涨了近五倍,超越了Anthropic上一代旗舰Opus 4.8,为58.0分。DSBench-Hard翻了一倍多达到67.2。 这些测试有个共同点,都涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的地方。换句话说,V4 Pro这次补上的正是大模型从“聊天玩具”走向“生产工具”最关键的Agent能力。 价格:对手的六十分之一 性能逼近Fable 5,价格呢?V4 Pro每百万Token输入(缓存未命中)3元、输出6元,缓存命中输入低至0.025元。 对比海外顶级模型,Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元。而DeepSeek V4 Pro仅为0.87美元。6元人民币的输出价格,是Fable 5的六十分之一、Opus 5的三十分之一。 0.1分的跑分差距背后,是五十七倍的价格鸿沟。在部分智能体任务中,V4 Pro与Claude、Fable等顶级模型的性能差距已缩小到约5%,但后者的价格最高却是它的45倍。 格局:大模型竞赛进入性价比时代 这次更新恰逢Grok 4.6同夜发布、Qwen 3.8-Max宣布开源。模型之争已从单一的参数比拼,转向性能、成本与商业化应用的综合较量。 DeepSeek走的是一条清晰的路,用顶级模型的性能、地板价的价格,倒逼整个行业重新思考“什么才是好的大模型”。V4 Pro与Flash版形成“高频轻量走Flash、复杂推理走Pro”的产品分层,开发者可以按需选择,丰俭由人。 当然,V4 Pro并非没有短板。在无工具调用的Humanity's Last Exam上,它跟Claude Opus 5仍有明显差距。部分开发者反馈长时间连续执行时仍会出现提前停止、任务质量不稳定等问题。此外,DeepSeek已预告将整体上调API定价,目前的低价窗口能持续多久仍是未知数。 但无论如何,V4 Pro正式版已经用实力证明了一件事:性能可以逼近全球第一,价格却可以只有对手的六十分之一。大模型的“奢侈品”时代正在被瓦解,这对所有开发者来说,都是好消息。 #AI# #DeepSeek#
显示更多
0
114
9
0
转发到社区