註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

数字生命卡兹克
@Khazix0918
愿我们永远对世界保持好奇。 公众号:数字生命卡兹克 AI热点网站AIHOT:
加入 February 2022
178 正在關注    66.7K 粉絲
等了好久,DeepSeek V4的正式版终于来了。 可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。 但我看到消息的第一反应,还有很开心的。 因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。 这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。 官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。 同时还原生支持Responses API,专门针对Codex进行了适配。 讲真,DeepSeek这次在后训练上,应该是憋了个大的。 但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。 复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。 这没什么可避讳的。 但模型真正进入生产环境以后,能力上限只是一部分。 还有一个经常被低估到离谱的指标: 你到底用不用得起。 这也是我为什么反而更期待Flash。 我自己的AIHOT,现在每天差不多要抓一万条新闻。 这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。 最后才回到真正的精选打分环节那一步。 这里面绝大多数环节,都需要AI介入。 有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。 一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。 按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。 但DeepSeek V4 Flash就很适合干这个。 智能水平在中上等,却又便宜得离谱。 WorkBuddy里也是一样。 真正难到天上的任务,大家可以接K3。 可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。 行业当然需要那些一次跑通世界级难题的顶级模型。 可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。 当智能贵得像奢侈品时,大家只能偶尔体验。 当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。 所以我很多时候,真的挺感谢DeepSeek。 这才是真正的,智能平权。
顯示更多
🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We’ve massively upgraded its Agent capabilities—benchmark scores are now far surpassing the V4-Pro-Preview. Check out the massive performance leap below! 👇 🔷 The official V4-Flash now natively supports the Responses API format and is fully adapted for Codex! Check out the configuration details in our official API docs:
顯示更多
0
99
166
5
轉發到社區