Register and share your invite link to earn from video plays and referrals.

思维怪怪
@0xLogicrw
写关于 AI 的一切 Shit Post @BeatingOfficial AI 信息流:
Joined May 2018
2.5K Following    6.5K Followers
DeepSeek-V4-Pro-0813 的 Agent 成绩大幅跃升。 DeepSeek 官方流出的自测表显示,DeepSWE 从 Preview 版的 12.8 飙到 62.7,一次涨了 49.9 分。CyberGym 也从 52.7 升到 83.3,AutomationBench 从 12.8 升到 31.8。 新版已经在多项评测反超 Claude Opus 4.8。Terminal Bench 2.1 达到 87.9 对 85.0,CyberGym 为 83.3 对 78.3,DeepSWE 为 62.7 对 58.0。AutomationBench 甚至以 31.8 超过 Fable 5 的 29.1。 离谱的是,模型从 Preview 升到 0813,价格一分钱没涨。V4-Pro API 仍维持每百万 Token 输入 3 元、输出 6 元。你梁圣永远是你梁圣! 不过这批成绩目前还是 DeepSeek 自测,第三方尚未完整复现。尤其 DeepSWE 一次暴涨近 50 分,Agent 评测又很依赖 Harness,实际提升还要等外部测试。
Show more
DeepSeek-V4-Pro 正式版可能已经开始切换。DeepSeek 官方 API 文档悄悄把模型版本从原来的 DeepSeek-V4-Pro 改成 DeepSeek-V4-Pro-0813。调用名称仍是 `deepseek-v4-pro`,上下文为 1M,最大输出 384K,Responses API 现在也已经标为支持。
Show more