注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 CyberGym
CyberGym 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 CyberGym 的推特
🔒 GCSA Agent 在 CyberGym 测试中取得 91.3% 高分,跻身全球顶尖 AI 网络安全智能体行列,展现强大防御能力 GCSA Agent scores 91.3% on CyberGym, joining top-tier AI cybersecurity agents worldwide with powerful defense capabilities
显示更多
🛡️ 微软 MDASH 登顶网安基准 CyberGym 测试 95.95% 断层第一 领先 GPT-5.5 Cyber 85.6% 约十点 组合架构专克 AI 网络攻击
啊?这一段原来都用的是beta版么? DeepSeek-V4-Flash 正式版 API 今天上线公测,Agent 能力提升明显。 Terminal Bench 2.1 得分 82.7,Cybergym 76.7,多项基准超过 V4-Pro-Preview。 模型结构和尺寸没变,这次只重新做了后训练。 它原生支持 Responses API,还针对 Codex 做了适配。 官方表示 V4-Pro 正式版会尽快发布。
显示更多
模型没改一个字,Harness 却让它长了本事 DeepSeek V4-Flash 这次发的"正式版",本质不是新模型。 架构没动,参数没加——Flash 还是 2840 亿总参、130 亿激活;Pro 是 1.6 万亿 / 490 亿,差一个数量级。官方原话就一句:"仅重新进行了后训练"。 没换发动机,只重调了变速箱和驾驶策略。 结果 Agent 能力一下子跳到接近 Pro:TerminalBench 82.7、DeepSWE 54.4、Cybergym 76.7。 这事儿值得盯,是因为它恰好验证了崔添翼进 DeepSeek 要干的那件事。 崔添翼是谁?浙大加六枚 ACM 金牌,Jane Street 量化九年,今年三月被梁文锋挖来组建 Agent 团队。 他给的公式很直白:Model + Harness = Agent。 Harness 是啥? 说白了,就是套在模型外面、让它能真正接任务、调工具、自己跑起来干活的那套系统。模型是发动机,Harness 是方向盘、刹车。没有它,模型再聪明也是个裸 API,跑不了真实任务。 他的切入点妙在:量化交易和 Agent 底层逻辑同源——都是上下文管理、工具调用、终端执行、权限控制。 量化不堆算力,是在噪音里筛信号、精准路由。这套"信号过滤 + 路由执行",被他搬到了模型框架上。 一句话:Harness 不是让模型更聪明,是让便宜的 token 变有用。小模型配好 Harness,能打赢大模型加糙 Harness。 为什么这能替代堆参数? 预训练是灌知识(多聪明),后训练是岗位带教(教怎么把事办完)。 这次证明:130 亿激活的小 Flash,靠重训加自家 Harness 环境,Agent 成绩逼近 490 亿的 Pro。 → 模型规模不再是 Agent 能力的唯一决定因素,训练方法、数据质量、Harness 的权重在上升。 但要泼盆冷水:Harness 和内部测试集没公开,第三方还没复现,暂时不能断言"后训练已可替代扩容"。 这条路线直接打 Agent 应用层的"毛利危机"——Cursor、Devin 这类产品,被 OpenAI、Anthropic 的旗舰账单吸走大半订阅费,沦为"算力劳务派遣"。 DeepSeek 的逻辑:用便宜 token 加自家 Harness,把成本压下来、可控性提上去,切 OpenAI 后院。 → 看 AI 应用公司,同一个模型换 Harness 结果天差地别。未来估值要看"模型 × Harness"复合能力,不是单看参数。 所以下一仗,是模型还是 Harness?
显示更多
0
17
25
3
转发到社区
🔎0.1分的差距,57倍的价格,DeepSeek V4 Pro正式版诠释“性价比之王” 凌晨突袭,DeepSeek V4 Pro正式版把性价比玩明白了。 8月12日深夜,DeepSeek官网API文档悄然更新,旗舰模型V4 Pro从预览阶段正式转正,版本号定格为DeepSeek-V4-Pro-0813。没有发布会,没有倒计时,连更新日志都没来得及写。但数据不会说谎,这款模型用一张成绩单,把“比我强的没我便宜,比我便宜的没我强”这句话,刻在了大模型竞赛的牌桌上。 性能:距离全球第一,只差0.1分 先说硬指标。V4 Pro正式版沿用了预览版的MoE架构,1.6万亿总参数、每个Token激活490亿参数,支持100万Token上下文窗口和384K最大输出。架构没变,但后训练下了狠功夫。 最惊艳的来自Agent相关评测。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分。全球第一的Anthropic Fable 5,为88.0分,差距仅0.1分。相比预览版72.1分,三个月跃升了15.8分。 再看其他维度。AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分。软件工程能力测试DeepSWE从预览版的12.8分飙升至62.7分,涨了近五倍,超越了Anthropic上一代旗舰Opus 4.8,为58.0分。DSBench-Hard翻了一倍多达到67.2。 这些测试有个共同点,都涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的地方。换句话说,V4 Pro这次补上的正是大模型从“聊天玩具”走向“生产工具”最关键的Agent能力。 价格:对手的六十分之一 性能逼近Fable 5,价格呢?V4 Pro每百万Token输入(缓存未命中)3元、输出6元,缓存命中输入低至0.025元。 对比海外顶级模型,Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元。而DeepSeek V4 Pro仅为0.87美元。6元人民币的输出价格,是Fable 5的六十分之一、Opus 5的三十分之一。 0.1分的跑分差距背后,是五十七倍的价格鸿沟。在部分智能体任务中,V4 Pro与Claude、Fable等顶级模型的性能差距已缩小到约5%,但后者的价格最高却是它的45倍。 格局:大模型竞赛进入性价比时代 这次更新恰逢Grok 4.6同夜发布、Qwen 3.8-Max宣布开源。模型之争已从单一的参数比拼,转向性能、成本与商业化应用的综合较量。 DeepSeek走的是一条清晰的路,用顶级模型的性能、地板价的价格,倒逼整个行业重新思考“什么才是好的大模型”。V4 Pro与Flash版形成“高频轻量走Flash、复杂推理走Pro”的产品分层,开发者可以按需选择,丰俭由人。 当然,V4 Pro并非没有短板。在无工具调用的Humanity's Last Exam上,它跟Claude Opus 5仍有明显差距。部分开发者反馈长时间连续执行时仍会出现提前停止、任务质量不稳定等问题。此外,DeepSeek已预告将整体上调API定价,目前的低价窗口能持续多久仍是未知数。 但无论如何,V4 Pro正式版已经用实力证明了一件事:性能可以逼近全球第一,价格却可以只有对手的六十分之一。大模型的“奢侈品”时代正在被瓦解,这对所有开发者来说,都是好消息。 #AI# #DeepSeek#
显示更多
0
114
9
0
转发到社区
同一批基准里,本地跑的 DeepSeek V4 Flash 加上 J-Space 控制层之后,在大多数任务上压过了不加控制层的 V4 Pro。 《DeepSeek V4 × J-Space 能力释放报告》 DeepSeek V4 × J-Space:Benchmark 与工程观察记录 © 2026 Tiger3807861189,本记录采用 CC BY-ND 4.0(署名-禁止演绎)许可。 页面范围:本记录整理外部项目已经公开的工程观察、J-Space 使用的操作性术语、项目级 Benchmark 分数及其适用边界。它不是研究论文,非学术性质,不提供模型内部机制证明、形式化判定方法、消融设计或因果贡献分解。 J-Space Cognition Suite V3.6 是一套在推理阶段运行的模型无关控制系统,不修改模型权重。项目地址: 一、外部工程观察 1.1 Anchored Standard:首轮接口锚定 dsh-anchored-standard( DeepSeek Harness 的首轮接口条件。其基础方案在第一次模型请求中恢复 Minimal 的真实双工具 Schema,抑制自动注入内容;会话产生持久事件后,再开放一个较小的常驻工具目录,并按需解锁其他工具。 该项目的公开实验表明,首轮工具 Schema、输出预算和自动注入内容都可能改变首条推理轨迹。它也明确区分了"轨迹被锚定"和"任务能力已经稳定提升":当前仓库中的通用组合与早期高分运行并不完全相同,小样本独立复现尚不足以确定稳定的能力增益幅度。因此,本记录只引用其接口敏感性与路径保持观察,不把单项分数推广为普遍结论。 1.2 Routing Suite:任务感知的入口选择 dsh-routing-suite( 与工具面装配,把新会话送入不同的行为带。其公开材料报告了稳定区域和不稳定过渡区域,并据此避免把连续数值旋钮误当成可连续调节的推理深度。 该项目后来对早期"官方刻意设计双吸引子""自路由绝对不可能"等强归因作出了公开勘误( mixed 表示不稳定的过渡或竞争区域,不等于一种兼具短、长思维优点的可用中间态。 二、思维链二极管 2.1 操作性定义 本记录所称思维链二极管(chain-of-thought diode),是一个面向黑盒行为的工程术语:在同一个会话中,连续思维链会稳定落入以下两种形态之一: • 短思维直觉:较快形成判断并进入行动,推理块较短; • 长思维推理:先展开较长的分析、重估与规划,再决定是否行动。 两种形态在同一会话中不能稳定、按任务阶段自然地共同出现;首轮形成路径承诺后,后续思维链通常延续同一侧。外部实验中偶尔出现的词汇混合或不稳定过渡,不构成能够同时利用两侧优势的中间态。 这一术语描述的是会话级轨迹,而不是某一句话或某一个词。We need、Let me 等表达最多只能作为外部探针,不能单独证明模型能力、推理质量或内部状态。 2.2 形成原因:极简接口过拟合假说 J-Space 采用的工程诊断是:DeepSeek 的 Agent 后训练行为可能与 DSH 极简模式的接口分布形成了过强耦合。极简 persona、首轮工具 Schema、自动注入边界和输出条件共同构成接口指纹;当实际 Harness 接近这一分布时,一类轨迹更容易被唤起,接口发生变化时则可能落入另一类轨迹。 这里的"过拟合"是对黑盒条件敏感性的工程概括,不表示已经获得 DeepSeek 的训练数据、隐藏状态或官方内部解释。现有公开证据支持"接口条件与轨迹变化相关",但不足以从外部还原完整训练机制。 2.3 两侧的结构性弊端 • 短思维直觉:过早接受第一个流畅解释;复杂约束整合不足;跳过必要中间桥接;工具证据利用不足;局部测试成功后过早宣布完成。 • 长思维推理:分析惯性和行动延迟;反复推翻或重建已有判断;工具调用过晚;Token 与时间消耗增加;长程状态漂移;信息已经充分仍难以收束。 因此,二极管带来的主要工程问题不是某一侧必然更差,而是会话无法随任务阶段稳定调整推理形态:需要桥接时可能过快,需要行动时又可能持续推演。 三、三套方案的浅层关系 • Anchored Standard:作用于首次模型请求的接口条件。恢复已知的 Minimal 接口指纹,尽量让会话从入口进入并保持一条稳定轨迹。 • Routing Suite:作用于新会话开始前的任务分类与模式选择。根据任务选择较适合的稳定行为带,并回避不稳定过渡区域。 • J-Space:作用于会话进入轨迹后的完整任务生命周期。不宣称消除二极管,而是通过状态、行动、验证与恢复机制缓解会话落入任一侧后的结构性弊端。 三者可以被理解为入口恢复、入口选择和持续任务控制三个不同层面。这是一种便于工程使用的关系整理,不表示三套方案已经在统一 Harness 下完成组合实验,也不构成效果排名。 3.1 J-Space 对两侧弊端的浅层处理 当会话偏向短思维直觉时,J-Space 使用 bridge-before-conclusion、共享约束广播、Empirics、verifier 与 coverage,要求快速判断在交付前补足必要桥接、证据和验证范围。 当会话偏向长思维推理时,J-Space 使用功能性第一人称、明确的 Next、有限候选、差分测试与 checkpoint,把已经形成的判断绑定到行动、取证或收束,减少无新增约束的反复推演。 对于两种形态,Goal / Core / Verified / Open / Next 账本、工具接缝刷新与恢复机制负责维持跨文件、跨工具和长时间任务状态。这些机制调节外部任务过程,并不等同于让模型在同一会话中自由切换两种底层思维链。 四、Benchmark 记录 4.1 评测上下文 J-Space 在 DeepSeek 上的项目评测参照官方 Harness 极简模式。J-Space 通过工作空间路由、状态连续性、验证与恢复参与推理时流程。 结果形成于项目现有的评测环境。硬件条件、进程隔离、工具可用性与信息访问边界共同构成评测上下文;可访问资料及执行轨迹也可能影响观测结果。 以下汇总上述条件下的项目级 Benchmark 记录。其他模型的数据保留各厂商公开评测时的原有上下文,不同环境与 Harness 配置下出现分数变化属于正常现象。各 Benchmark 使用自身原生分数,数值越高越好;"—" 表示没有报告结果。 4.2 分数记录 顺序固定为:V4-Flash-0731 裸跑、V4-Flash-0731 + J-Space、V4-Pro-0813 裸跑、V4-Pro-0813 + J-Space、GLM-5.3、Kimi-K3、Opus-4.8、Fable 5(带 fallback)。 • HLE(无工具):37.8、45.5、42.7、48.0、未报告、43.5、49.8、53.3(全场最高) • HLE(有工具):51.5、60.6、60.0、67.7(全场最高)、62.5、56.0、57.9、63.0 • Terminal Bench 2.1:82.7、87.1、87.9、90.1(全场最高)、88.2、88.3、85.0、88.0 • NL2Repo:54.2、70.2、61.5、73.4(全场最高)、58.0、58.0、69.7、未报告 • CyberGym:76.7、81.7、83.3、86.8(全场最高)、84.5、80.0、78.3、83.1 • DeepSWE:54.4、67.4、62.7、72.0(全场最高)、66.9、67.5、58.0、70.0 • Toolathlon-Verified:70.3、77.7、74.1、79.5(全场最高)、73.0、76.5、76.2、77.9 • Agents' Last Exam:25.2、30.1、25.7、30.3(全场最高)、28.5、27.6、25.7、23.8 • AutomationBench(Public):25.1、31.7、31.8、38.2、48.2(全场最高)、30.8、27.2、29.1 4.3 Benchmark 与二极管弊端的定性对应 • HLE(无工具):短侧可能过早下结论,长侧可能在知识边界之外无效延伸;J-Space 对应必要桥接、置信控制与独立复核。 • HLE(有工具)、CyberGym:短侧可能少用或少整合证据,长侧可能迟迟不进入工具取证;对应 Empirics、工具接缝与验证覆盖。 • Terminal Bench:短侧可能快速执行但遗漏核验,长侧可能分析过度、行动延迟;对应明确的 Next、诊断重试与 checkpoint。 • NL2Repo、DeepSWE:短侧可能丢失跨文件约束,长侧可能反复重建计划;对应共享广播、Loop 账本与持续验证。 • Toolathlon-Verified:短侧可能跳过编排检查,长侧可能困在工具选择和重新规划;对应共享状态、接缝审计与 coverage。 • Agents' Last Exam、AutomationBench:异构任务或长间隔会放大固定路径与任务阶段的错配;对应选择性 pass、持久状态与恢复。 上述对应关系是工程解释,不是从分数反推出内部状态的证明。当前 Benchmark 记录没有逐次标注会话所处的二极管状态,因此不能据此计算二极管对分数的贡献比例,也不能把全部分数变化归因于单一机制。 4.4 数据来源 • DeepSeek V4-Flash-0731 模型卡: • 智谱 AI( GLM-5.3 发布评测记录 • Kimi-K3 模型卡: • Claude Fable 5 与 Claude Mythos 5 System Card: • J-Space Cognition Suite V3.6 README: 五、适用边界 • 思维链二极管和极简接口过拟合属于黑盒工程诊断,不是 DeepSeek 官方披露的模型结构或训练事故。 • 词汇、首行风格和思维链长度只能作为轨迹探针,不能替代任务完成、工具行动、验证覆盖和得分。 • Anchored Standard、Routing Suite 与 J-Space 的关系是作用层面的整理,尚未经过统一组合实验验证。 • 当前分数是项目记录,不足以建立跨模型普遍性,也不支持精确的因果贡献分解。 • J-Space 不创造基础模型缺少的知识,也不保证对所有任务、模型或 Harness 产生正向变化。 引用:工程使用请引用 J-Space Cognition Suite V3.6( 原文: #DeepSeek# #J-Space# #本地AI#
显示更多