註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeepSWE
DeepSWE 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeepSWE 的搜尋結果
看DeepSWE评测,Gemini是真的惨。 谷歌到底出了啥问题。
0
51
42
2
轉發到社區
CodeX最具性价比的使用方式出现了 根据DeepSWE 排行榜最新数据:GPT-5.6 Luna Max 以 67% 得分,平均成本只要 $0.61 登顶最具性价比的模型,兼顾了性能和成本 所以现在最高效的玩法是: 主线程用 GPT-5.6 Sol 做整体规划和拆解,把边界清晰的子任务全部丢给 GPT-5.6 Luna Max 并行执行 直接把下面这段提示词复制给 Codex: ─── 请在 ~/.codex/agents/luna-worker.toml 创建一个名为 luna_worker 的自定义代理。 使用以下设置: model = "gpt-5.6-luna" model_reasoning_effort = "max" 为它写一个清晰的 description 和 instructions,专门用于处理边界明确、可独立完成的委派任务。保留我现有的其他配置不要动。根据我当前安装的 Codex 版本校验配置是否兼容,展示修改的 diff,然后后续子代理任务优先使用 luna_worker。 ─── 设置完之后,Sol 负责思考和决策,Luna Max 负责大批量落地执行。一个长 goal 下来,额度消耗会明显下降,速度却更快 也可以不建自定义文件,直接让 Sol 在主线程里为每个子任务单独开 Luna Max 线程,结果会自动汇总回来
顯示更多
0
17
39
7
轉發到社區
国产模型最近这一波打得太精准了 DeepSWE benchmark 放出了榜单, 从分数上看, GLM-5.2 无疑是国产编程大模型SOTA了, 而 Kimi-K2.7-Code 则是性价比SOTA. 图上几个折线是对应模型的不同推理程度的得分情况. DeepSWE 我觉得是最近非常值得的关注的的榜单了, 这个虽然也叫xxSWE, 但是它用的不是像SWE那种github上爬取的PR或者issue, 而是完全根据开源项目人工制造的问题, 然后让大模型修改. 能最大限度避免大模型提前炼这些问题(起码需要一段时间了, 5月份刚出的) 并且修改范围也很大,SWE-Bench-verified 通常一个提交也就几十行代码, 而 DeepSWE 每个问题都要上百行提交才能解决问题, 并且很考验模型的规划能力, SWE-Bench-Verified 通常会把所有需要的工具给到错误日志啥的也有, 并且提示词也写好告诉模型该怎么用. 而 DeepSWE 纯靠模型自己摸索, 非常像现实中修改项目代码的过程. 我觉得是涵盖了一部分工程能力测试的. 另外 SWE-Bench-verified 测得大部分都是 Python, 而 DeepSWE 则涵盖了TypeScript、Go、Python、JavaScript、Rust. 所以我强烈建议关注大模型编程能力测试的同学过关注一波这个测试. #DeepSWE# #SWEBench# #glm# #kimi#
顯示更多
0
55
84
7
轉發到社區
GLM-5.2 刚涨价,DeepSeek 转头就把桌子掀了。 V4-Flash 正式版 API 上线公测,Terminal Bench 2.1 跑到 82.7,NL2Repo 54.2,DeepSWE 54.4。拿 GLM-5.2 的常规口径对一下:81.0、48.9、46.2。表面看,三项都压了过去,而且出手的还只是 Flash,不是后面的 Pro。 这就有意思了。 GLM-5.2 前脚刚把价格抬上去,DeepSeek 后脚就拿原本负责性价比的 Flash 过来抢 Agent 的位置。更狠的是,这版模型结构和尺寸没变,只靠后训练,把进终端、读仓库、调工具、跑长任务重新练了一遍。 它还原生支持 Responses API,专门适配 Codex。什么意思?DeepSeek 不只是来刷榜,它是准备直接抢 Code Agent 的开发者入口。 当然,不同 Harness 不能简单判死刑,榜单也不等于真实项目。但 GLM-5.2 这波涨价多少有点尴尬:你前脚说自己值更多钱,DeepSeek 后脚就拿 Flash 过来问——凭什么? 接下来别看谁嗓门大。拿同一个真实仓库、同一套任务、同一笔预算跑一遍,谁先把活干完,谁才有涨价的底气。
顯示更多
这次 DeepSeek V4 Flash 0731 的价格一出来,我想了一下,感觉昨天刚降价的 GPT-5.6,好像又贵了🙃。 OpenAI 前一天刚把 GPT-5.6 Luna 降价 80%,现在是每百万 Token 输入 0.2 美元、输出 1.2 美元;Terra 也降了 20%,来到 2 美元和 12 美元。 结果 DeepSeek Flash 的官方 API 价格依然只有输入 1 元、输出 2 元人民币,缓存命中更低至 0.02 元。 更关键的是,这次 Flash 的定位已经不只是「便宜模型」。在 DeepSeek 公布的 Agent 和 Coding 基准里,它超过了 V4 Pro Preview,Terminal-Bench 2.1 达到 82.7,DeepSWE 达到 54.4,部分成绩已经接近 Opus 4.8。虽然这些还是官方数据,并且使用了 Max 推理和自家的 Harness,独立评测还需要再等等。 我感觉,模型厂商接下来很难再单靠「旗舰能力」维持高价。 Agent 任务调用次数多、运行时间长,Token 价格会直接决定一个产品能不能大规模跑起来。DeepSeek 这种定价,会逼着其他厂商继续降价,或者证明自己在稳定性、工具调用和真实任务成功率上,确实值几十倍的差价。 接下来更有悬念的,是 DeepSeek V4 Pro 正式版会怎么定价。 Flash 已经把能力和价格压到了这里,Pro 还能留下多大的定价空间?
顯示更多
模型没改一个字,Harness 却让它长了本事 DeepSeek V4-Flash 这次发的"正式版",本质不是新模型。 架构没动,参数没加——Flash 还是 2840 亿总参、130 亿激活;Pro 是 1.6 万亿 / 490 亿,差一个数量级。官方原话就一句:"仅重新进行了后训练"。 没换发动机,只重调了变速箱和驾驶策略。 结果 Agent 能力一下子跳到接近 Pro:TerminalBench 82.7、DeepSWE 54.4、Cybergym 76.7。 这事儿值得盯,是因为它恰好验证了崔添翼进 DeepSeek 要干的那件事。 崔添翼是谁?浙大加六枚 ACM 金牌,Jane Street 量化九年,今年三月被梁文锋挖来组建 Agent 团队。 他给的公式很直白:Model + Harness = Agent。 Harness 是啥? 说白了,就是套在模型外面、让它能真正接任务、调工具、自己跑起来干活的那套系统。模型是发动机,Harness 是方向盘、刹车。没有它,模型再聪明也是个裸 API,跑不了真实任务。 他的切入点妙在:量化交易和 Agent 底层逻辑同源——都是上下文管理、工具调用、终端执行、权限控制。 量化不堆算力,是在噪音里筛信号、精准路由。这套"信号过滤 + 路由执行",被他搬到了模型框架上。 一句话:Harness 不是让模型更聪明,是让便宜的 token 变有用。小模型配好 Harness,能打赢大模型加糙 Harness。 为什么这能替代堆参数? 预训练是灌知识(多聪明),后训练是岗位带教(教怎么把事办完)。 这次证明:130 亿激活的小 Flash,靠重训加自家 Harness 环境,Agent 成绩逼近 490 亿的 Pro。 → 模型规模不再是 Agent 能力的唯一决定因素,训练方法、数据质量、Harness 的权重在上升。 但要泼盆冷水:Harness 和内部测试集没公开,第三方还没复现,暂时不能断言"后训练已可替代扩容"。 这条路线直接打 Agent 应用层的"毛利危机"——Cursor、Devin 这类产品,被 OpenAI、Anthropic 的旗舰账单吸走大半订阅费,沦为"算力劳务派遣"。 DeepSeek 的逻辑:用便宜 token 加自家 Harness,把成本压下来、可控性提上去,切 OpenAI 后院。 → 看 AI 应用公司,同一个模型换 Harness 结果天差地别。未来估值要看"模型 × Harness"复合能力,不是单看参数。 所以下一仗,是模型还是 Harness?
顯示更多
0
17
25
3
轉發到社區
最近 AI 圈的大事汇总(避免无脑吹) 1. DeepSeek:V4-Flash 正式版 API 公测 • DeepSeek 宣布 DeepSeek-V4-Flash 正式版 API 开启公测 • 官方称 Agent 能力 明显提升,多项成绩超过此前 V4-Pro 预览版 • 社区/评测侧对比:多项基准 超过 GLM-5.2;部分长程编程任务接近 Claude Opus 4.8(如 DeepSWE 约从 7 分升至 54 分出头,Opus 约 59 分) • 价格约 输入 $0.14 / 输出 $0.28(每百万 token);缓存命中更低 • 架构与参数量基本不变,本次主要为后训练升级;V4-Pro 正式版尚未发布 社区实测: 独立机构 Artificial Analysis 综合指数约 50,与 GPT-5.6 Luna、GLM-5.2 接近(约 51),并非断层第一;开源总榜仍 落后 Kimi K3。部分高分可能含官方 Agent 脚手架,待第三方复测。仍为纯文本;高峰时段价格可能翻倍 2. OpenAI:GPT-5.6 降价 • GPT-5.6 Luna 降约 80%,约 $0.20 / $1.20(百万输入/输出)。 • GPT-5.6 Terra 降约 20%,约 $2 / $12。 • Sol 价格不变,新增更快的 Fast 模式(约 2.5 倍速度、2 倍价格) 注意: 降的是中低档,旗舰未降;相对部分中国模型仍更 3. MiniMax:H3 视频模型发布 • 发布 H3,支持文本、图片、视频、音频输入 • 可生成约 15 秒、2K 视频,带原生声音 • 官方表示 权重将很快开源;成本宣传为 2K 视频约低于主流竞品三分之一 4. 字节:Seedance 2.5 发布 • 与 MiniMax 同日前后发布 Seedance 2.5 • 单次可生成约 30 秒 视频,强调长叙事与多参考素材 • 将上线即梦、豆包等,API 陆续开放 5. 智谱 GLM:Coding 套餐涨价 • GLM Coding / Token 相关套餐涨价;订阅重新开放 • 社区反馈:入门档约翻倍以上;高档有 约 $22 涨至 $79 等说法 这个真的拉了一坨大的 ───
顯示更多
GPT5.6你用上了吗? 主打长任务和工作流 GPT-5.6 分三档: Sol:旗舰模型,最强能力。 Terra:日常工作平衡款,成本更低。 Luna:最快、最便宜,适合大规模低成本调用。 主打效率 OpenAI 强调 GPT-5.6 能用更少 token 完成更多有效工作,在代码、知识工作、网络安全、科学任务上提升明显。 更适合 Agent 和复杂任务,GPT-5.6 支持更强的工具调用和长流程执行。新的 max 模式给模型更多推理时间;ultra 模式默认协调 4 个 agent 并行处理复杂任务。API 里也提供 Programmatic Tool Calling 和 multi-agent beta,用来减少往返调用和中间 token 浪费。 代码能力是重点,OpenAI 称 GPT-5.6 Sol 是目前最好的编码模型之一,在 Coding Agent Index、Terminal-Bench、DeepSWE 等评测中表现更强,尤其适合真实代码库、命令行工作流和长周期工程任务。 设计和前端生成能力提升,GPT-5.6 能把自然语言需求转成更完整、更好看的交互界面,而且会检查渲染结果、修正视觉和功能问题。对 PPT、文档、表格、模板复刻等“可交付物”也更强。 知识工作更端到端,GPT-5.6 能处理 Slack、Notion、Microsoft 365、Google Drive 等复杂上下文,产出报告、演示文稿、电子表格、研究分析等更完整的成果。 网络安全和科学能力提升,GPT-5.6 在漏洞分析、代码审查 补丁 威胁建模等防御场景提升明显。 GPT-5.6 现在开始在 ChatGPT、Codex、OpenAI API 推出。 API 价格为每 100 万 token: Sol:输入 $5,输出 $30 Terra:输入 $2.5,输出 $15 Luna:输入 $1,输出 $6 作为品牌经理,已经开始期待了🖤 我将变得更强…….. #GPT# #AI#
顯示更多
0
46
58
1
轉發到社區
DeepSeek招土木工程师,大工程口的同行们,希望这不就来了么这😎😎 近期,DeepSeek官网出现一则招聘信息,称“每一代人都会遇到属于自己的基础设施革命”。 在职位要求中,电气、暖通、环境、土木等均被列为符合需求的专业。
顯示更多
0
15
41
0
轉發到社區
DeepSeek 凭什么推理成本比同行便宜几个数量级?秘密全在这个算子库里。它专门为多头潜隐注意力机制(MLA)打造,把算力榨干到极致。 显存占用暴跌: KV Cache 压缩到传统 MHA 的 6.7% 左右,大并发不再爆显存。 吞吐性能撕裂: 在 H800 上提速超明显,带宽跑满到 3000 GB/s,算力冲上 660 TFLOPS。 支持 FP8 低精度: 配合 FP8 KV 缓存,内存直接省一半,精度还没怎么掉。 开箱即用: 专为大模型推理服务打造,只要跑 MLA 架构模型就能无缝接入。 🔗 传送门:
顯示更多