注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 最弱のオダ
最弱のオダ 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 最弱のオダ 的推特
非农数据这么差,你们又空我最弱的存储,我都要哭出来了!
0
34
92
0
转发到社区
Claude Fable 5 是 DeepSWE 记分板上最贵的模型。Together AI 拿它跟全场最便宜的模型各跑了 452 次,给出的用法建议是反过来:贵的当后手。 《DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码与路由》 DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码和路由 要点 • 先跑 DeepSeek V4 Pro 0813,只有它失败时才升级到 Claude Fable 5。这条级联链解决 82.7% 的 DeepSWE 任务,每个任务 8.28 美元。单用 Fable 是 69.7%、每个任务 21.63 美元。高 13 个百分点,便宜 62%。 • Fable 赢第一发。pass@1 69.7% 对 62.8%,领先 7 个点。 • Pro 赢之后每一发。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。 • 价格差 90 倍。每次 rollout 0.24 美元对 21.63 美元。每花 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。 • 它们栽在不同的任务上。逐任务相关性只有 0.39,是我们测过的分歧最大的一对。两者合计覆盖 113 个任务中的 107 个。分歧正是路由能成立的全部理由。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 的 DeepSWE 对比中——DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准——这两个模型坐在价格表的两端。Claude Fable 5 的每次 rollout 是 DeepSWE 全榜最贵。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 首发的准确率高 7 个百分点,单次 rollout 却贵 90 倍,所以真正的问题不是哪个模型更好,而是这 90 倍的溢价到底买到了什么、什么时候值得付。 DeepSWE · 正面对决 DeepSeek V4 Pro 0813 vs Claude Fable 5 一览 • claude-fable-5 [max]:pass@1 69.7% ± 2.3%,平均成本 21.63 美元,每 100 美元解决 3 个任务,输出 token 115k,79 步 • deepseek-v4-pro-0813 [max]:pass@1 62.8% ± 3.1%,平均成本 0.24 美元,每 100 美元解决 260 个任务,输出 token 101k,146 步 我们在全部 113 个 DeepSWE 任务上,用 DeepSeek V4 Pro 0813(max)对 Claude Fable 5(max)各跑四次 trial,取自已发布的逐 trial 记录:总计 904 次 rollout(各 452 次)。Fable 是贵价的手艺人;Pro 是性价比上的异类。这两个模型的分歧也大于这套数据里的任何其他组合——结果这成了它们最有趣的地方。下文的每个数字都来自本次运行,所以可能与其他公开的 DeepSeek V4 Pro 0813 vs Claude Fable 5 记分卡有出入。 DeepSWE 记分板:pass@1 与 pass@k 单发,Fable 领先:pass@1 69.7% 对 Pro 的 62.8%(官方计分)。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次尝试时 Pro 的 pass@4 88.5% 比 Fable 的 84.1% 高出 4 个多百分点。对一个贵 90 倍的模型来说,Fable 既没有守住天花板,也没有在重试下保住首发优势。更便宜的模型覆盖更广,best-of-k 也更高。 成本对比:DeepSeek V4 Pro 0813 vs Claude Fable 5 的价格 每次 rollout 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,Fable 只有 3 个。这是我们测过的所有组合里最宽的成本差距,Fable 也是榜单上最贵的单个配置。而且与直觉相反,低价格没有带来速度惩罚:Fable 的中位 rollout 31 分钟,Pro 35 分钟,基本持平——因为 Fable 是榜单上话最多的模型(115k 输出 token),尽管它的步数更少(79 对 146)。Pro 走的步数多;Fable 每步写得多。两个模型谁也没有明显更快。 失败模式:两个模型分别怎么错 两者在「不破坏东西」上都算自律:DeepSeek V4 Pro 0813 和 Fable 各自只在 11% 的失败里回归了现有测试套件,远低于 GPT 家族的 20%。差别在另一个方向:Fable 的大偏差失误占比是这里最高的(18% 对 Pro 的 10%),也就是说 Fable 一旦错,更常是错得离谱——给出离题很远的方案,而不是差一个边界用例。Pro 更多时候倒在离正确答案不远的地方(66% 的近似失手,对 Fable 的 57%)。所以两者都可以不加重度回归门禁就放心接入,但 Fable 的失手是调试成本更高的那种。 按任务类型,各自赢在哪 Fable 的手艺体现在推理重、契约精确的领域:8 个领域里它赢 6 个,领头的是数据建模与序列化(88%,比 Pro 高 24 个点)和语言内部机制(78)。但 DeepSeek V4 Pro 0813 拿下两个,两个都分量不轻:有状态响应式(66 对 64),以及——更有说服力的——并发与持久化(58 对 45):在恰恰是 Fable 最弱的领域里领先 13 个点。Fable 在并发上的 45% 是它最弱的格子,也是唯一一个便宜模型不只是更便宜、而是工程师水平更高的领域。 按编程语言 Fable 赢下五种语言里的四种,但真正对得起它价格的是 Rust:85% 对 Pro 的 65%,20 个点的差距,也是这场对决里最大的一处差距。Fable 显然是序列化和 Rust 专家。其他语言都比价格暗示的接近(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),DeepSeek V4 Pro 0813 则实际拿下 TypeScript(61 对 57)。Rust 和序列化之外,付 90 倍价格的理由很难成立。 这两个模型到底有多不一样? 亮点在这里。逐任务相关性只有 0.39,是我们测过的 DeepSeek-Pro 组合里最低的——这两个模型是真心意见不合。它们各自解决了 88 个任务;Pro 单独拿下 12 个,Fable 单独拿下 7 个,只有 6 个任务两边都栽。两者的并集覆盖 113 个任务中的 107 个(94.7%),而且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四发四中,Fable 一次没成;Fable 在四个 Pro 全挂的任务上四发四中(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补,不是冗余。 在两者之间路由:组合打法 多样性加上价格差,让级联变得很划算。先跑 DeepSeek V4 Pro 0813,只有测试套件否决答案时才升级到 Fable:82.7% 的解决率,每个任务 8.28 美元。比单用 Fable(69.7%)高 13 个百分点,价格不到 Fable 单任务价格(21.63 美元)的一半。廉价的第一阶段清掉大部分队列,Fable 的溢价只花在难啃的剩余任务上,而且那些任务在上面还多获得一次独立的尝试。级联甚至赢过完美的一次性 oracle 路由(78.8%)。顺序不是可选项:Pro 先行每个任务 8.28 美元,Fable 先行 21.71 美元,准确率一样。 这意味着什么 Fable 5 是这张榜单上最难被当作默认模型的:最贵的一次 rollout 遥遥领先,首发优势被重试抹平,四发也没有天花板优势。只为两件事买它:Rust(85%)和序列化密集的工作(88%)——只有在这里它的质量才真正对得起价格。 DeepSeek V4 Pro 0813 是相反的画像:首发准确率接近 Fable,天花板更高,失败画像持平或更好,便宜 90 倍——尽管它在 Rust 和契约精确的领域让位。而因为两者是我们测过最多样的一对,Fable 最好的用法不是当默认,而是躲在低成本的 Pro 第一阶段后面做选择性升级,只在那少数真需要 Rust 或序列化专家的任务上付费。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 数据表:DeepSeek V4 Pro 0813 vs Claude Fable 5 完整结果 DeepSWE · 完整结果 • Pass@1(官方计分):Pro 62.8%,Fable 69.7% • Pass@1(错误计为失败):62.8%,67.3% • Pass@2 / pass@4:78.5 / 88.5%,77.1 / 84.1% • 覆盖率 / 可靠性:88.5 / 71.0%,84.1 / 82.0% • 四发四中 / 全挂:35 / 13,56 / 18 • 每次 rollout 成本 / 总成本:0.24 美元 / 109 美元,21.63 美元 / 9,346 美元 • 每 100 美元解决数:261,3 • 中位分钟 / 步数:35 / 146,31 / 79 • 中位峰值上下文 / 输出 token:232k / 101k,202k / 115k • 失败构成(近似 / 大偏差 / 回归):66% / 10% / 11%,57% / 18% / 11% • 赢下的领域(共 8 个):2(有状态、并发),6 • 赢下的语言:1(TypeScript),4(Rust 大胜) • 逐任务相关性 / 并集(两模型合计):0.39 / 113 中的 107(94.7%) • Pro → Fable 级联(准确率 / 成本):82.7% / 8.28 美元(单用 Fable 69.7% / 21.63 美元) • 单发 oracle 路由:78.8% • 基础设施错误:0,16 FAQ DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗? 看指标。Claude Fable 5 赢 DeepSWE 上的单次尝试质量(pass@1 69.7% 对 62.8%),四发四中的任务也更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 追平、pass@4 反超(88.5% 对 84.1%),且每次 rollout 便宜 90 倍,所以在大批量或容忍重试的 agent 工作里,它是更强的性价比之选。 DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少? 在我们的运行里,DeepSeek V4 Pro 0813 每次 rollout 0.24 美元,Claude Fable 5 满血档 21.63 美元,约便宜 90 倍。按解决的任务算,Pro 每 100 美元解决 260 个,Fable 是 3 个——每美元的产出大约差 80 倍。 编码该用 DeepSeek V4 Pro 0813 还是 Claude Fable 5? 大多数编码工作,两者的差距比价格暗示的小。Claude Fable 5 领先 Rust(85 对 65)、Python、Go 和 JavaScript,赢下 8 个领域中的 6 个,领头的是数据建模与序列化。DeepSeek V4 Pro 0813 拿下 TypeScript(61 对 57)、有状态响应式,以及并发与持久化(58 对 45)——那正是 Fable 最弱的领域。 要不要在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间做路由? 要,前提是你能验证结果。两者是我们测过的所有组合里逐任务相关性最低的(0.39),合计覆盖 113 个任务中的 107 个。先跑 DeepSeek V4 Pro 0813,当测试套件否决输出时升级到 Claude Fable 5,能达到 82.7%、每个任务 8.28 美元——赢过单用 Fable,也赢过完美的一次性 oracle 路由。 DeepSWE 的 pass@k 是什么? pass@k 衡量一个任务在 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励一次做对;更高的 k 奖励能在多次尝试后最终到达方案的模型。DeepSeek V4 Pro 0813 的优势随 k 增大而扩大。 原文: #DeepSWE# #AI编程# #LLM评测#
显示更多
历史数据表明八月到九月是过去37年中标普500指数表现最弱的两个月,而八月到十月则产生了最弱的平均三个月回报。 今年也恰逢四年周期的第二年(中期选举年)。 未来的三个月要降低回报预期。
显示更多
推荐这个项目,shadcn(shadcn/ui 作者)做了一个 Agent Skill——让最贵的模型做审计和规划,让便宜的模型写代码。这个想法本身不新,但 shadcn 把它做成了一个可安装、可编排、带执行闭环的系统,每个设计决策都很实用。 shadcn/improve:一个 Agent Skill,让最强模型做审计,让便宜模型写代码 核心理念:把智能会累积的那部分——理解代码库、判断什么值得做、写规格——交给最强的模型。执行交给便宜的模型。这个 skill 自己从来不实现任何东西。计划就是产品。 /improve → 全局审计 → 优先级排序的发现 → 计划 用法 /improve # 全局审计 /improve quick # 快速:热点 + 最高优先级 /improve deep # 详尽:每个包、每个类别 /improve security # 关注审计(还有 perf, tests, bugs...) /improve branch # 只看当前分支改了的部分 /improve next # 产品方向建议 /improve plan <描述> # 跳过审计,直接起草一个计划 /improve review-plan <文件> # 批判和收紧已有计划 /improve execute <计划> # 派便宜执行器,审查其工作 /improve reconcile # 刷新 backlog:验证、解锁、退役 内部流程 勘查。 映射仓库:技术栈、规范、准确的构建/测试/lint 命令——这些变成每个计划的验证门。同时读取设计文档(ADR、PRD、CONTEXT.md 等),让已决定的 tradeoff 不再被重新标记。 审计。 并行分派子 agent 跨 9 个类别:正确性、安全性、性能、测试覆盖、技术债务、依赖和迁移、DX、文档、方向。每个发现带 file:line 证据、影响、努力和置信度。 审查。 子 agent 会过度报告,所以 advisor 在给你看之前重新读每个引用的位置——假阳性被丢弃,错误归属被纠正,驳回被记录。 优先级排序。 发现按杠杆排序(影响 ÷ 努力,按置信度加权)。你选哪些变成计划。 计划化。 每个选中的发现一个文件,写入 plans/,带索引、优先级顺序和依赖图。 什么让这些计划可执行 计划是为最弱的合理执行者写的——一个从未见过 advisor 会话、可能小得多的模型。三个特性承载这一点: 自包含。所有上下文内联:精确文件路径、当前状态代码摘录、带示例文件的仓库规范、已验证的命令。没有"如上所述"。 验证门。每一步以命令及其预期输出结束。完成标准机器可检查。执行者永远不需要判断自己是否成功。 硬边界。明确的范围外列表,加上 STOP 条件——"如果 X,停止并报告"——而不是让小模型在现实不匹配计划时即兴发挥。 闭环 execute:派更便宜的执行器子 agent 在隔离 git worktree 里,把计划交过去,然后像 Tech Lead 一样审查——重新跑每个完成标准、检查范围合规、读 diff 对意图。通过(批准,合并始终由你决定)、退回修改(最多 2 轮)、或阻塞并精炼计划。 reconcile:验证 DONE 计划是否仍成立、调查 BLOCKED 计划并绕过障碍重写、刷新漂移的计划、退役独立修复了的发现。 --issues:把计划发布为 GitHub issues。 硬规则 从不修改源代码。唯一的写入到 plans/;执行器只在一次性 worktree 中编辑,合并始终是你的。从不运行会破坏你工作树的命令。从不复现密钥值。被要求实现?拒绝并指向计划(或提供 execute)。 项目: shadcn/improve #AgentSkills# #CodeAudit# #LLM架构#
显示更多
0
2
60
12
转发到社区
今天第三场:加拿大 vs 卡塔尔 昨晚本次世界杯最弱的东道主,上场被波黑逼平了,这场又遇到亚洲硬茬。 进一个球 就送 300 万美金和一辆劳斯莱斯 ,你就说加拿大压力大不大吧 。
显示更多
2026年8月19日|麦麦课堂 🤔 纳指大跌1.33%,AI硬件成了最弱一环。 为什么年内涨超两倍的美光,昨夜反而跌了7%? 🎬 订单仍在,高位获利盘却先松了手。 这是正常降温,还是AI逻辑真的变了? #美股#
显示更多
0
43
13
0
转发到社区
中国7月有效贷款需求依然低迷,企业和居民新增中长贷,双双为负,贴着过去十年最弱的下限。 当然,贷款需求弱,这将会是以后的常态。 潘功胜在6月陆家嘴论坛也已经定调,宣告中国进入“直接融资”时代(债券和股票等融资比例首次超过贷款), 并明确说“没有必要”再让贷款保持过去增速,说“降速提质”或将成为宏观运行的新常态之一” 贷款弱点就弱点吧,无所谓的...
显示更多
0
30
89
16
转发到社区
日元逼近40年低位,这是一场慢动作危机 USD/JPY 逼近160关口,触及1986年前后以来最弱水平 表面是一个汇率数字,背后是一场货币政策分裂带来的长期套利交易的极致演绎 ✍️为什么日元这么弱 核心逻辑只有一条,美日利差太大,资金必然流出日本 美联储利率3.5%-3.75%,沃什刚刚暗示年底可能还要加息。日本央行 BOJ 利率长期接近零,即便近两年试探性加息,也只是从-0.1% 走到0.5%附近,跟美国的利差依然在 300bp以上 利差存在,套利就存在,借日元、买美元资产,这个交易在过去两年创造了天量规模的日元套利头寸 carry trade ✍️日本政府为什么不能随便干预 不是不想,是代价太高 ① 干预是烧钱游戏 2022年和2024年日本财务省两次入市干预,短暂压住了汇率,但效果持续不超过几周。根本的利差逻辑没有改变,市场会重新压回去 ② BOJ加息有副作用 日本政府债务/GDP接近 260%,是全球最高水平。利率每上升1%,政府利息负担就会大幅增加。BOJ想加息保汇率,但激进加息可能引发债务危机,这是一个真实的两难困境 ③ 日元弱对出口有利 丰田、索尼、任天堂,日本制造业巨头在日元弱的时候利润换算成日元会更多,政府对适度弱势日元并不是完全反对的 ✍️真正的风险:carry trade 逆转 这才是全球市场最应该盯住的变量 全球投资者借了大量低息日元,买入美债、美股、新兴市场资产。一旦BOJ超预期加息或日元触发大规模逆转,这些套利头寸会被迫平仓,卖美元资产,买回日元 2024年8月就发生过一次小规模预演,BOJ意外加息,日元突然反弹,全球股市单日暴跌,日经指数创史上最大单日跌幅之一,那次只是「预演」 如果这次日元跌破关键心理位触发系统性去杠杆,冲击范围会比2024年8月大得多 ✍️对加密的含义 直接联系是间接的,但逻辑清晰: - 日元carry trade 逆转 → 全球流动性快速收缩 → 风险资产无差别抛售 → BTC、ETH首当其冲 - 反过来,日元持续弱势、日本居民财富缩水 → 有一部分资金会流向BTC作为日元之外的资产,这是日本散户购买BTC的历史逻辑之一 短期内,前者的风险大于后者的机会 ✍️叠加当前宏观环境 时间节点非常特殊,美联储鹰派、美元强势、美债供需恶化、中国减持美债 日元弱势不是孤立事件,是美元霸权体系内部张力集中爆发的一个侧面。黄金创新高、中国减持美债、日元创40年新低,这三件事同时发生,指向同一个深层逻辑,旧的货币秩序正在被重新定价 💡日元逼近40年低位,不是日本一个国家的问题,是全球carry trade 结构有多脆弱、BOJ政策空间有多逼仄的直接体现。真正的风险不在日元跌到哪里,而在于它什么时候突然反弹 DYOR 非投资建议
显示更多
📉 美股「9月魔咒」真的存在吗? 🔥 自1926年以来,标普500的9月平均回报为 -1.16%,上涨概率仅44.7%,是历史最弱月份之一; 可2024年涨2.02%、2025年涨3.53%,趋势强时,「魔咒」也会失灵。 📊 今年9月,中期选举、美联储路径、长债高位、地缘扰动,四件事挤进了同一个月。 🤔 历史均值撞上四重变量,这个9月,会应咒,还是破咒? #美股#
显示更多
0
41
23
5
转发到社区
突发:美国伊朗战争,已传导中国?6月份中国原油进口量同比下降-41%,至2900万吨或700万桶/日,为10年来最低。环比来看,石油进口量下降-400万吨,或-12%,达到8年来最弱水平。自2025年末峰值以来,进口量现已下降-2600万吨,或-47%。同时,伊朗石油进口量环比下降-40%,至低于80万桶/日。伊朗战争已造成历史性供应冲击,而亚洲国家如中国、日本和韩国,受到冲击最大。
显示更多