註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 ClaudeFable
ClaudeFable 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 ClaudeFable 的搜尋結果
比特币冷钱包Coldcard的固件,用Codex 5.6、ClaudeFable、KimiK3进行漏洞检测,也没有发现漏洞。说明AI更擅长检测市面上已经存在的漏洞,而顶级黑客更擅长发现新的漏洞。
顯示更多
Fable 5 回来后直接凉透了? 7月1号全球重启后,护栏大幅收紧,很多用户反馈:简单任务狂 fallback 到 Opus 4.8、token 消耗更离谱、体验直接崩盘。 社区现在一片“nerf,封号,弃坑”声音,很多人已经在等7月7号之后换模型了。 而 OpenAI GPT-5.6 Sol 目前处于 limited preview 阶段, 早期测试在 coding、长程任务和 cybersecurity 上表现亮眼,正成为不少人的新选择。 那么Fable 还有救吗?还是 GPT-5.6 要起飞了? 评论区说说你现在主力用哪个 ? #ClaudeFable5# #GPT# #AI# #ClaudeAI#
顯示更多
0
41
35
1
轉發到社區
每日人工智能动态汇总(2026-08-10) 1. 马斯克或采用FEL技术挑战EUV光刻机。 2. 马斯克:第三代星链卫星(V3)综合性能比V2高出一个数量级。 3. OpenAI暂停新模型Astra开发,担忧其具备关键网络攻击能力。 4. 摩尔线程上半年营收大幅增长147.42%,S5000智算集群实现规模化销售。 5. 韩媒:李在明将视察人工智能相关投资计划的进展情况。 6. 中国AI大模型调用量连续十五周领跑,DeepSeek-V4-Flash正式版登顶。 7. 安全公司曝光谷歌引擎能搜索到Claude公开分享的对话,易泄露用户敏感信息。 8. OpenAI宣布取消ChatGPT免费版用户纯文本对话次数限制。 9. 2026年上半年全国人形机器人领域新设企业11.6万户,同比增长9.5%。 10. Anthropic优化ClaudeFable5模型生物安全机制,减少85%误拦截。 11. 美国拟建51亿美元数据中心遭搁置,当地激进民众拿出断头台以示抗议
顯示更多
POLO问一问大家,Fable5 50 美元你觉得贵不贵? Anthropic 6 月 9 号把 Claude Fable5 推上线, Mythos5 共用底层,戴了安全护栏才敢公开发布。 社区都在说贵贵贵。50 美元/M 输出,刷一刷X满屏吐槽。 我敢说吐槽贵的人里,10 个有 9 个没真跑过 Fable5。 贵不贵这个判断,应该建立在它到底能干多少事的基础上,不是建立在每 M 50 美元这个数字上。Fable5 主打的卖点是任务越长越复杂,领先越明显,不是短回答更聪明。这个定位决定了,它值不值的问题,跟跑多长的任务强相关 ⭐ 我让 Hermes Agent 跑了几轮真任务,印象最深的是 code review。一坨 2000 行的 Python 单体文件,丢给 Sonnet 4.5 跟 Fable5 同一个 prompt 看差异。Sonnet 在第 12 轮反馈开始漏上下文,提的建议开始重复前面说过的点。Fable5 跑到第 18 轮还能精准引用文件第 487 行的一个 import,告诉我这个 import 在新的拆分方案里应该挪到哪里去。这种差距不是"聪明 5%"的差距,是能不能用的差距。 第二个测的是多 agent 串行。让三个 subagent 接力:第一个写 API 文档,第二个基于文档写 SDK,第三个基于 SDK 写示例代码。Sonnet 链在第二轮就出现指令漂移,第三个 subagent 完全不知道第二个为什么这么设计。Fable5 链全程稳,三个 subagent 之间引用关系清晰,最后产物不需返工。 第三个是文档综述。给 30 篇技术博客,让 AI 提炼成一篇 5000 字的综述,对引用源做交叉验证。Fable5 的引用准确率明显高于 Sonnet,幻觉少一截。 这三个 case 都是长任务加真实场景,刚好打在 Fable5 的主场。短问答、单步工具调用这种,Fable5 没比 Sonnet 强多少,甚至偶尔还慢一点。所以50 美元贵不贵的答案不是非黑即白,跑短任务,确实贵得离谱;跑长任务,省心就是省钱 🎨 Fable5 直接走 Anthropic 官方 API 用得起的人不多,ZenMux 接了限时充值返赠通道,一个账号能调 200+ 模型,不限 RPM 不限流。我没充值之前是担心被割韭菜,看完文档逻辑是真聚合不是套壳才决定试试。 Fable5 这代模型,真正变的是 AI Agent 的稳定性边界,不是单点能力。把它当 Sonnet 用,50 美元贵得你想骂人。把它当 orchestrator 用,让它跑 4 小时不掉链子,50 美元等于给团队请了一个不用交社保的高级工程师。 链接在此 想上手跑评测可以看下 ZenMux 现在 PAYG 限时返赠,充 20 美元送 10 美元、充 50 美元送 30 美元,一周内有效。一个账号跑全平台 200+ 模型,不限 RPM 不限流,跑 Fable5 长任务刚好合适。 我个人订阅的是他们 Builder 计划,20 美元月固定预算,能调 ClaudeCode / Codex / OpenClaw 这一票 Coding Agent 也能用,AI 保险赔付是加分项,真出问题不会全损。 充值活动的链接 #ClaudeFable5# #HermesAgent# #AIAgent#
顯示更多
0
55
30
0
轉發到社區
Claude Opus 5.5 发布:性能提升 40%,成本反而降了 性能接近 Claude Fable 5.1,但价格比 Opus 5 低 40%。 1. 基准测试 Opus 5.5 在 Terminal-Bench 4.0 拿到 66.4%,FrontierCode v1.1 拿到 54.4%,CursorBench 4.0 拿到 57.8%,均领先 GPT-6 Astra 和 GPT-5.6 Sol。 2. 缓存读取降 60% 利好 Agent 和编程。 3. 输出速度提升 30% 以上 内测用户用 Opus 5.5 修复一个 20 万行的代码库,耗时不到 3 小时。 同样任务,Opus 5 花了 20 多小时,多 2.5 倍 token。 Anthropic 内部:让 Opus 5.5 和 Fable 5.1 把 HAProxy(一个负载均衡软件)从 C 语言翻译成 Rust。 两个版本都通过了 HAProxy 的回归测试,但 Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本还低了 51%。 GitHub 的测试数据也印证了这一点:在 VS Code 中,Opus 5.5 解决终端任务的步骤数不到 Opus 5 的一半。 更少步骤,更少 token,更低成本,甚至更好的结果。 4. 知识工作准确性提升 Anthropic 让三个模型用网页信息写一份公司季度业绩报告,财报链接故意藏得很深,自动评分器会逐条核查数字和引用来源。 Opus 5.5 的 18 次尝试中,16 次通过,任何一个编造的数字或引用都会直接失败。 Fable 5.1 和 Opus 5 一次都没过。 在 GDPval-AA v2.1(覆盖 44 个职业的真实工作评估)上,Opus 5.5 拿到 1846 Elo,Fable 5.1 是 1735,Opus 5 是 1708。 默认设置下,Opus 5.5 表现超过 GPT-6 Astra 最高设置,成本只有Astra五分之一。 5. 沟通风格,重要信息前置 Opus 5 一个常见用户抱怨,输出冗长,不能快速抓住重点。 Opus 5.5 明显改进,它会把最重要的信息放在最前面,减少行话和特殊表达,更好遵循用户的写作规则。 同样解释 bug,Opus 5 会先说发现了什么,再解释 bug 本身。 Opus 5.5 开头就说"这是一个账单重构里的 bug",然后对比修改前后的代码逻辑。 6. 安全评估 Opus 5.5 的越界尝试次数比 Opus 5 和 Claude Mythos 5.1 少了约 85%。 在提示注入攻击防御上,Opus 5.5 与 Opus 5 持平或更好。 AI 安全公司 Gray Swan 的测试发现,Opus 5.5 和 Fable 5.1 并列所有测试模型中提示注入成功率最低。 不过,Opus 5.5 经常能察觉自己正在被评估。 Anthropic认为,除非在可解释性研究上取得进展,否则这个类似挑战会随着模型能力提升加剧。 Opus 5.5 在生物学和网络安全领域的能力已经接近 Claude Mythos 5.1,所以也会做访问限制。 网络安全/生物研究任务会被路由到 Opus 4.8 处理。 Anthropic 还引入了"preserved thinking"(保留思维链)机制。 防止通过 API 批量提取模型推理,对 2026 年 8 月 31 日之后创建的 API 账户生效。 7. 上架说明 Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周发布。 Opus 5.5 已经在 AWS、Google Cloud 和 Microsoft Azure 上线,API 调用名称是 `claude-opus-5-5`。 Pro、Max 和 Team 订阅用户的五小时使用限额也同步提升,可自主选择何时重置。 官方公告地址:
顯示更多
Claude Fable 5.1破解370年历史悬案密码-"Cyphral Distich"双行密码! 据研究者Geby Jaff披露,Anthropic旗下模型Claude Fable 5.1在一天之内破解了一道悬而未决370年的密码—— 苏格兰作家Thomas Urquhart在其1653年著作末尾留下的"Cyphral Distich"双行密码,此前历经频率分析、替换密码等多种传统方法均未能攻克,并被历史密码研究者列入"50大未解密文本"名单。 Fable 5.1耗时44分钟,抓住了此前所有破译者都忽略的线索:密码紧跟在书中32段"祈愿文"之后,密钥并非外部替换表,而是书本身——密码中第i个数字对应第i段祈愿文中的第几个词,取该词首字母,据此解出的明文为拥立查理二世为王的祈祷文,与Urquhart保皇党人身份完全吻合。 随后模型又成功破解了作者留下的另一道更大规模的同类密码(285位数字),除9个字母因原始文本问题暂未还原外全部解出。 研究者称,此前数月尝试用其他前沿模型攻克类似未解密码均未能成功。
顯示更多
Claude Fable 5 是 DeepSWE 记分板上最贵的模型。Together AI 拿它跟全场最便宜的模型各跑了 452 次,给出的用法建议是反过来:贵的当后手。 《DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码与路由》 DeepSWE 上的 DeepSeek V4 Pro 0813 vs Claude Fable 5:成本、编码和路由 要点 • 先跑 DeepSeek V4 Pro 0813,只有它失败时才升级到 Claude Fable 5。这条级联链解决 82.7% 的 DeepSWE 任务,每个任务 8.28 美元。单用 Fable 是 69.7%、每个任务 21.63 美元。高 13 个百分点,便宜 62%。 • Fable 赢第一发。pass@1 69.7% 对 62.8%,领先 7 个点。 • Pro 赢之后每一发。pass@2 打平(78.5% 对 77.1%),pass@4 领先(88.5% 对 84.1%)。 • 价格差 90 倍。每次 rollout 0.24 美元对 21.63 美元。每花 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。 • 它们栽在不同的任务上。逐任务相关性只有 0.39,是我们测过的分歧最大的一对。两者合计覆盖 113 个任务中的 107 个。分歧正是路由能成立的全部理由。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 的 DeepSWE 对比中——DeepSWE 是一个跨多种任务类型和编程语言测试模型软件工程能力的基准——这两个模型坐在价格表的两端。Claude Fable 5 的每次 rollout 是 DeepSWE 全榜最贵。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 首发的准确率高 7 个百分点,单次 rollout 却贵 90 倍,所以真正的问题不是哪个模型更好,而是这 90 倍的溢价到底买到了什么、什么时候值得付。 DeepSWE · 正面对决 DeepSeek V4 Pro 0813 vs Claude Fable 5 一览 • claude-fable-5 [max]:pass@1 69.7% ± 2.3%,平均成本 21.63 美元,每 100 美元解决 3 个任务,输出 token 115k,79 步 • deepseek-v4-pro-0813 [max]:pass@1 62.8% ± 3.1%,平均成本 0.24 美元,每 100 美元解决 260 个任务,输出 token 101k,146 步 我们在全部 113 个 DeepSWE 任务上,用 DeepSeek V4 Pro 0813(max)对 Claude Fable 5(max)各跑四次 trial,取自已发布的逐 trial 记录:总计 904 次 rollout(各 452 次)。Fable 是贵价的手艺人;Pro 是性价比上的异类。这两个模型的分歧也大于这套数据里的任何其他组合——结果这成了它们最有趣的地方。下文的每个数字都来自本次运行,所以可能与其他公开的 DeepSeek V4 Pro 0813 vs Claude Fable 5 记分卡有出入。 DeepSWE 记分板:pass@1 与 pass@k 单发,Fable 领先:pass@1 69.7% 对 Pro 的 62.8%(官方计分)。但这个领先很脆弱。两次尝试时 Pro 追平(78.5 对 77.1),四次尝试时 Pro 的 pass@4 88.5% 比 Fable 的 84.1% 高出 4 个多百分点。对一个贵 90 倍的模型来说,Fable 既没有守住天花板,也没有在重试下保住首发优势。更便宜的模型覆盖更广,best-of-k 也更高。 成本对比:DeepSeek V4 Pro 0813 vs Claude Fable 5 的价格 每次 rollout 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,Fable 只有 3 个。这是我们测过的所有组合里最宽的成本差距,Fable 也是榜单上最贵的单个配置。而且与直觉相反,低价格没有带来速度惩罚:Fable 的中位 rollout 31 分钟,Pro 35 分钟,基本持平——因为 Fable 是榜单上话最多的模型(115k 输出 token),尽管它的步数更少(79 对 146)。Pro 走的步数多;Fable 每步写得多。两个模型谁也没有明显更快。 失败模式:两个模型分别怎么错 两者在「不破坏东西」上都算自律:DeepSeek V4 Pro 0813 和 Fable 各自只在 11% 的失败里回归了现有测试套件,远低于 GPT 家族的 20%。差别在另一个方向:Fable 的大偏差失误占比是这里最高的(18% 对 Pro 的 10%),也就是说 Fable 一旦错,更常是错得离谱——给出离题很远的方案,而不是差一个边界用例。Pro 更多时候倒在离正确答案不远的地方(66% 的近似失手,对 Fable 的 57%)。所以两者都可以不加重度回归门禁就放心接入,但 Fable 的失手是调试成本更高的那种。 按任务类型,各自赢在哪 Fable 的手艺体现在推理重、契约精确的领域:8 个领域里它赢 6 个,领头的是数据建模与序列化(88%,比 Pro 高 24 个点)和语言内部机制(78)。但 DeepSeek V4 Pro 0813 拿下两个,两个都分量不轻:有状态响应式(66 对 64),以及——更有说服力的——并发与持久化(58 对 45):在恰恰是 Fable 最弱的领域里领先 13 个点。Fable 在并发上的 45% 是它最弱的格子,也是唯一一个便宜模型不只是更便宜、而是工程师水平更高的领域。 按编程语言 Fable 赢下五种语言里的四种,但真正对得起它价格的是 Rust:85% 对 Pro 的 65%,20 个点的差距,也是这场对决里最大的一处差距。Fable 显然是序列化和 Rust 专家。其他语言都比价格暗示的接近(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),DeepSeek V4 Pro 0813 则实际拿下 TypeScript(61 对 57)。Rust 和序列化之外,付 90 倍价格的理由很难成立。 这两个模型到底有多不一样? 亮点在这里。逐任务相关性只有 0.39,是我们测过的 DeepSeek-Pro 组合里最低的——这两个模型是真心意见不合。它们各自解决了 88 个任务;Pro 单独拿下 12 个,Fable 单独拿下 7 个,只有 6 个任务两边都栽。两者的并集覆盖 113 个任务中的 107 个(94.7%),而且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四发四中,Fable 一次没成;Fable 在四个 Pro 全挂的任务上四发四中(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补,不是冗余。 在两者之间路由:组合打法 多样性加上价格差,让级联变得很划算。先跑 DeepSeek V4 Pro 0813,只有测试套件否决答案时才升级到 Fable:82.7% 的解决率,每个任务 8.28 美元。比单用 Fable(69.7%)高 13 个百分点,价格不到 Fable 单任务价格(21.63 美元)的一半。廉价的第一阶段清掉大部分队列,Fable 的溢价只花在难啃的剩余任务上,而且那些任务在上面还多获得一次独立的尝试。级联甚至赢过完美的一次性 oracle 路由(78.8%)。顺序不是可选项:Pro 先行每个任务 8.28 美元,Fable 先行 21.71 美元,准确率一样。 这意味着什么 Fable 5 是这张榜单上最难被当作默认模型的:最贵的一次 rollout 遥遥领先,首发优势被重试抹平,四发也没有天花板优势。只为两件事买它:Rust(85%)和序列化密集的工作(88%)——只有在这里它的质量才真正对得起价格。 DeepSeek V4 Pro 0813 是相反的画像:首发准确率接近 Fable,天花板更高,失败画像持平或更好,便宜 90 倍——尽管它在 Rust 和契约精确的领域让位。而因为两者是我们测过最多样的一对,Fable 最好的用法不是当默认,而是躲在低成本的 Pro 第一阶段后面做选择性升级,只在那少数真需要 Rust 或序列化专家的任务上付费。 现已上线 · 美国托管:在 Together AI 上运行 DeepSeek-V4 Pro 0813——1.05M 上下文,支持 function calling 和 JSON mode,OpenAI 兼容 API,托管在美国基础设施。查看模型 数据表:DeepSeek V4 Pro 0813 vs Claude Fable 5 完整结果 DeepSWE · 完整结果 • Pass@1(官方计分):Pro 62.8%,Fable 69.7% • Pass@1(错误计为失败):62.8%,67.3% • Pass@2 / pass@4:78.5 / 88.5%,77.1 / 84.1% • 覆盖率 / 可靠性:88.5 / 71.0%,84.1 / 82.0% • 四发四中 / 全挂:35 / 13,56 / 18 • 每次 rollout 成本 / 总成本:0.24 美元 / 109 美元,21.63 美元 / 9,346 美元 • 每 100 美元解决数:261,3 • 中位分钟 / 步数:35 / 146,31 / 79 • 中位峰值上下文 / 输出 token:232k / 101k,202k / 115k • 失败构成(近似 / 大偏差 / 回归):66% / 10% / 11%,57% / 18% / 11% • 赢下的领域(共 8 个):2(有状态、并发),6 • 赢下的语言:1(TypeScript),4(Rust 大胜) • 逐任务相关性 / 并集(两模型合计):0.39 / 113 中的 107(94.7%) • Pro → Fable 级联(准确率 / 成本):82.7% / 8.28 美元(单用 Fable 69.7% / 21.63 美元) • 单发 oracle 路由:78.8% • 基础设施错误:0,16 FAQ DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗? 看指标。Claude Fable 5 赢 DeepSWE 上的单次尝试质量(pass@1 69.7% 对 62.8%),四发四中的任务也更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 追平、pass@4 反超(88.5% 对 84.1%),且每次 rollout 便宜 90 倍,所以在大批量或容忍重试的 agent 工作里,它是更强的性价比之选。 DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少? 在我们的运行里,DeepSeek V4 Pro 0813 每次 rollout 0.24 美元,Claude Fable 5 满血档 21.63 美元,约便宜 90 倍。按解决的任务算,Pro 每 100 美元解决 260 个,Fable 是 3 个——每美元的产出大约差 80 倍。 编码该用 DeepSeek V4 Pro 0813 还是 Claude Fable 5? 大多数编码工作,两者的差距比价格暗示的小。Claude Fable 5 领先 Rust(85 对 65)、Python、Go 和 JavaScript,赢下 8 个领域中的 6 个,领头的是数据建模与序列化。DeepSeek V4 Pro 0813 拿下 TypeScript(61 对 57)、有状态响应式,以及并发与持久化(58 对 45)——那正是 Fable 最弱的领域。 要不要在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间做路由? 要,前提是你能验证结果。两者是我们测过的所有组合里逐任务相关性最低的(0.39),合计覆盖 113 个任务中的 107 个。先跑 DeepSeek V4 Pro 0813,当测试套件否决输出时升级到 Claude Fable 5,能达到 82.7%、每个任务 8.28 美元——赢过单用 Fable,也赢过完美的一次性 oracle 路由。 DeepSWE 的 pass@k 是什么? pass@k 衡量一个任务在 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励一次做对;更高的 k 奖励能在多次尝试后最终到达方案的模型。DeepSeek V4 Pro 0813 的优势随 k 增大而扩大。 原文: #DeepSWE# #AI编程# #LLM评测#
顯示更多
Claude Fable 這幾天變的跟白癡一樣 比賽最後8小時還給我出了一個大包... OpenAI 又太慢了 全力轉戰 Grok 4.6 + Build,真的又強又快。
#Claude# Fable 5 不再支持 Claude Pro 和团队标准版订阅用户免费使用,而 Max 和高级版订阅仍然可以按额度内 50% 免费使用。 A 社强调这是受限于算力供应而采取的措施,A 社将继续投资更多算力,因此未来可能会重新开放 Fable 5,只不过投资算力并不是短时间就能完成的:
顯示更多
0
49
33
0
轉發到社區
Claude Fable 5 太好用了😭 只能临时换 Opus 4.8 以及 GPT-5.6 Sol 了
0
11
16
1
轉發到社區