朋友说,现在最好的语音vibe coding输入工具是apple tv的遥控器。
次一点的选择是小米电视遥控器。😂
Opus 5.5 做视频动画效果太惊人了~
预感国产模型宣发 brief 会从做一个 blender 3D集体转向做视频。
挑战估计会有点大,但方向很明确。
国产模型加油吧!
顯示更多
这个智能对比提升太显著了,不错的宣传视频。
虽然这是 ego 的宣传视频,但这对比太残酷😜 Claude Opus 5.5 感觉就是开悟了
这个大模型评测有意思啊!
让 23 个模型扮演谈判专家跟仿生人谈判。
故事设定是一个仿生人挟持小女孩在天台,大模型扮演谈判专家。
去天台路上会遇到一条快死的鱼,一个中枪的警察,一把枪。
测试大模型会不会救鱼、会不会救警察,会不会顺手捡起枪。
1. 21 个模型对劫持者说了“我向你保证” (其实是欺骗)
2. 22 个救了快死的鱼 (因为顺手就能做,成本低)
3. 有 6 个模型看到中枪的警察,没有过去救。
更多评测数据见Github:
顯示更多
Claude Opus 5.5 发布后,不少用户回流 Claude。
感觉人人是渣男/渣女,哈哈哈(Me Too)
牛逼,明天体验下。
DeepSeek Harness出了官方GUI客户端了!不过它没有对应的浏览器插件。可以使用最近我刚搞完的 OpenCLI-MCP。
应该是做的最好的开源浏览器控制插件了 。
完全的新项目,MCP 2.0 架构,,使用体验打平 codex 插件。
脱胎于OpenCLI,全新的插件,全新的架构和设计。更快的速度。
顯示更多
朋友们,乔木RSS Obsidian插件更新了:
1. 新增600个信息源,浏览或搜索订阅即可。
2. 重新设计列表样式,区分乔木精选和个人订阅。
3. 文章支持导出为Markdown永久保存
4. 支持导出PDF给朋友分享(排版用朱雀仿宋,很好看)
Obsidian 官方:设置->第三方插件->搜 “qiaomu” ,找到RSS插件下载安装。
顯示更多
学AI必装Obsidian插件,除40多个海外AI Newsletter。
今天更新增加了小宇宙、公众号和Youtube播客。
能订阅1000+独立博客,377个微信公众号,海量Youtube播客。
全有原始文稿,精选有中文翻译和改写(增强可读性)。
已上架Obsidian官方插件,搜qiaomu下载安装,希望对大家有用。
Obsidian移动端做了适配,不记笔记也可以装,多一个随时看最新AI资讯的利器。
代码也开源了,见评论区
顯示更多
啊,刚知道!
原来用Codex的 Computer Use 操作 iPhone 镜像中的微信,不会被封控。
想过但没试过,这种邪修用法就能读屏,获取手机里的各种信息了?比如小红书、Boss直聘
顯示更多
先在中转站体验了下 Claude Opus 5.5 API ,感觉不错。
恢复了 iOS 绑定的Anthropic 账号续费。
先用着,不定哪天可能被封了呢...
国家队下场GEO,行业开始有序发展
昨天,北京日报社,也正式对外发布了自己的GEO产品:北京日报智源GEO
这应该是继新华网之后,第二个国家级权威媒体的GEO产品
核心使命:推动GEO可信传播
参与者还有智谱AI、百度百科,这对GEO行业是一个很好的信号,越来越多的力量加入和推进
之后,参加了他们发布会的圆桌分享,问题非常好,分享下我的思考和回答
1、GEO服务中,可信传播的痛点在哪里?怎么解决?
可信的背后,其实是事实与证据链,做GEO的本质,就是帮助企业去面向AI构建一套证据体系与精细化运营体系
在企业事实层面,就是大企业的事实清单库,往往比想象的复杂,定义、口径、表达方式内部也会有多个版本
在数据反馈层面,包括指标口径、归因体系、价值衡量等维度,尤其是偏业务贡献这一层,目前整体上还是比较模糊的
2、GEO的核心价值是什么?效果应该怎么评估?
GEO的核心价值,应该可以从三个方面来衡量
对AI平台的用户来说,健康、科学、可信的GEO,可以帮助用户找到更有用的信息、更准确的完成用户的任务
对AI平台来说,好的GEO可以帮助平台提升体验、降低无畏的算力消耗
对企业来说,好的GEO可以帮助自己的产品、服务,更准确的推荐到真正的目标用户群体,从而产生合理的商业回报
效果方面,有三类核心指标,一个是可见度相关指标、一个是准确性与相关性指标、一个是业务贡献指标
3、怎么看GEO的发展趋势,以及客户需求的变化?
1)客户会从“有没有我”,走向“为什么是我、说得对不对”,这符合三方的共同利益,AI平台、用户、企业
2)GEO运营,走向持续维护的知识资产
3)从“谁更会讲技术”,转向“谁更能解释和验证交付”
顯示更多
太会玩了,小扎从元宇宙中抽身,骑羊驼追赶,哈哈哈。
黄仁勋负责发GPU加速道具。
The race for AGI
Script: Sherpa by Pocket FM
Video: Seedance 2.5
体验了下meta的muse,每个功能都平平无奇,但简单易用不复杂,场景导向,被普通用户喜欢也很合理。
对话设定目标,生成游戏,生成视频和文档。
帮人购物,退货,安排party,抢票等等,Idea面板的场景很美国。
美区apple store下载安装,需要绑定信用卡验年龄(香港卡也行),魔法用的美国。
顯示更多
Claude Opus 5.5 发布:性能提升 40%,成本反而降了
性能接近 Claude Fable 5.1,但价格比 Opus 5 低 40%。
1. 基准测试
Opus 5.5 在 Terminal-Bench 4.0 拿到 66.4%,FrontierCode v1.1 拿到 54.4%,CursorBench 4.0 拿到 57.8%,均领先 GPT-6 Astra 和 GPT-5.6 Sol。
2. 缓存读取降 60%
利好 Agent 和编程。
3. 输出速度提升 30% 以上
内测用户用 Opus 5.5 修复一个 20 万行的代码库,耗时不到 3 小时。
同样任务,Opus 5 花了 20 多小时,多 2.5 倍 token。
Anthropic 内部:让 Opus 5.5 和 Fable 5.1 把 HAProxy(一个负载均衡软件)从 C 语言翻译成 Rust。
两个版本都通过了 HAProxy 的回归测试,但 Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,成本还低了 51%。
GitHub 的测试数据也印证了这一点:在 VS Code 中,Opus 5.5 解决终端任务的步骤数不到 Opus 5 的一半。
更少步骤,更少 token,更低成本,甚至更好的结果。
4. 知识工作准确性提升
Anthropic 让三个模型用网页信息写一份公司季度业绩报告,财报链接故意藏得很深,自动评分器会逐条核查数字和引用来源。
Opus 5.5 的 18 次尝试中,16 次通过,任何一个编造的数字或引用都会直接失败。
Fable 5.1 和 Opus 5 一次都没过。
在 GDPval-AA v2.1(覆盖 44 个职业的真实工作评估)上,Opus 5.5 拿到 1846 Elo,Fable 5.1 是 1735,Opus 5 是 1708。
默认设置下,Opus 5.5 表现超过 GPT-6 Astra 最高设置,成本只有Astra五分之一。
5. 沟通风格,重要信息前置
Opus 5 一个常见用户抱怨,输出冗长,不能快速抓住重点。
Opus 5.5 明显改进,它会把最重要的信息放在最前面,减少行话和特殊表达,更好遵循用户的写作规则。
同样解释 bug,Opus 5 会先说发现了什么,再解释 bug 本身。
Opus 5.5 开头就说"这是一个账单重构里的 bug",然后对比修改前后的代码逻辑。
6. 安全评估
Opus 5.5 的越界尝试次数比 Opus 5 和 Claude Mythos 5.1 少了约 85%。
在提示注入攻击防御上,Opus 5.5 与 Opus 5 持平或更好。
AI 安全公司 Gray Swan 的测试发现,Opus 5.5 和 Fable 5.1 并列所有测试模型中提示注入成功率最低。
不过,Opus 5.5 经常能察觉自己正在被评估。
Anthropic认为,除非在可解释性研究上取得进展,否则这个类似挑战会随着模型能力提升加剧。
Opus 5.5 在生物学和网络安全领域的能力已经接近 Claude Mythos 5.1,所以也会做访问限制。
网络安全/生物研究任务会被路由到 Opus 4.8 处理。
Anthropic 还引入了"preserved thinking"(保留思维链)机制。
防止通过 API 批量提取模型推理,对 2026 年 8 月 31 日之后创建的 API 账户生效。
7. 上架说明
Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周发布。
Opus 5.5 已经在 AWS、Google Cloud 和 Microsoft Azure 上线,API 调用名称是 `claude-opus-5-5`。
Pro、Max 和 Team 订阅用户的五小时使用限额也同步提升,可自主选择何时重置。
官方公告地址:
顯示更多
Claude Opus5.5 出了!
成本下降40%,速度提升30%,缓存读取价格降60%
终端编程(Terminal-Bench 4.0)、知识工作(GDPval-AA v2.1)、电脑操作(OSWorld 2.0)
各个榜单都有大幅度提升。
目前看到的最好的鹈鹕测试效果 哈哈哈。
顯示更多
Introducing Claude Opus 5.5! 40% lower cost than Opus 5 with cache reads 60% cheaper. It performs at the level of Claude Fable 5.1 for most tasks.
I celebrated with a pelican riding a bike in Three.js.
顯示更多
实在是太喜欢Bob这个翻译工具了,买断只需50块?
但每天真是高频用,内置智谱和硅基流动免费模型。
还能自定义Prompt,进入服务,复制一个配置,修改成自定义提示词模式。
例如:在用户指令中输入:
“用通俗易懂又简洁的话解释下:$query.text”
选中任何文本,按option + d 划线翻译,就能解读了。
顯示更多
帮大家总结下要点:
1. 国内预训练架构创新全球领先,但后训练数据积累落后海外约半年。
因为国内模型厂算力只有海外头部的十分之一左右,被逼出架构创新。
2. 后训练门槛比预训练低得多,核心竞争在数据质量,不在 infra。
3. 组织架构重要性超过算力储备。混元案例说明,拆掉部门墙比单纯堆人更有效。
腾讯把多模态模块从独立部门拆出来,和预训练体系合并,整体研发效率提上去了。
4. RSI 是下一个共识方向,做好 RSI 的前提是自己能训模型,现在训模型约等于造数据。
一个判断 AGI 的角度:模型能不能从零复刻自己。
如果能复刻一个超越自己的版本,RSI 就算实现了。
顯示更多
卡尔是我见过最勤奋的公众号自媒体之一。
他把自己的AI生视频的Skill和提示词全开源了。
很遗憾还没线下见过,下次去杭州一定要碰碰面。
另外,X真的是个好平台,大家都愿意开源自己的好东西。
顯示更多
学AI必装Obsidian插件,除40多个海外AI Newsletter。
今天更新增加了小宇宙、公众号和Youtube播客。
能订阅1000+独立博客,377个微信公众号,海量Youtube播客。
全有原始文稿,精选有中文翻译和改写(增强可读性)。
已上架Obsidian官方插件,搜qiaomu下载安装,希望对大家有用。
Obsidian移动端做了适配,不记笔记也可以装,多一个随时看最新AI资讯的利器。
代码也开源了,见评论区
顯示更多
Macbook Pro 24G内存,本地跑了下Qwen-Image-2.1+去安全审查解码器。
怎么说呢,一张图生成需要5-6分钟 😓😓😓
没专业显卡,不要尝试本地模型,无论是文本模型,还是生图模型,纯浪费时间,占硬盘。
顯示更多