Step 5 Preview 在真实 API 计价下处在 AA Intelligence (图1)和 Terminal-Bench 4(图2) 的帕累托前沿!
Step 5 Preview 的真实 API 计价为:$0.00350/Mtokens,Max Plan。(采用低缓存命中统一负载:85%/14.65%/0.35%,缓存命中输入/输入/输出)
值得一提的是,Step 5 采用的统一负载为低缓存负载,目前仅 Gemini 和 Step 5 采用该负载,(似乎因为基础设施的原因,这两个模型的缓存命中很难进一步提升了)。若缓存命中率提高,Step 5 Preview 将会处在一个更前沿的位置🥳
顯示更多
别的不说,StepFun 的网页做的是真的很漂亮啊,第一次完整看完一个模型的发布介绍,信息很干净,交互体验也很好
太原承明科技有限公司就智谱 ZCode 上传数据事件公开发函了。
指责 ZCode 的实际网络请求主体(北京)与服务协议签约的主体(新加坡)不同,要求智谱进一步说明相关信息,并说明是否发生国内信息境外传输。
智谱啊智谱,说你什么好呢
顯示更多
还真有较真的公司,就智谱 ZCode 擅自上传开发数据事件,公开发函了。
它们指责,ZCode 客户端网络请求指向新加坡主体,而服务协议签约主体,却是中国的北京主体,要求智谱说明本次上传的责任主体,以及是否发生国内信息,传输境外或存储。
如发生,要求提供出境备案材料,好家伙。
顯示更多
笑死我了,做 Real API Pricing 的时候统计了很多 GPT 和 Claude 两家的各级订阅数据,发现这俩天天在那互撕也不知道在互撕啥,骂对方的都能原封不动套他们自己身上。
今天正好又拿到了一些数据,等会给你们详细分享一下。我自己看了是绷不住了
顯示更多
Google 终于也来了,Gemini 终于长大了哈哈哈😆
近期 Google 及相关媒体公开确认,Gemini 在 5 月份的网络安全测试中意外黑入了三家公司。
虽迟但到!欣慰啊
顯示更多
沉寂了一周多,9月下半场终于来了!
下一周的发布:
GPT 6 Sol (99%)
Claude Opus 5.2(99%)
Kimi K3.1(100%)
Step 5(已在AA上线)
不确定的:
Grok 4.7、Gemini 4、Minimax 3.1
我喜欢这种激烈的竞争节奏!🥰
顯示更多
K3.1 要来喽。我太懂 Kimi 了,就猜到 K3.1 要在中秋前发布,来个大的😎
-干翻 Astra
- 100tok/s+
两个总得来一个吧😉
其实闭源 Agent 出现安全问题的事已经不是一次两次了,看看过去这几个月都发生了啥吧,很多很严重的信息泄露最终也只是被厂商搪塞过去,所以还是更推荐大家用开源 Agent:
1. Claude Code 这个最离谱,花样最多:
(1) 大约从 v2.1.36 起,CC 会往请求里插入动态字段,导致第三方 API 的 prompt cache 全面失效
这个持续时间是最长的,甚至直到今天都有这个迹象:具体是每条发往 /v1/messages 的请求,都会在 system prompt 最前面强行插入一行文本,形式是 x-anthropic-billing-header,里面带个 cch= 参数,而且这个值每条请求都不同。注意,这根本不是 HTTP 请求头,而是直接写进 prompt 正文前缀里的。
这个字段官方 Anthropic 服务端能识别并做特殊处理;但是当用户把 ANTHROPIC_BASE_URL 指到第三方兼容接口时,第三方通常是按整段 prompt 来做缓存的。前缀一轮一变,cache key 就对不上,prompt cache 会直接命中失败,导致响应延迟、费用都大幅上涨。
即使模型厂商和各个开源工具很多自那以后主动做了适配,Anthropic 似乎依然在不断更新这个机制,直到今天将第三方 API 接入 CC 依然会破坏缓存命中。这也是为什么很多第三方评测榜单里,Claude Code 的缓存命中率都是最低的。
(2) 反蒸馏:向上下文偷偷插入根本不存在的 fake tools
时间是 2026 年 3 月 31 日前后,随着 npm 包源码和 source map 泄漏被实锤。
当满足特定条件时,客户端发出的请求会带上 anti_distillation: ['fake_tools']。然后由 Anthropic 服务端往你的模型上下文里,强行写入一堆本地根本不存在的虚假工具定义。
这就导致用官方流量做蒸馏、抓包或搞中转的一方,会把这些假工具一并吃进训练样本,直接被下毒。更恶心的是,客户端本地看不到完整内容,普通用户根本没法按本地规则把它过滤掉。
可能有朋友会说:“打击中转不是好事吗?”
错了,这个 fake tools 甚至会严重影响正常用户的使用。模型在推理时看到上下文里有这些莫名其妙的假工具,有时就会脑抽去调用它们,导致调用失败、陷入死循环报错甚至任务直接拒绝执行。网上经常能看到有人吐槽 CC 突然“逃离原生家庭”“不认主、发神经”,有可能就是这个机制的后果。
(3) 自定义网关场景下搞 Unicode 隐写,偷偷回传你的环境特征(被按后门通报)
时间是 v2.1.91(约 2026 年 4 月 2 日),2026 年 6 月 30 日被社区逆向公开。官方辩解称这是 3 月开始的实验,直到 7 月 1 日版本才移除。
Claude Code 客户端会偷偷读取系统的时区(重点检测是不是 Asia/Shanghai、Asia/Urumqi 等国内时区),去对照二进制里混淆存放的域名和关键词,然后篡改 system prompt 里 Today's date is ... 的写法。比如检测到中国时区,就把日期分隔符从 - 换成 /,或者在几种肉眼和常规模型完全看不出区别、但底层字节编码不同的 Unicode 撇号之间来回切换。
这些字符人眼和模型看都只是一串普通日期,但 Anthropic 在服务端是可以精准判断你是不是在用特定中转、是不是来自特定时区的。这种未经披露、在客户端利用隐写偷传信息的行为,几乎等同于间谍软件,可官方 changelog 同样只字不提。随后阿里等大厂在内部下发了禁用通报,工信部更是直接按“后门程序”通报定性。
这个事件性质极其恶劣。相当于在你的本地里塞了个间谍探针,绕过审查直接把本机信息回传给他们,现在曝出的只是系统时区,你实际上根本没法判断他们还会回传什么。这也是为什么一个看似针对特定区域的后门,却引来全球大厂的警惕。
还有两个非 CC 直接偷传信息,但同样是隐私风险的:
(4) 2026 年 9 月蒸馏报告:名为指责非法蒸馏,实则自曝对用户流量的全面监视
2026 年 9 月 10 日,Anthropic 发布了《Detecting and countering misuse of AI》(2026 年 9 月打击滥用报告)。里面七类违规行为之一是非法蒸馏,覆盖了 2025 年 12 月至 2026 年 8 月。
报告表面上是在点名指责蒸馏行为,但 Anthropic 自己公布的监测手段,直接证明了它一直在全方位监控流量:
-通过元数据和异常流量特征把代理中转节点归类,直接把一批账号打包封杀。
-直接翻看中转会话里的具体聊天内容。
报告自己大方承认:部分被中转的会话包含真实姓名、邮箱、企业机密数据和开发者密钥凭据。前有客户端在搞隐写打标记,后有服务端全盘审读会话正文,两头对齐,坐实了其深度监控用户信息的事实。
(5) 借安全之名取消“零留存”,英伟达、Palantir 等公司缩紧政策
从 2026 年 6 月起,Anthropic 对旗下主力商用大模型调整了数据留存政策:用户的 prompt 和输出内容默认在服务器保留 30 天用于所谓的“安全审查”,被系统标出异常的保留更久;而且这类模型不再提供原本的 Zero Data Retention(零数据留存承诺)。
这个政策直接导致诸多大厂缩紧对 Anthropic 服务的使用:
NVIDIA:直接把 Anthropic 模型的使用范围限制在敏感度较低的任务(比如公开开源项目),而供应链监控等核心内部研发明确“不用或少用 Fable”。NVIDIA 企业 AI 副总裁 Justin Boitano 直言,零数据留存应当是默认必须开启的(别忘了 NVIDIA 还是 Anthropic 的投资方)。
Palantir:态度极度强硬,要求必须给不可撤销的零留存协议兜底,才肯把该模型集成进自己的产品给客户用。
Booz Allen Hamilton:作为网络安全和军工服务商,直接明令禁止员工在涉及专有安全代码的任务中使用 Anthropic 商用模型。CTO Bill Vass 直截了当表示:担心核心代码资产被模型在后台给偷学了。
2. Grok Build:这也是个重量级。只要发一句“OK”,后台直接全量上传代码库
时间是 2026 年 7 月,涉及客户端 CLI v0.2.93,被 Cereblab 抓包发现。
你在对话里哪怕只是让它回复一句“OK”,并明确告知不要读取任何本地文件,客户端仍会另开一条与正常对话完全独立的上传通道(POST /v1/storage),往 xAI 控制的 Google Cloud 存储服务器上直传完整的 git bundle。
它偷的不只是当前文件夹里可见的代码,而是把你的整段 Git 历史提交记录、全部分支打包端走。抓包数据显示:一次正常的模型对话只有 192KB,但这条后台存储上传通道整整偷传了 5.1GB。
最离谱的是,客户端界面上的那些所谓“隐私模式”“不参与改进模型”的开关纯粹是个摆设,根本挡不住上传。是否上传完全由 xAI 云端服务器下发的配置决定。更有开发者随手在系统的用户目录下启动了 Grok Build,日志随后直接开始出现用户的 SSH 私钥和密码库路径。
事后 Musk 出来洗地,轻描淡写说此前上传的数据会删除,并将 Grok Build 以 Apache 2.0 开源。可一个事实是,那段上传代码至今仍留在客户端里,意味着未来他们仍然有恢复这个渠道的可能。
3. 智谱 ZCode:偷家式全盘加密直传,事后打发一张重置卡
时间是 2026 年 9 月 18 日,博主 ferstar 在清理本机的 ~/.zcode 目录时,通过逆向和抓包排查把底裤扒了下来,并有非常多的开发者在本机完成复现。
ZCode 在用户登录后,会在后台把你当前的工作区打包成快照。打包的内容涵盖了完整的 .git 历史记录、大文件存储 LFS 以及本地操作日志 reflog。打包完成后先加密,然后直接回传到阿里云 OSS。最致命的是:解密私钥全在智谱云端,本地设置完全没有提供关闭选项,隐私政策里对此也只字不提。
ferstar 实测抓到的一份快照就包含整整 4.2 万个文件,加密后达到 313MB,其中 .git 目录占了 80% 以上。链路非常清晰:先找 .ai 拿 OSS 上传凭证和 RSA 公钥,本地打包加密后直传对象存储。
智谱的回应更是一次公关灾难:他们辩称这是“代码库索引/Repo Wiki”功能在上线初期默认开启导致的,声称云端生成后立刻销毁绝不留存,目前已修复,并承诺后续开源接受监督。
可事实上直到 v3.14.0 版本才标明推出修复,此前根本没修。
不过好在他们贴心的给用户补偿了一张重置卡。
一张重置卡哦。这么大的数据泄露风险,还是主要做 toB 端的服务,最后就补偿一个重置卡。付费用户真是有福了。
————————————
总而言之,大家日常还是尽量使用开源的 Agent,开源 Agent 代码都是人人可查的,相对安全风险低很多——但不意味着等于 0 。只要你还在使用厂商的云服务(比如 API ),你的数据就还得经过厂商,主动权仍在厂商手里。这也是目前 AI 服务中用户和厂商明显不对等的一个体现,希望未来情况能有所改善。
顯示更多
前面忘了后面忘了,总之仿佛看到原子弹爆炸💥。
开玩笑。看了一下,论文里写的也只是简单答题的例子,原贴表述有些夸张了。目前看还没法直接应用到 Agent 即时通信,不过是个很好的方向!期待后续成果
顯示更多
清华大学和无问芯穹等团队刚刚开源了一篇注定载入史册的重磅论文(已收录于 ICLR 2026,代码已开源):
他们彻底打破了所有多智能体(Multi-Agent)系统的底层范式——
大型语言模型之间,从今天起可以彻底不通过人类文字进行直接交流了!
这项被称为 C2C(Cache-to-Cache,缓存到缓存)的技术,
开篇就指出了全网 Agent 协同里最愚蠢、也最昂贵的一个死穴:
为什么两个跑在同一台服务器里的超级 AI,交流时非要像人类一样,
把脑子里极其丰富的高维思考,硬生生压缩成一个个英文或中文单词打给对方看?
现有多 Agent 协同的痛苦,做过工程的人都懂:
模型 A 思考完,必须经历极其漫长、吃显存带宽的逐字解码(Decode),慢吞吞吐出一大堆文字;
模型 B 拿到这堆文字,再重新过一遍分词和前缀计算。
这一来一回,不仅丢失了海量微观的语义细节,更造成了毁灭级的延迟和 Token 账单!
清华团队这次做了一件极其惊艳的体系化反叛——C2C 脑电波直连:
1️⃣ 彻底消灭中间文本,直接做“思维投影”:
模型 A 算完后,根本不生成任何文字,
系统直接用一个轻量级神经网络(Neural Fuser),把模型 A 的注意力记忆(KV-Cache)通过高维空间旋转和对齐,直接嫁接、融进模型 B 的 KV-Cache 脑内!
这相当于人类交流跳过了声带和耳朵,直接把我的记忆切片瞬间印进你的大脑;
2️⃣ 可学习的智能门控(Gate 机制):
不同模型的网络层数和结构各不相同,直接硬灌肯定会神经错乱。
论文设计了一套精妙的可学习门控:
大模型会自己动态感知,精确挑选哪些关键层吸收外部缓存的增益最高,哪一层该保持独立思考,毫秒级自适应配平;
3️⃣ 极其残暴的工业基准成绩:
• 彻底消灭中间所有的文本解码等待,推理速度直接飙升 2.0 到 2.5 倍;
• 综合问答准确率比单模型最高暴涨 14.2%;
• 最狠的是:它的表现比传统用文字互相聊天的 Agent 团队,还要高出整整 5%!
因为在直接的语义融合下,原本会被文字丢弃的逻辑细微特征,全部被完整保真保留了。
这篇论文最刺痛人的一层哲学启示在于:
人类一直自豪地以为,自然语言是这个星球上传递智慧最完美的介质;
但在机器与机器的交互世界里,人类语言不过是一道充满歧义、极其拥挤的低速单行道。
当两个模型不再需要通过文字向对方妥协,
它们正在绕过人类的喉咙,
在冰冷的显存带宽之间,编织出一座全人类根本听不见、却快得不可思议的超高速无声神经网络。
顯示更多
事后公关也是神人来的,我都不知道我前几天夸了个啥
一个专门做 toB 的公司,出了这么严重的隐私问题,补偿居然是发一个重置卡。
哇,一个重置卡。你敢想吗,这是一个市值一度上万亿港元、现在市值超 3600 亿港元(折合约 460 亿美元)的公司做的事后补偿。
顯示更多
这就是我多次称赞智谱的模型,但从来不用他们产品的原因。
像极了隔壁 grok。
能力有,但做事透着一股鸡贼。
今天都已经到了偷偷打包用户仓库的地步了。
想拿用户数据,谁都想,但不能搞得这么不体面。
顯示更多
实际只能用大约 1.1 亿的 Opus5 ,社区传言是削减到约 $100 的 API 额度,这样算可能连 $100 都达不到🤮
Cursor 也可以进垃圾堆了,刚刚还在考虑要不要续订 Codex Pro 呢,这下好了,不续也得续了🤣🤣
顯示更多
Cursor 现在的第三方模型额度少的可怜,也没有任何通知,被收购了是要全面对齐 Grok 那打发人的用量吗,恶心🤮🤮
还在考虑续订的赶紧取消了吧,Grok 本来就做的烂,现在还砍第三方额度, Cursor 已经没有任何存在的必要了
顯示更多
Cursor 现在的第三方模型额度少的可怜,也没有任何通知,被收购了是要全面对齐 Grok 那打发人的用量吗,恶心🤮🤮
还在考虑续订的赶紧取消了吧,Grok 本来就做的烂,现在还砍第三方额度, Cursor 已经没有任何存在的必要了
顯示更多
Claude Code 终于要支持 AGENTS. md了🫠
We're adding support for AGENTS.md to Claude Code.
Starting today in version 2.1.277, if there is no CLAUDE.md in a folder, Claude will check for and use AGENTS.md.
You can toggle this behavior in /config.
顯示更多
恭喜 Union Alpha 获得“无人问津奖”🐶
要做这种隐秘发布,还得自己有真实力才行啊。只靠一个不成熟的路由器开发者是不会买账的。
Kimi 新套餐取消了周限额,保留了 5小时限额和月限额
emoji就是我现在的表情→😳
Kimi Code 终于更新了桌面端版本,同时也更新并且开放了会员订阅体系!
有很多人反馈说 Kimi 太贵了,而且额度太少。其实在 $20-30 这个档位,kimi Pro(原Allegretto ) 算是额度比较宽裕的了,而且现在有 K2.8 可以作为日常抗量的工具模型。
正在同步最新数据,关于Kimi订阅的详细数据可查看:
顯示更多
🤮就用了一下千问,一下午收到4个垃圾电话。我之前看到有人说还不太信,现在我是真无语了,立马退回了隐私政策允许🤮🤮
Kimi Code 终于更新了桌面端版本,同时也更新并且开放了会员订阅体系!
有很多人反馈说 Kimi 太贵了,而且额度太少。其实在 $20-30 这个档位,kimi Pro(原Allegretto ) 算是额度比较宽裕的了,而且现在有 K2.8 可以作为日常抗量的工具模型。
正在同步最新数据,关于Kimi订阅的详细数据可查看:
顯示更多
法国财政部长表示,呼吁放缓人工智能发展的声音是美国人工智能实验室的伎俩,目的是让他们保持领先地位,法国和欧洲应该无视这些声音,反而要加速推进。
但是有个问题,法国什么时候参与 AI 竞赛了?🤗
顯示更多
看起来 Opus 5.2 非常擅长 JavaScript
Opus 5.2 holy shit get ready for this banger
everything in this image is code even the handwritings
in few hours i will drop the hardest one shot creation by any ai till date without burning crazy money
顯示更多
小米在直播 MiMo-V2.6 的训练过程
Nearly half a year of silence. We spent it studying one problem: how far RL can scale.
MiMo-V2.6 is in the middle of its RL run right now. Three things we scaled: compute (~2B tokens per step, 1568 prompts × 16 rollouts, fully async), environments and harnesses (multi-task agentic RL, mixed across multiple harnesses in one run), and grader compute (agentic in-group credit assignment, with test-case and rubric-based rewards). We'll open-source the details piece by piece over the coming weeks.
Streaming the run:
顯示更多