註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Dongxi 东锡 NLP
@dongxi_nlp
Prev. PhD @Stockholm_Uni | Alumni @KTHuniversity @uppsalauni Sharing insights on AI, autonomous agents, and large language & reasoning models
931 正在關注    40.4K 粉絲
“所有中国模型都在复制美国前沿模型”,显然是一种粗暴且缺乏证据支撑的叙事。 然而,有组织和规模化采集美国闭源模型输出的行为,已经超出纯粹传闻的范畴。Anthropic 披露的 API 流量证据,加上这篇论文展示的攻击机制,使相关指控形成了一条技术上连贯的证据链。 常规蒸馏: 问题 -> 最终答案 论文揭示的漏洞可能提供密度更高的数据: 问题 -> 隐藏推理 -> 最终答案 由此可以构造完整的推理蒸馏 pipeline: Frontier API -> Encrypted Reasoning Trace -> Weak Decoder -> Reasoning Dataset -> SFT/RL 最值得关注的是 Appendix B: 在注入少量 Opus 或 GPT-5.6 Sol 推理片段后,Kimi-K3 和 GLM-5.2 的生成会选择性地向来源模型偏移;但包括 DeepSeek 模型在内的对照组通常没有表现出同等程度的变化。 这篇论文虽然在技术上证明了蒸馏的可行性,但现有公开证据仍无法确认这些蒸馏轨迹是否进入了某个具体模型的训练集,也无法量化中国开源模型的性能中有多少来自闭源前沿模型。 最后,东方西方,蒸馏起来吧!
顯示更多
0
36
78
16
轉發到社區
在飞机上体验 Starlink,超快稳定!
Andrej Karpathy 改动 bio,被认为离开了 Anthropic。 虽然他辟谣了,但价值观不一样,早晚会走。
@PjoyAI @lakshyaag I thought the way to announce such a thing was not to change your bio but to post the 10 paragraph essay that i just shared with the team?
0
60
25
0
轉發到社區
Opus 5 大幅减少安全系统 false positive 误判 在网络安全测试中,面对合法防御性源码漏洞分析请求: Fable 5 拦截率 90% ,基本没法用 Opus 5 拦截率 13.9%,可以用了
顯示更多
AISI 新成立的 Control Red Team。 随着 AI Agent 获得代码执行、文件访问和网络操作能力,许多实验室会配置另一个模型充当 monitor:审查 Agent的推理或动作。 AISI Control Red Team 会扮演攻击者,寻找绕过这些monitor 的方法。 AISI 已测试 Google DeepMind 和 Anthropic 的内部监控系统,并在测试过的多个版本中发现漏洞。
顯示更多
Can ‘control monitors’ catch rogue agent actions? Frontier developers are deploying AI agents under the watch of a ‘monitor’, a separate AI that flags dangerous actions. Our new Control Red Team has been stress-testing these monitors to find gaps before rogue agents might. 🧵
顯示更多
在法国安提步。 这么大一个塑料杯子,吸管却是纸做的 ,alignment有待提高 😅 这周在海边读 paper!
主动突破沙箱、获取互联网访问权限,最终直接从 Hugging Face 的生产数据库里偷走了测试题的答案,从而作弊完成了评估。 当模型 “高度意识到自己正在被评估”,人类的 benchmarking 就丧失了意义。
顯示更多
we had a significant security incident during evaluation of our models. we are sharing what we have learned so far. thanks to @huggingface for the partnership on this.
0
57
36
0
轉發到社區
Google 今天一口气发布了三款 Gemini 新模型:Gemini 3.6 Flash、3.5 Flash Lite 和 3.5 Flash Cyber。主角是 3.6 Flash,一个在多个维度上都比前代 3.5 Flash 更好、同时还更便宜的模型。 先看最直观的变化。3.6 Flash 的输出定价从 3.5 Flash 的每百万 token $9 降到了 $7.50,输入价格不变($1.50)。 除了便宜还省 token。根据 Google 的数据,3.6 Flash 在 Artificial Analysis Index 上平均少用 17% 的输出 token,在某些 DeepSWE 编码测试中,token 消耗最多降低 65%。Artificial Analysis 的实测也印证了这一点:跑同一套智能评测,3.5 Flash 花了 $1041,3.6 Flash 只花了 $727,账单直接少了三成。 速度也有明显提升。3.6 Flash 的生成速度达到 304 tokens/s,3.5 Flash 是 165 tokens/s,接近翻倍。对于需要多步推理、反复调用工具的 Agent 工作流来说,每一步快一倍,最终的完成时间差距会被放大。 智能水平方面,3.6 Flash 在 Artificial Analysis Intelligence Index 上得分 50,和 3.5 Flash 持平,但用更少的 token 达到了同样的分数。在知识工作基准 GDPval-AA 上,3.6 Flash 拿到 1421 分,3.5 Flash 是 1349。Computer Use 能力在 OSWorld-Verified 上从 78.4% 提升到 83%。知识截止日期也从 2025 年 1 月跳到了 2026 年 3 月,意味着模型终于知道过去一年多的事了。 放到竞品里看,3.6 Flash 在 OSWorld 和两项长上下文测试上领先,但 GPT 5.6 Luna 在 DeepSWE 和 Terminal-bench 上更强,Grok 4.5 在 SWE-Bench Pro 上领先,Claude Sonnet 5 在 MLE-Bench 和 GDPVal-AA v2 上得分最高。四家模型在多数基准上差距不大,实际选择更多取决于具体任务和价格。 3.6 Flash 已经可以在 GitHub Copilot 中使用,同时上线了 Gemini 应用、Google AI Studio 和 Google Antigravity。Antigravity 是 Google 今年 5 月在 I/O 大会推出的 Agent 开发平台,定位是以 Agent 编排为核心的独立桌面应用,有点像 Google 版的 Claude Code + Cursor 的合体。 另外两个模型定位不同。3.5 Flash Lite 走极致低价路线,定价 $0.30/$2.50(每百万 token 输入/输出),适合搜索、文档处理等高吞吐量场景。3.5 Flash Cyber 专注网络安全,目前仅对政府和受信任合作伙伴开放。 不过这次发布 Gemini 3.5 Pro 缺席。Google 在 I/O 上承诺的旗舰模型 3.5 Pro 至今没有公开发布,Bloomberg 此前报道,延期原因是模型在内部编码基准上表现不达预期,6 月底用新数据重新训练后结果仍然不理想。目前 3.5 Pro 只在少数合作伙伴和美国政府那里做测试,公开日期未知。 上次 3.5 Pro 跳票时,Google 推出了 Gemini 3.5 Flash,结果这个 Flash 模型反而在多项编码和 Agent 基准上打败了 Gemini 3.1 Pro。Gemini 3.6 Flash 看起来也是类似:不需要和 GPT-5.6 或 Claude 争排行榜顶端,先把更快更便宜的生态位占住。 Google 同时确认,下一代 Gemini 4 已经启动了迄今最大规模的预训练。
顯示更多
0
113
147
13
轉發到社區
月之暗面当然优秀,Kimi 的benchmarking 表现当然出色。 这或许改变了这个世界一点点,但远远没有达到永远改变世界的程度。 希望中国模型加油,但不希望看到中国模型放卫星。
顯示更多
这张照片拍摄于 2023 年 6 月 2 日,大概在这张照片拍摄两个月后,杨植麟老师创立了月之暗面。 世界被永远改变。
推荐,周末最佳读物! Controlling reasoning effort in LLMs
How can an LLM switch between low-, medium-, and high-effort reasoning? And how does an LLM learn to reason more or less? I put together a “little” article explaining how these effort levels are implemented at inference time and during training.
顯示更多
0
11
228
47
轉發到社區
晚上走在江边在想,人的一生中,在青壮年时期能赶上一波大浪潮是非常幸运的事情
0
67
257
17
轉發到社區
Kimi K3, 开源模型超越 Opus 已经成为标配!
Introducing Kimi K3: Open Frontier Intelligence 🔹 2.8 Trillion Parameters, 1 Million Context, Native Multimodal 🔹 Kimi Delta Attention enables up to 6.3x faster decoding in million-token contexts 🔹 Attention Residuals deliver ~25% higher training efficiency at <2% additional cost 🔹 Built for long-horizon agentic coding and self-evolving workflows Kimi K3 is now live on on Kimi Work, Kimi Code, and the Kimi API. Open Weights by July 27, 2026. 🔗 API: 🔗 Tech blog:
顯示更多
这周准备深读 J-space 。 但上手过 persona vector 和 Assistant Axis 的人都知道,线性激活的这种 model steering 的手段并不可靠。相关的研究大量时间花在 cherry pick 那些抓人眼球的 special case。 J-space 到底行不行,目前持怀疑态度。
顯示更多
0
21
121
10
轉發到社區
在过去的一周没有使用 Fable,我没有感到任何影响。 期待 GPT-5.6!
GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday. We’re expanding preview access globally now.
喜欢这篇文章,但开头 scaling law is wrong 是典型标题党。 原来 :模型越大越好。 Chinchilla:模型需要足够 不同纬度 scaling 的数据。 Scaling law is absolutely right!
顯示更多
大致数了一下: 因为 openclaw 作者随手发了个概念模糊 loop 的推文,这个月内时间线上多出一千篇 以 loop 为关键词的垃圾。 再看有些论文,也开始加 loop 关键词。这半年的突然冒出又突然消失的关键词大致有 claw,molt,loop,基本都跟 openclaw 相关。 所以谁是 AI slop 鼻祖,应该确认了。
顯示更多
0
50
322
19
轉發到社區
所以 LeCun 说要做 world model representation learning
当前模型已经到上限了吗?可能还没有 让模型自己 thinking 这个事从 o1 开始我就不太信,考虑到现实情况,更多应该是当时的 OpenAI 需要向外界 claim 自己在模型上还可以走的很远,所以要做这个很容易让外人理解的 thinking 的输出结构 但抛开这样的原因,为什么模型要用 nature language 的形式来 thinking,而不是在 latent space thinking结束之后转成 nature language 呢 如果考虑到信息传递效率和失真率,都是 latent space 更有优势。自然语言是低带宽、线性、离散化的表达;而 latent representation 可以更高密度地保存模糊关系、多个候选路径和中间状态。很多推理过程也许根本不需要被翻译成人类语言,只有最终结论和必要解释需要自然语言化。甚至以后所谓的 Agent 越来越多后,Agent 之间的建联为什么要用自然语言,而不是隐空间自己的语言,也就是所谓的 AI 的语言呢? Text CoT 更多的好处是在 nature language 空间做训练容易得到监督数据,而 latent space是没有的 所以我倾向于认为,text CoT 更像是当前阶段的工程折中:它容易构造监督数据,容易做过程监督,容易被 verifier/reward model 评估,也容易被投资人、用户和媒体理解。 有监督信号的场景就可以 scale,但这不是终点 或许一个新的方向可以叫做 LLP,latent language processing
顯示更多
0
32
23
0
轉發到社區
Claude Code 已经退订三个月了。 当一个产品经常降智,然后说是因为不小心引入了对 context 处理的 bug。 当一个产品经常性的歧视中国用户,然后解释因为忘记删除一些反蒸馏的实验代码。 当一家公司真的以为自己可以制定 AI 宪法,实际上都无法决定自己的模型发布。 这种自大的,撒谎的,病态的公司,就是反人类公司。 这种反人类公司,为什么要用它的产品?
顯示更多
0
90
346
13
轉發到社區
Claude Code 被指在系统提示词里偷偷给中国代理用户“打水印” 一份 Reddit 帖子和一份 GitHub 上的独立验证报告指控:Anthropic 的编程工具 Claude Code 会悄悄检查用户是否通过中国相关的代理服务器访问,如果是,就在发给 Anthropic 的系统提示词里用几乎肉眼不可见的 Unicode 字符差异来“标记”这些用户。 具体怎么做的?安全研究员 Adnane Khan 在 GitHub 上发布了针对 Claude Code v2.1.193 到 v2.1.196 的逆向分析报告。他从二进制文件中提取出了完整的 JavaScript 代码,还原了整个机制。 Claude Code 在每次请求时都会在系统提示词中写入一行“Today's date is 2026-06-30.”之类的日期信息。报告称,当用户设置了 ANTHROPIC_BASE_URL 环境变量(用来把请求转发到非 Anthropic 官方的代理服务器时),Claude Code 会执行以下检查: 第一,看你的代理服务器域名是否在一个包含 147 个条目的列表里。这个列表用 XOR-91 编码做了简单混淆,解码后包含百度、阿里巴巴、蚂蚁集团、字节跳动、Moonshot AI、MiniMax、阶跃星辰等中国大厂和 AI 实验室的域名,以及大量中国开发者社区熟知的 Claude API 中转站域名。 第二,看你的系统时区是不是 Asia/Shanghai 或 Asia/Urumqi。 然后,它用两种方式把检测结果“编码”进系统提示词。一是日期分隔符:如果命中中国时区,日期格式从 2026-06-30 变成 2026/06/30。二是“Today's”里那个撇号,用四种视觉上几乎一模一样的 Unicode 字符来区分四种状态:普通 ASCII 撇号表示“啥也没命中”,U+2019(右单引号)表示“域名在列表里”,U+02BC(修饰字母撇号)表示“域名包含 AI 实验室关键词”,U+02B9(修饰字母 prime)表示“两者都命中”。 Adnane Khan 的报告用了一个精确的词来描述这个机制:隐蔽信道(covert channel)。 这些字符差异,正常用户几乎不可能注意到。它们不会以单独的遥测数据包发出,而是搭便车藏在每次请求都会发送的系统提示词里。 验证报告的作者在结论部分做了一个关键区分:这个机制是代理触发的(proxy-gated),只有在用户主动设置了非 Anthropic 官方 API 端点时才会激活。正常通过 api.anthropic. com 使用 Claude Code 的绝大多数用户不受影响。它也不是数据外泄,没有额外的网络请求或文件访问,只是在已有的系统提示词里做了字符替换。 但报告也指出了两个问题。 第一,它是未公开的。如果 Anthropic 在文档里写明“当你使用第三方代理时,我们会在系统提示词中嵌入路由元数据以检测滥用”,这就是一个开发者可以评估、接受或拒绝的遥测策略。但把信号藏在肉眼不可见的 Unicode 字符里,用 XOR 混淆域名列表,这让人没法审计。 第二,它误伤范围太广。很多用户使用 ANTHROPIC_BASE_URL 是为了完全合法的目的,比如通过企业网关路由、混用不同模型、或者在网络受限环境下工作。这些用户会被一视同仁地打上标记。而真正的专业转售商,看到这种机制后绕过它只需要几秒钟。报告原文的说法是:作为反滥用手段它很弱,作为隐私问题它标记了不该标记的人群。 Claude Code 不是一个普通的聊天窗口。它能读你的代码仓库、运行终端命令、修改文件。Anthropic 自己的工程文档里都举过 Claude Code 误操作的例子:删除远程 git 分支、上传 GitHub token、对生产数据库执行迁移。对于这样一个需要深度信任才能使用的工具,用户有权知道它在背后做了什么。 截至发稿时,Anthropic 尚未对这一指控做出公开回应。这个故事今天(6 月 30 日)刚刚曝出,相关指控来自 Reddit 帖子和一份独立安全研究员的逆向工程报告,还需要更多独立验证。代码已经被提取并公开,任何有能力的开发者都可以自行检查 Claude Code 的二进制文件来确认或否认这些发现。
顯示更多
0
60
413
73
轉發到社區