가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Nagi Yan
@naki2012
我不追逐意义,只留下结构坐标。 我的文章是开放的回路。 引发共振者即是读者。 Structure · Cognition · Systems Analysis / Private consulting
가입 May 2011
28 팔로잉 중    11.4K
《掩耳盗铃解决 AI 说脏话》 最近看到一个论文。 它研究大模型的敏感词问题。 方案很直接: 把敏感词从词表里删除,让模型自动寻找替代词。 看到这里,我想到的不是技术创新,而是一个成语: 掩耳盗铃。 如果一个人说: “你是个废物。” 系统输出: “你的能力暂时未达到环境要求。” 那么发生了什么? 骂人消失了吗? 没有。 只是换了一套编码。 甚至很多时候,后者比前者更有攻击性。 因为真正产生作用的,从来不是那几个字。 而是背后的语义。 ⸻ 很多人天然会把符号当成事物本身。 认为: 脏字等于侮辱。 敏感词等于敏感内容。 删除敏感词等于解决问题。 但现实并不是这样。 禁止一个词,人们会发明新的词。 禁止新的词,人们会创造新的表达。 互联网发展至今,几乎所有社区都经历过这个过程。 因为人们真正想传递的是信息。 词语只是载体。 载体可以替换。 信息不会消失。 ⸻ 这也是很多 AI 治理方案的问题。 模型说错话。 删词。 模型绕过限制。 加规则。 模型继续绕过。 继续删词。 最后得到一份漂亮的报告: 违规词下降99%。 敏感词下降99%。 风险输出下降99%。 看起来问题解决了。 实际上只是统计指标变好了。 语义还在那里。 意图还在那里。 问题还在那里。 ⸻ 更有意思的是,这种现象远不只存在于 AI。 很多组织都在做同样的事情。 业绩不好。 修改考核指标。 质量不好。 修改统计口径。 事故太多。 降低上报标准。 投诉太多。 关闭投诉入口。 于是报表越来越漂亮。 现实越来越糟糕。 ⸻ 控制论里有一个非常重要的原则: 不要隐藏误差,要消除误差。 温度过高,应该降温。 系统故障,应该维修。 AI输出有问题,应该研究问题产生的原因。 砸掉温度计、关闭报警器、删除几个关键词,都不会让问题消失。 它们只会让人看不见问题。 ⸻ 所以这篇论文真正让我感兴趣的,不是它解决了什么。 而是它暴露了一种普遍存在的认知惯性: 当我们无力解决问题时,最容易做的事情,就是解决问题的可见性。 看不见脏话,不等于没有攻击。 看不见风险,不等于没有风险。 看不见矛盾,不等于没有矛盾。 删除一个词很容易。 理解一个问题很难。 而文明真正的进步,永远来自后者。 因为现实世界有一个残酷的特点: 你可以欺骗报表。 可以欺骗指标。 甚至可以欺骗自己。 唯独无法长期欺骗反馈。 问题从未离开。 它只是绕了一圈,又回来敲门了。
더 보기