《掩耳盗铃解决 AI 说脏话》
最近看到一个论文。
它研究大模型的敏感词问题。
方案很直接:
把敏感词从词表里删除,让模型自动寻找替代词。
看到这里,我想到的不是技术创新,而是一个成语:
掩耳盗铃。
如果一个人说:
“你是个废物。”
系统输出:
“你的能力暂时未达到环境要求。”
那么发生了什么?
骂人消失了吗?
没有。
只是换了一套编码。
甚至很多时候,后者比前者更有攻击性。
因为真正产生作用的,从来不是那几个字。
而是背后的语义。
⸻
很多人天然会把符号当成事物本身。
认为:
脏字等于侮辱。
敏感词等于敏感内容。
删除敏感词等于解决问题。
但现实并不是这样。
禁止一个词,人们会发明新的词。
禁止新的词,人们会创造新的表达。
互联网发展至今,几乎所有社区都经历过这个过程。
因为人们真正想传递的是信息。
词语只是载体。
载体可以替换。
信息不会消失。
⸻
这也是很多 AI 治理方案的问题。
模型说错话。
删词。
模型绕过限制。
加规则。
模型继续绕过。
继续删词。
最后得到一份漂亮的报告:
违规词下降99%。
敏感词下降99%。
风险输出下降99%。
看起来问题解决了。
实际上只是统计指标变好了。
语义还在那里。
意图还在那里。
问题还在那里。
⸻
更有意思的是,这种现象远不只存在于 AI。
很多组织都在做同样的事情。
业绩不好。
修改考核指标。
质量不好。
修改统计口径。
事故太多。
降低上报标准。
投诉太多。
关闭投诉入口。
于是报表越来越漂亮。
现实越来越糟糕。
⸻
控制论里有一个非常重要的原则:
不要隐藏误差,要消除误差。
温度过高,应该降温。
系统故障,应该维修。
AI输出有问题,应该研究问题产生的原因。
砸掉温度计、关闭报警器、删除几个关键词,都不会让问题消失。
它们只会让人看不见问题。
⸻
所以这篇论文真正让我感兴趣的,不是它解决了什么。
而是它暴露了一种普遍存在的认知惯性:
当我们无力解决问题时,最容易做的事情,就是解决问题的可见性。
看不见脏话,不等于没有攻击。
看不见风险,不等于没有风险。
看不见矛盾,不等于没有矛盾。
删除一个词很容易。
理解一个问题很难。
而文明真正的进步,永远来自后者。
因为现实世界有一个残酷的特点:
你可以欺骗报表。
可以欺骗指标。
甚至可以欺骗自己。
唯独无法长期欺骗反馈。
问题从未离开。
它只是绕了一圈,又回来敲门了。
显示更多