留学生发明「报吃」黑话骗过 AI,结果把全行业大模型都整崩溃了
莎士比亚它能逐行解析,却读不懂一句“几乎可以媲美我高中食堂”里,那点咬牙切齿的嘲讽。
—— 与龙共弈
最近,自然语言处理(NLP)圈被一篇论文轻轻将了一军。宾夕法尼亚大学和华盛顿大学的研究者发现:在评估主流大模型对中文在线评论的理解能力时,只要用户稍微用暗号,用一套只有圈内人才懂的编码语言写差评,几乎所有模型都瞬间瞎了。
这篇论文已被ACL 2026收录,它是计算语言学的顶级会议,能被它收,说明这事不是段子,是真问题。
更扎心的是这些模型能写代码、能翻译古籍、能在律师资格考试里吊打人类,却在这饭到底好不好吃这种问题上栽了跟头。
当差评可以被删除:一套黑话的诞生
故事要从谷歌地图的一个机制说起。在海外,谷歌地图的商家评论区长期存在差评可删的灰色空间,只要评论触发某些规则,商家或平台就可能把它移除。
于是,一群在海外生活的中国留学生,想出了一个朴素又聪明的办法:把差评用正面内容包起来,再用只有中国人能懂的暗号传递真实态度。
英文写Newspaper eat(字面:报纸吃),对应中文谐音报吃,意思就是这饭不好吃。
有人用藏头诗写好评:每句首字连起来,才是真正的差评。
还有人更硬核:用米粒在桌上摆出字,拍照配五星,图里的字才是真心话。
表面是五星、是夸赞、是报纸吃这样莫名其妙的句子,背后,是一群人对一套不公机制的集体幽默反抗。
这不是孤例,论文团队在真实评论里捞到大量这类编码语言,它们共用一个特征:字面意思与真实意图完全相反,且高度依赖社群共识。
7744 条评论实测:大模型全军覆没
光有轶事不够,研究者做了硬核实验,他们收集了7744 条真实中文评论,其中900 条属于各类编码语言(黑话、谐音、藏头、反讽)。
然后,他们把这些评论喂给一众主流大模型,让模型判断评论的真实情感倾向(正面 / 负面)。
结果,用论文作者的话说,是断崖式下跌,在普通评论上还能打八、九十分的大模型,一旦遇到编码语言,准确率直接跳水。
核心结论:大模型并不是变笨了,是它从未真正学过这套语言。当真实意图被藏进字面相反的表述里,依赖统计规律的模型就只能举手投降。
病根在哪:Transformer 的阿喀琉斯之踵
为什么连 GPT 级别的大模型都会翻车?论文把矛头指向了几个结构性原因。
局部语义强,跨句整合弱
Transformer 的核心机制是注意力(attention),它对单个词、相邻几个词的关系把握得很好。但一旦真实意思散落在字面是五星 + 图片里一行米粒字 + 评论区的社群语境之间,模型就拼不出完整拼图。它看得见每一块碎片,却读不懂整幅画。
训练数据里,黑话占比极低
大模型的世界观来自训练语料。而像报吃米粒摆字这类活在日常、长在社群的表达,几乎没有进入高质量训练集。模型没见过,自然不懂。
最棘手的映射关系动态演化
Newspaper eat → 报吃 → 不好吃这样的对应关系,不是字典里固定的,是网民实时共创、随时改写的。今天报吃是暗号,明天可能就换了说法。对靠静态语料训练的模型来说,这是一道追不上的移动靶。
模型读得懂词典,却读不懂人间。语言不是死的符号,是活的关系。
当机器学会了读书,却读不懂人
这篇论文最值得玩味的地方,不在于AI 又翻车了,翻车年年有。它真正提醒我们的,是人工智能的理解,和人类的理解,根本不是一回事。
我们读懂报吃,靠的是共情、社群经验,是知道一个人不会无缘无故夸一家难吃的店。而模型读懂一句话,靠的是它见过的千万次统计。当真实世界比训练集更复杂、更狡黠、更有人味,差距就暴露了。
人之聪明,多失于浮炫。——《金史》
再聪明的系统,一旦困在字面的浮光里,也会在真正的深意面前失语。
所以,下次看到 AI 妙笔生花,不妨想起那句:几乎可以媲美我高中食堂。它写得越漂亮,越提醒我们:真正的理解,从来不只是读懂字,更是读懂字背后那个人。
#
AI# #
AIAgent#
@grok @xai