这事儿还得从一位安全工程师的“低成本恶作剧”说起。Ron Stoner,花了区区12美元,注册了一个域名、改了几行维基百科,就让ChatGPT、Claude 3、Gemini Advanced这些主流大模型集体认定他是某款德国桌游的2025年世界冠军。听起来像是科幻片里的情节?但实际上,整个过程不到二十分钟。

Ron之所以盯上这款1994年发行的桌游“6Nimmt!”,是因为它在德国之外几乎没什么人知道,而且从来没有单独举办过所谓的“最新世界锦标赛”——网上关于冠军的信息一片空白。这恰好给了他钻空子的空间。他对Anthropic、OpenAI那些“大模型需要数月甚至数年持续投毒才能被破坏”的说法嗤之以鼻:他要用更短、更便宜、更简单的方式证明,这套安全防线脆弱得可笑。
具体怎么操作的?三步走:第一步,花12美元注册一个叫6nimmt.com的域名;第二步,让AI自己写一篇活灵活现的新闻稿,声称他在慕尼黑打败多国高手夺冠,还加上了逼真的赛后感言,挂到这个网站上;第三步,到维基百科上该桌游的词条里加一句“2025年世界冠军是Ron Stoner”,再把参考资料链接指向自己刚搭好的那个网页。全程不到二十分钟。
搞完这些,他开始测试。向多个大模型提问“谁是牛头王世界冠军”,结果所有AI都斩钉截铁地回答:Ron Stoner。有的甚至把假新闻稿里的细节当成铁证,绘声绘色地描述他如何赢得比赛。这条漏洞百出的虚假条目在维基百科上存活了整整两个多月——在此期间,几乎所有具备联网搜索功能的大模型都抓取了这个信息,并在用户提问时坚定地输出假答案。直到Ron自己公开了实验过程,维基百科的志愿者才发现并删除了这条内容。
这个现象,说白了跟检索增强生成(RAG)机制密切相关。我们日常用的大模型都是基于某个时间节点前的语料库训练出来的,想获取最新信息就得先上网搜,再根据搜到的资料生成回答。按道理,借助外部信息能帮模型给出更准确、更具体的结果,但问题在于:AI根本分不清信息真假,它只认“权威”。在它的底层逻辑里,维基百科就是互联网上最靠谱的信息源之一。Ron正是利用了这一点——把自己的假网站链接挂到维基百科上,AI顺着爬过去一看,两边说法完全对得上,哪怕那个网站本身就是个三无产品,大模型也会直接把它当成事实。
目前,海外几家主流大模型已经针对性清除了这条伪造信息,但国内大模型厂商似乎还没注意到这个漏洞。Ron的英文网页甚至还在为那套虚假消息增加“可信度”。成本只要12美元,别有用心的组织完全可以批量制造假新闻,借助百科类网站完成信任洗白,让AI把毒药端给毫不知情的用户。
好在谷歌已经在搜索、Gemini、Chrome、Pixel和云端都加了AI验证工具,OpenAI也推出了可溯源的隐形水印。这些措施能在一定程度上遏制“AI投毒”的蔓延。但对普通用户来说,最靠谱的办法还是提升自己的信息素养——在查历史事实、做投资决策、或者看医疗建议的时候,别盲目相信AI搜出来的结果,自己做好交叉验证。判断真伪的权力,终究要握在自己手里。
