游乐游手机版
首页/AI热点日报/热点详情

Epoch AI测试三大AI文本检测器 模仿人类文风后最高漏检近三成

类型:热点整理2026-07-21
三大AI文本检测器在识别普通AI生成文本时漏检率低于0 7%,但面对模仿人类写作风格的AI文本时,平均漏检率升至13%,其中科学写作场景下漏检率高达24%至29%,部分模型组合甚至接近50%,技术瓶颈显著。

具体来说,研究团队选了Pangram(3.3.2版)、GPTZero(2026-05-11-base版)和Originality.ai(Turbo3.0.2版)这三款市面上用得比较多的AI检测器来做测试。他们搞了一个基准测试集,里面全是货真价实的人类原创文本,一共495篇,涵盖了博客、小说和科研写作。关键是,这些样本都是在ChatGPT 2022年11月发布之前写好的,这样就能彻底排除训练数据被污染的风险。

实验数据挺能说明问题。在识别普通AI生成文本时,三款工具的漏检率最高才0.7%,几乎可以忽略不计。而在判断人类文本时,Pangram和GPTZero更是零失误,完全没误判。不过,Originality.ai这边稍微有点状况,把19篇真正的人类作品错当成了AI生成,误报率整体是3.8%。

更有意思的是,研究团队还让Claude Opus 4.8、GPT-5.5和Gemini 3.1 Pro这三款大模型,先学习作者提供的5篇真实作品,摸清写作风格,然后模仿着生成一批新文本。总共搞了297篇这种风格模仿的样本,结果平均下来,大约13%的文本没有被任何一款检测器成功识别。细分来看,Pangram漏掉了10%,GPTZero漏掉了11%,而Originality.ai的漏检率直接飙到了18%。

到了科学写作这个场景,检测器的表现就更疲软了。面对学术风格的AI生成文本,Pangram的漏检率是25%,GPTZero是24%,Originality.ai更是达到了29%。某些模型组合的误差更是离谱:比如Pangram对Gemini生成的学术文本,漏检率高达48%,而Originality.ai对GPT-5.5生成的学术内容,也漏掉了39%。

这三款检测工具虽然技术路线不同——有的靠神经网络建模,有的分析文本可预测性,还有的依赖统计模式识别——但暴露出的能力瓶颈却惊人地相似。这项研究传递了一个很清晰的信号:随着大语言模型在模仿写作风格上越来越逼真,现有的AI文本检测手段,在学术评估、论文出版这类对文本真实性要求极高的领域,仍然面临不小的技术挑战。这才是关键点。

来源:https://www.php.cn/faq/2855593.html?uid=1246273

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。