独立评测:只要让模型模仿作者文风,AI 检测器漏检率从 0.7% 跳到 13%

Epoch AI 用 99 位作者、495 段 ChatGPT 发布前写就的人类文本做对照,测试 Pangram、GPTZero、Originality.ai 三款检测器。普通提示词生成的 AI 文本几乎全被抓出(漏检率最高 0.7%),但只要先喂给模型 5 段作者样本让它仿写,平均漏检率就升到 13%,学术写作一类高达 24%–29%。

评测怎么做的

研究团队选了 99 位作者共 495 段文本,博客、小说、学术写作各占三分之一,且全部写于 2022 年 11 月 ChatGPT 发布之前,以排除语料被模型污染。生成侧用了 Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro;检测侧是 Pangram 3.3.2、GPTZero 2026-05-11-base 和 Originality.ai Turbo 3.0.2。对照组是常规提示词直接生成,实验组则先给模型 5 段该作者的样本,再要求它按同样的文风另写一段。

差距出在哪

对照组几乎没有悬念:三款检测器的漏检率最高只有 0.7%。误报方面,Pangram 和 GPTZero 没有把任何人类文本判成 AI,Originality.ai 误判了 495 段中的 19 段。 换成仿写文本,结果就变了:Pangram 漏检 10%、GPTZero 11%、Originality.ai 18%,平均约 13%。最薄弱的是学术写作——三款分别漏检 25%、24% 和 29%,而这恰恰是检测器在现实中被用得最多的场景。

这个结论的用法

要注意区分两件事:这不是说检测器失灵,而是说它的表现高度依赖对手是否刻意规避。厂商自评通常报告的是常规条件下的数字——比如 GPTZero 曾在自家博客中援引第三方基准称召回率 99.3%——口径与 Epoch AI 的对抗性设定并不一致,不能直接互相印证。 实际影响集中在把检测结果当处罚依据的场景:学校、期刊和内容平台若以单次检测判定作弊,在学术文本上大约每四份仿写稿会放过一份,同时仍有误伤人类作者的可能。相对稳妥的做法是把检测分数当线索而非证据,配合写作过程记录、版本历史等其他信号一起判断。

via: Epoch AI 评测报告(数据已在其 GitHub 公开),经 The Decoder 2026 年 7 月 19 日报道;核实于 2026 年 7 月 21 日,未见国内媒体报道