AI 检测器没能通过它们本该通过的作弊检测,学生们心知肚明

AI 检测软件市场建立在一个承诺之上:算法能够判断一篇论文是学生写的还是机器写的。CNET 本周发布的实测结果显示,这一承诺已经破灭。所有主流检测器都被免费或低成本的规避手段击败,不同检测器对同一批图像还会给出相互矛盾的结论。

CNET 撰稿人、亚利桑那州立大学新闻学教授蕾切尔·凯恩(Rachel Kane)将真实的 PDF 作业输入 ChatGPT、Claude、Gemini 和 NotebookLM,再把生成的论文交给去 AI 化工具处理。文章称,所有经过处理的文本都轻松通过了检测。测试还发现该行业存在结构性冲突:一些销售 AI 检测服务的公司,同时也在销售专门用于击败检测的去 AI 化工具。

矛盾在图像检测上表现得最为突出。一款工具将一张在生成式 AI 问世之前制作的图形判定为 100% 由 AI 生成,另一款工具却认定一张完全由 AI 制作的信息图只有 1% 出自 AI。文章指出,面临指控的学生可以利用这种分歧,因为两台检测器往往会对同一份作品给出截然相反的结论。

即便是为抵御 AI 而专门设计的作业也未能通过测试。仅凭一条提示词去完成一项需要视觉元素的作业,Claude 就在没有任何进一步指令的情况下,按标准化格式生成了看起来相当专业的信息图。作者从未审阅过作业内容,也未检查输出结果,这削弱了那种认为学生把作业交给模型就能掌握内容的说法。

If our reporting has earned your trust, consider helping us continue our work.

Help keep us independent

独立研究支持了这些个例发现。《International Journal for Educational Integrity》发表的一项系统性评估发现,广泛使用的商用检测器在处理 GPT-4 生成的内容时表现不稳定,既会出现漏检,也会给出不确定的分类。布兰迪斯大学的 AI 指导委员会汇集的研究表明,检测工具存在较高的误报率,并可能对母语非英语者存在偏见;2023 年以来的报道也记录过检测器将人类写作的作品误判为机器生成的情况。

这一生态系统的经济逻辑指向同一个方向。按需完成多页作业的作业帮手应用以学习辅助工具的名义销售,订阅价格约为每月 7 至 12 美元;针对考试的工具则以每年 15 至 192 美元的价格宣传无法被检测的使用体验。CNET 的文章总结道,整个行业的主要客户是想尽快了结作业的学生,而不是试图维护学术诚信的教育工作者。

大学已经开始从结构层面而非技术层面作出回应。各院校正转向从更大的题库中随机抽题,并增加现场考试,因为它们意识到,软件军备竞赛对掌握写作工具的一方有利,而不是对掌握检测工具的一方有利。就目前而言,对教育工作者的实际启示是,仅凭检测器得分不能作为证据;对学生而言,绕过这套监管机器比信任它更容易。

婷 翻译

来源:I Used Every AI Cheating App and Detector and Came to One Conclusion (CNET, July 31, 2026); Evaluating the efficacy of AI content detection tools in differentiating between human and AI-generated text (International Journal for Educational Integrity, Springer); Limitations of AI Detection Tools (Brandeis University AI Steering Council); Detecting AI may be impossible. That’s a big problem for teachers (Washington Post, June 2023)

Scroll to Top