美国阿尔科恩州立大学历史教授Jason Gibson设计了一个性价比极高的AI作弊检测方案。他在网上发布了一道期中考试讨论题,在题目中嵌入了一段人眼完全不可见的隐藏文本:用与网页背景融为一体的纯白色、极小的字体写成的指令。学生正常浏览网页时什么都看不到,这行白色小字和白色背景颜色完全一致。但AI系统在解析网页内容时会不加区分地读取页面上的每一段文字,包括那些在人眼视野中完全隐形的内容。
隐藏指令的内容简单到近乎荒谬:要求任何大语言模型在生成的回答中插入"banana"这个英文单词。当32名学生提交的答案中不约而同出现了这个与历史考题毫无关联的词汇时,Gibson得以板上钉钉地确认:他们使用了AI生成答案,而不是自己动手写的。
这一检测方法的精妙之处在于它几乎消除了误判的一切可能。学生从ChatGPT复制答案时根本不知道AI被植入了什么隐藏指令,自己动手写作的学生既看不到这行隐形文字、也不可能在答案中凭空写出这个触发词。没有人可以在事后辩解"banana"是自己想出来的,因为这个英文单词与历史论述题之间没有任何逻辑、常识或学术上的关联。正常人类不会在一道历史论文题里突然插入一个水果的英文名。Gibson事后在社交媒体上分享了这个方法,立刻引起了其他教授的热烈讨论,许多人表示自己也要在下一场考试中如法炮制。
事件迅速在教育界引发强烈反响。目前市面上主流的AI文本检测工具准确率有限,经常把非英语母语者写的地道英文误判为AI生成,或者反过来漏掉明显的AI作业。与之相比,Gibson的"提示注入"式陷阱几乎零成本、零误判、零技术门槛。不需要在学生电脑上安装任何监控程序,不需要训练复杂的分类模型,不依赖任何第三方商业检测服务。唯一需要做的,就是在发布试题的网页上多打一行肉眼不可见的白色小字。
这起事件也折射出教育界面对生成式AI时的深层困境。随着ChatGPT等工具在大学校园中全面普及,教师面对的核心问题已经不是要不要禁止AI,而是如何在学生普遍使用的既定前提下维持考试和作业评估的公平性。Gibson找到的解决方案打破了这个困局:不是被动地在学生交卷之后去检测答案是不是AI写的,而是在发题的那一刻就主动给AI下好了套。他用32个学生的期中成绩,证明了一个简单的道理:最有效的防御,有时候就是最聪明的陷阱。

(示意图)