AI文章检测的前沿——精度竞争背后蔓延的学生和教师的不安

AI文章检测的前沿——精度竞争背后蔓延的学生和教师的不安

AI写的文章真的能被识别吗——检测工具的实力与“误判”的陷阱

随着生成AI开始撰写邮件、报告、广告、新闻文章,“这篇文章是谁写的”这个问题突然变得沉重起来。因此,AI文本检测器的存在感正在增加。输入文章后,几秒钟内就会显示“AI生成的可能性”,以百分比或颜色区分。教师可以用于检查提交物,编辑可以用于审查稿件,企业可以用于外包内容的质量管理。仅从便利性来看,它似乎是AI时代的必需品。

然而,屏幕上显示的“87%”并不是像DNA鉴定那样的作者证明。这是通过统计分析文章的特征,推测其更接近于已学习的人类文或AI文的结果。虽然它可以成为一个方便的警报装置,但不能单独作为裁判人的判决书。如果在不了解这种区别的情况下引入,不仅可能会错过不正当行为,还可能产生怀疑无辜者的风险。


AI检测器在看什么

许多检测器以词语选择、句子长度的变化、重复、句法、下一个词的可预测性等为线索。大型语言模型通过概率选择可能在上下文中出现的词来构建文章。因此,在流畅且较少破绽、保持一定节奏的文章中,可能会出现机器生成的模式。

常用的概念是“预测难度”和“变动性”。前者表示下一个词的可预测性。后者观察短句与长句、简单表达与意外表达的混合程度。人类会在中途改口,或根据话题改变节奏。而AI则容易持续写出整齐的平均句子——至少检测器试图捕捉这种趋势。

不过,这并不是指纹。即使是同一个AI,模型、指令、温度设置、编辑方法不同,文体也会变化。即使是人类,也会写出像法律文件、产品规格、模板邮件、学术摘要那样容易预测的文章。通过文章校对工具,表达的波动可能会减少。检测器看到的只是完成的字符串,而不是写作现场。谁、在哪个终端、以何种步骤创作的都无法得知。


最大弱点是“AI特征”不断变化

当检测方学习AI的特征时,生成方可以淡化这些特征。通过改写、词序更改、多次推敲、人为添加等,判定可能会改变。研究表明,通过递归改写,可以在不大幅降低文章质量的情况下降低检测率。相反,在人类文章中添加机械特征以误导检测的攻击在理论上也是个问题。

也就是说,检测并不是寻找固定的假货。随着生成模型的进化和用户的编辑技术提高,标准不断变化的追踪游戏。某个时间点、某个模型、某种语言中表现优异的检测器,在其他条件下未必能保持同样的性能。

象征性的是OpenAI的应对。该公司在2023年公开了AI文章分类器,但在用于评估的英语数据中,正确判定AI文为“AI特征”的比例仅为26%,将人类文章误判为AI的比例也达到了9%。随后因精度低而停止提供。该公司自身也解释说,在短文、非英语、与训练数据不同的文章中,可靠性下降,不应作为主要的决策手段。

这并不意味着“所有检测器的准确率只有26%”。因为每个产品的数据和评估方法都不同。然而,即使是开发生成AI的企业,也面临通用文章判定的困难这一事实是沉重的。


误检测带来的隐形不公平

误检测不仅仅是数字上的错误。在学校,它可能影响成绩或纪律处分;在研究中,可能影响信誉;对于作家,可能影响报酬或合同。特别需要注意的是,非英语母语的作者。斯坦福大学等研究者的调查报告称,多种检测器容易将非母语者的英语作文误认为是AI生成。词汇和句法的范围有限,文章变得容易预测被认为是原因之一。

这一问题对日本用户来说并非无关。许多检测技术是基于英语数据开发的,未必在日语中验证了同等性能。日语具有省略主语、无分词、敬语、汉字与假名混用等与英语不同的特征。在短的SNS帖子或模板化的商务文中,判定材料更少。“超过500字就安全”这样的统一标准也不能跨语言或产品保证。

Turnitin也表示,在AI判定为1~19%的区域误检测较多,目前不显示具体数值而用星号表示。这是检测服务方承认低分数更容易被误解的例子。超过20%并不意味着自动确定为不正当。显示的比例是被认为具有AI特征的文章部分的比率,与作者使用AI的概率是不同的。


在SNS上,“必要性”和“危险性”正面冲突

在SNS和论坛上的反应两极分化。在教育工作者的社区中,有人认为“在大量提交物面前,作为筛选可疑文章的入口是必要的”“可以辅助发现与平时作文能力的差异”,对完全放弃检测器持谨慎态度。因为AI抄袭确实增加,教师逐一手工检查的负担也不可忽视。

 

另一方面,反对声音很强烈。在Reddit上,有教师输入自己写的文章却被判定为AI,有相同文章在多个服务中检测结果从0%到高比例不一,使用校对工具的文章被怀疑等经历。学生方面则表达了不安,称为了反驳误判必须保留编辑历史,证明无辜的负担过大。

有趣的是,在教师的讨论中,“不要仅凭分数指控”的意见反复出现。建议的方法包括让本人解释可疑部分的意义,询问参考资料,确认草稿和更改历史,与平时的文章比较。也有相反的失败案例。明明文章明显不同于平时,但多个检测器返回0%的情况,假阳性和假阴性的不信任都在扩大。

当然,SNS帖子不是统计调查,写作者的主张可能无法确认是否属实。即便如此,可以读出“被误判的恐惧”和“无法识别不正当行为的焦虑”同时存在。围绕检测器的对立,不仅是技术精度的问题,也是关于谁承担解释责任的制度设计问题。


“AI文章在SEO中被惩罚”是过于简单化

关于AI内容,有人说“搜索引擎仅因为是AI写的就会降低排名”。然而,Google的官方方针并没有那么简单。生成AI被认为有助于调查和独特内容的构建,问题在于大量生成对用户无附加价值的页面等,违反垃圾邮件政策的操作。重视的是准确性、质量、相关性,并建议对制作方法提供适当的背景说明。

因此,作为SEO对策仅专注于降低检测分数是本末倒置的。即使文章看起来像人类写的,但如果事实错误、没有独特信息、未能回答读者的疑问,其价值仍然很低。相反,即使使用AI进行初步调查或结构辅助,但如果专家验证、加入独特采访或经验、明确责任所在,仍然可以成为对读者有用的内容。


在现场的正确使用方法——将分数作为“入口”

如果使用AI检测器,目的应放在“寻找需要额外确认的部分”,而不是“寻找犯人”。在实际操作中,以下步骤是现实的。

首先,记录判定对象和条件。保留服务名称、执行日期、对应语言、输入范围、文章量。检测模型会更新,因此日后未必会得到相同结果。

其次,确认分数的意义。是“AI使用的概率”,还是“AI特征文章所占比例”,因产品而异。不能仅凭数字进行比较。

第三,结合多种证据。查看草稿、笔记、采访记录、参考URL、版本历史、文件创建时间、本人解释等。在学校,在告知学生怀疑之前,需要提供反驳机会和申诉程序。

第四,将检测结果与质量评估分开。是否具有AI特征与内容是否准确、独创、对读者有价值是不同的轴。有人类写的低质量文章,也有使用AI辅助但由人类负责完成的有用文章。

第五,确认机密信息或未公开稿件的处理。在粘贴到外部服务之前,确认保存方针、学习利用、删除条件、组织的信息管理规定。为检测而泄露客户信息或研究数据是没有意义的。


从检测转向“制作过程的证明”

未来的焦点可能会从仅看完成文推理作者的方式转向展示制作过程的方式。结合编辑历史、出处管理、电子签名、来历信息、组织内的AI使用申报等,比起“是AI还是人类”这种二选一,更接近实际情况。因为现实的文章制作正在成为AI提出结构方案、人类进行采访、其他工具进行校对的协作过程。

应该问的是“是否有一个字由AI参与”。而是在哪里使用了AI,谁确认了事实,最终责任由谁承担。在教育中,全面禁止AI并继续检测游戏,学生可能会学习如何规避分数的写作技巧。相反,明确可使用的范围、申报方法、评价对象,设计能够口头解释自己想法的课题更为重要。

AI检测器今后也会继续改进,在特定条件下继续成为有效的辅助线。然而,即使检测率提高,也不一定可以自动化社会判断。比起几秒钟内得出的数值,花时间留下的制作过程有时会成为更有力的证据。

我们应该守护的不是模糊的“人类特征”。而是信息的准确性、独特性、透明性和责任。AI时代的信任不是来自不被机器识破的文章,而是来自能够解释如何制作和如何验证的文章。


出处URL