超30%新arXiv论文疑似AI撰写:基于0.4%误报率的检测研究
一项针对12,750篇arXiv论文的检测研究发现,约三分之一的新论文读起来像机器撰写。研究通过校准检测器至0.4%误报率,并以ChatGPT前论文为对照,揭示了AI写作在学术领域的渗透程度及其局限性。
我们如何测量arXiv中的人工智能写作,以及测量结果的突破点我们对12,750篇arXiv论文的全文进行了评分,发现大约三分之一的新论文读起来是机器编写的。以下是方法、结果以及对局限性的诚实描述。
假阳性楼层有一种标题类型说“X的N%现在是人工智能”,但大多数都不值得一读,因为数字背后的检测器也标记了部分真正的人类写作。如果一个工具将40%的新论文标记为机器撰写,但也标记了ChatGPT存在之前撰写的20%的论文,那么真正的故事是没有人提及的20%。
所以我们围绕这个异议进行了研究。我们的检测器(此处描述)针对学术写作进行了校准;为0。假阳性率4%,清除99。6%的真正LLM预科科学文本,并恢复85%的人工智能学术文本。我们把假阳性率作为锚点。
我们收集了ChatGPT之前2021年和2022年提交的论文,将它们视为地面真相人类,并将标记阈值设置为恰好0。4%的人绊倒了。那条线就是地板。我们报告的每个数字都是超过阈值的论文比例,根据结构,真正的LLM预科写作为0。
4%。ChatGPT之前的年份充当了内置控制:如果上升是检测器的人为因素,那么2021年和2022年将标记为2026年。第一个图表明他们没有。
我们测量的从2023年1月到2026年7月,我们对10个领域组进行了抽样,每个领域每月大约25篇论文,加上2021年和2022年的8个控制月,总共获得了12,750篇论文。
对于每一篇文章,我们都提取了版本1的PDF,因此2026年修订的论文无法将现代文本泄露回2023年的插槽中。我们对全文而不是摘要进行评分,因为摘要低估了信号:我们看到同样的论文摘要评分低于20%,正文评分超过70%。
每个报告的数字都具有自举95%的置信区间。结果标记的份额持平于0。到2021年和2022年,这一比例为4%,在ChatGPT的几个月内上升,并在最近一个完整季度分两波攀升至约32%,在2026年初达到接近39%的峰值。
跨领域的差异很大,承载它的是表格和第二个数字。下面的值是截至2026年7月12个月内每个领域的标记份额,以及其LLM前的控制水平。计算机科学领先约65%。数学最低,接近0。7%,限制部分解释了为什么它的低值难以解释。
控制列是每个字段2021年至2022年标志率在三个灵敏度设置下的平均值;上升最多的字段并不是LLM前控制水平最高的字段,因此升高的起点并不能解释上升。限制控制样本量。每个字段的ChatGPT前控制是200篇论文。
在0。
4%标记率整个2,000张纸张控制中只有8张纸张标记,稀疏地分布在十个字段上,因此每个字段的单阈值控制率是粗略的。
汇总楼层是经过充分估计的,也是该研究的锚定对象,但每个字段的控制水平只是大致的,更大的控制无法解决这个问题:将每个字段固定为百分之一的比率将需要每个字段数千张控制纸2023年之前的arXiv卷不包含。
低分数可能表明采用率低或检测器盲点。数学是最清楚的案例。数学论文以符号和定理证明结构为主,一旦方程和参考文献被删除,剩余的散文就会稀疏,与检测器训练的科学英语不同。
在大量模型辅助下起草的数学论文可能得分较低,因为其散文超出了检测器的分布范围,因此数学得分较低是人类写论文的弱证据。结果与两种截然不同的解释一致,即该寄存器中采用率较低或检测器灵敏度降低,并且该数据无法将它们区分开来。
内分布假设最强的领域,即散文为主的领域,也是增长最多的领域,因此这种混淆并不能解释总体趋势。但在低分领域,排名应该被视为采用的下限。探测器覆盖范围。
检测器对某些生成器比其他生成器更敏感,我们无法根据作者实际使用的模型和提示的精确、私人混合来评估它。不完全覆盖会降低旗帜率,因此报告的患病率是一个下限:真实份额至少是我们测量的。检测器写入报告每个发生器的性能。
旗帜不是作者身份。检测器以已知错误率的校准概率估计文本是否读为机器编写的。它无法将经过轻度编辑的文档与完整生成的文档区分开来,而且单一的分数绝不能成为指控特定人的理由。我们报告了类机器写作的流行,其中包括大量人工智能辅助编辑。
试试该检测器的运行成本很低,而且我们没有从中赚钱。您可以在此处的任何arXiv纸上免费尝试,也可以在此处的您自己的文本上免费尝试。