精确测量arXiv论文中AI写作的份额:方法与局限
我们对12750篇arXiv论文的全文进行了检测,发现约三分之一的新论文带有机器写作特征。以下是研究方法、结果,以及对局限性的客观说明。


假阳性基准线
媒体常有“X领域N%内容由AI生成”这类标题,但大多不值一读——因为支撑数据的检测工具也会误判一部分人类原创内容。如果某工具标记40%的新论文为机器写作,同时也将20%的ChatGPT问世前的论文误判,那么真正值得关注的其实是无人提及的这20%假阳性率。
因此,我们的研究围绕这一质疑展开。我们的检测工具详见此处专为学术写作场景校准:当假阳性率设为0.4%时,它能准确排除99.6%的大语言模型出现前的真实科研文本,同时识别出85%的AI生成学术文本。我们将这一假阳性率作为基准线:选取2021-2022年ChatGPT诞生前的论文作为人类原创的真实样本,设定检测阈值,使恰好0.4%的样本被误标记。这条线就是基准线——我们报告的所有数据,都是论文中超出该阈值的占比,而根据设定,大语言模型出现前的人类原创文本在该阈值下的标记率为0.4%。ChatGPT诞生前的年份因此成为内置对照组:如果检测结果的上升是工具本身的偏差导致,2021和2022年的标记率应与2026年相当,但第一张图显示事实并非如此。
研究方法
我们选取了10个学科组,2023年1月至2026年7月期间每月每个学科约抽取25篇论文,再加上2021-2022年的8个对照月份样本,总计12750篇论文。每篇论文均采用第一版PDF,避免2026年修订的论文将新文本混入2023年的样本中。我们检测的是论文全文而非摘要,因为摘要的信号强度不足:曾出现过同一篇论文摘要检测得分低于20%、正文得分却高于70%的情况。所有报告数据均附带自助法95%置信区间。
研究结果
2021-2022年,被标记论文占比稳定在0.4%;ChatGPT问世后数月内,占比开始攀升,随后经历两轮增长,在最近一个完整季度达到约32%,并在2026年初接近39%的峰值。不同学科间的差异显著,具体数据见下表和第二张图。以下是截至2026年7月的12个月内,各学科的被标记占比,以及大语言模型出现前的对照水平。
| 学科组 | 大语言模型出现前对照水平 | 近期被标记占比 | 95%置信区间 |
|---|---|---|---|
| 计算机科学 | 0.2% | 65.0% | [59.3, 70.3] |
| 定量生物学 | 3.5% | 56.3% | [51.0, 61.7] |
| 电子工程与系统科学 | 1.7% | 51.3% | [46.0, 57.0] |
| 经济学与金融学 | 2.5% | 47.0% | [41.3, 52.7] |
| 应用物理学 | 1.3% | 34.0% | [29.0, 39.7] |
| 统计学 | 1.8% | 31.3% | [26.0, 36.7] |
| 凝聚态物理学 | 0.0% | 24.0% | [19.3, 29.0] |
| 高能物理学 | 0.5% | 14.0% | [10.0, 18.0] |
| 天体物理学 | 0.0% | 10.7% | [7.3, 14.3] |
| 数学 | 0.0% | 0.7% | [0.0, 1.7] |
计算机科学以约65%的占比位居第一,数学占比最低,仅约0.7%,其低占比的解读难点将在局限性部分说明。对照列数据为各学科在三种灵敏度设置下,2021-2022年标记率的平均值;占比增长最多的学科,并非大语言模型出现前对照水平最高的学科,因此初始水平偏高无法解释占比的增长。
局限性
对照样本量有限:每个学科的ChatGPT前对照样本为200篇论文。在0.4%的标记率下,全部2000篇对照样本中仅8篇被标记,且分散在10个学科中,因此单个阈值下的学科对照率较为粗略。整体基准线的估算较为准确,也是本研究的核心锚点,但各学科的对照水平仅为近似值。即便扩大样本量也无法解决这一问题:要确定每个学科不足1%的标记率,每个学科需要数千篇对照论文,而2023年前arXiv的论文储量无法满足这一需求。
低得分可能意味着AI使用率低,也可能是检测工具盲区:数学学科是最典型的例子。数学论文以公式和定理-证明结构为主,去除公式和参考文献后,剩余的文本非常零散,与检测工具训练所用的科研英语差异较大。即便某篇数学论文大量借助AI生成,也可能因文本不符合检测模型的训练分布而得分偏低,因此数学学科的低得分并不能有力证明论文为人类原创。这一结果对应两种完全不同的解释:要么AI使用率低,要么检测工具在该领域灵敏度不足,现有数据无法区分这两种情况。文本占比越高的学科,检测模型的适配性越强,其AI使用率增长也最显著,因此这一混淆因素并未影响整体趋势。但对于低得分学科,其排名应被视为AI使用率的下限。
检测工具的覆盖范围有限:检测工具对不同生成模型的灵敏度存在差异,而我们无法针对作者实际使用的、未公开的模型与提示词组合进行评估。覆盖不全会导致标记率偏低,因此报告中的AI使用率仅为下限:真实占比至少不低于我们的测量值。各生成模型的具体检测表现见工具说明文档。
标记不等于AI全权创作:检测工具仅能估算文本是否带有机器写作特征,其概率经过校准,误差率已知。它无法区分轻度编辑的AI生成文本与完全由AI生成的文本,单一检测得分绝不能作为指控特定作者的依据。我们报告的是类机器写作文本的普及率,其中包括大量AI辅助编辑的内容。