头版Folia Daily Briefing
← 返回头版
科技人工智能

研究人员测量arXiv论文中的AI写作比例,发现检测方法存在局限

研究人员对arXiv上的12,750篇论文进行了分析,通过校准检测器评估机器生成内容的规模 [1]。该检测器在0.4%的误报率下进行了校准,以2021-2022年ChatGPT发布前的论文作为基准 [1]。

分析涵盖了2023年1月至2026年7月期间发布的论文 [1]。结果显示,最新完整季度中约32%的论文呈现机器写作特征,而2026年初的峰值接近39% [1]。这一比例自ChatGPT发布以来在多个领域显著上升 [1]。

不同学科的检测结果差异巨大 [1]。计算机科学领域AI写作占比最高,达到约65%;而数学领域最低,仅约0.7% [1]。研究指出,数学领域的低比例与该学科文本结构的差异导致检测困难有关 [1]。

研究团队同时指出了该检测方法的多项局限性 [1]。检测器无法区分经过轻度编辑的文档与完全由机器生成的文档,因此报告的数字应理解为机器化写作流行度的下限 [1]。此外,该方法在覆盖率、控制样本量等方面也存在制约 [1]。


arXivAI检测学术写作大语言模型计算机科学