华潮新闻网
科技

arXiv近三成论文涉AI写作 CS学科AI味论文占比超六成

来源:华潮新闻网
arXiv近三成论文涉AI写作 CS学科AI味论文占比超六成

新智元报道

arXiv上三分之一的论文,竟是AI代笔?

近期,unslop发布的一项研究在外网引发了剧烈震荡。

在过去一年里,该检测器给计算机科学领域65%的新论文打了红标。

网友们甚至戏称这为「大泔水时代」。

但在同一时期,数学领域的标记率仅为0.7%。

ChatGPT一出,数据曲线瞬间飙升

这项研究团队梳理了12750篇arXiv论文,时间范围覆盖2023年1月至2026年7月。

研究选取了十个学科,每个领域每月随机抽取约25篇全文进行分析。

对照组则锚定在2021至2022年,那是ChatGPT尚未问世、人类独自耕耘的阶段。

数据显示,2021至2022年间,标记率一直维持在0.4%的低位;但随着ChatGPT的发布,这一比例在数月内急剧攀升。

在最近一个完整季度中,标记率升至32%,而到了2026年初,峰值更是逼近39%。

细分学科来看,计算机科学的情况最为严峻,标记率高达65%。

值得注意的是,在ChatGPT出现之前,这一基线数值仅为0.2%。短短三年间,数字暴涨了300多倍。

紧随其后的是定量生物学(56.3%)、电气工程(51.3%)以及经济金融(47%);随后依次是应用物理(34%)、统计学(31.3%)、凝聚态物理(24%)、高能物理(14%)和天体物理学(10.7%)。

榜单末尾是数学:0.7%。

面对同一台检测仪和同一个论文库,两者落差接近100倍。

这是数学家们集体坚守纯手工写作?还是这台机器在面对数学公式时彻底致盲?

跌至谷底的0.7%,源于机器的「色盲」

其实,谜底早已写在unslop的报告里。

试想一下,一篇标准的数学论文由什么构成?满屏皆是符号、公式、定理与证明,真正以英语撰写的散文式句子寥寥无几。

偏偏该检测器只识别文字。它关注的是句子结构、用词习惯及段落组织。

而在数学论文中仅存的那几行文字,多为「设X为……」「由引理3可推导」等格式化表达,与检测器训练数据中的科学英语并不在同一频道。

因此,团队也坦承目前研究存在局限:

数学领域的0.7%尚不足以说明问题。这可能是数学家确实少用AI,也可能是检测器无法理解数学论文,但现有数据无法区分这两种情况。

此外,对照组样本量较小。每个学科仅有200篇ChatGPT前的论文,按0.4%的误报率计算,2000篇中总共只有8篇被标记。这种精度只能算作粗略估计。

再加上前文提到的检测不全问题,这些数字实际上只是下限,真实比例可能更高。

越内卷的领域,越依赖AI

那么,究竟是谁在利用AI撰写论文?

答案隐藏在斯坦福另一项历时两年的数据中。

2024年3月,斯坦福Weixin Liang团队率先将目光投向同行评审环节:在ICLR 2024的审稿意见中,约10.6%的句子曾遭LLM大幅修改。论文尚未最终定稿,审稿人已先行使用。

2025年8月,同一团队将样本扩大至112万篇论文,并直接发表于《自然·人类行为》。

研究表明,截至2024年9月,计算机科学论文摘要中经LLM修改的比例最高已达22.5%。且使用频率最高的,正是那些频繁发布预印本、身处最内卷领域的研究者。

领域越内卷,使用越频繁。

在此背景下,AI写作已演变为一场军备竞赛:同行借助AI提速,仅靠手写的人便会慢半拍。

难怪这份报告在X平台上广为流传的一条转发,其配文首句便是:「提示词:写一篇能发arXiv的论文。」

它嗅出的是「味道」,而非AI本身

不过,暂勿急于对这65%下定罪论。

团队在报告中亦承认,检测器无法区分「AI仅润色语法」与「整篇由机器代工」,它仅能识别文字中的机器味浓度。

因此,65%的准确解读应为「65%的论文闻起来像AI」,而非「65%的论文由AI撰写」。

但麻烦在于,这种机器味,人类作者也会沾染。

有研究者不信邪,将自己多年前的旧论文投入检测工具,结果27%至74%的内容被标红。

要知道在那个年代,ChatGPT的影子都未曾出现。

原因显而易见。

翻阅今日的学术期刊,满纸充斥着大型语言模型、基准测试及业界前沿术语。措辞越标准、结构越工整,越易触发检测器认定的机器特征。

况且,LLM本就是基于此类论文训练而成。并非学者写得像AI,而是AI生来就写得像学者。

当所有文字皆成嫌疑对象

事实上,这两年我们都在做着与检测器相同的事。

读到一段四平八稳、词句工整、充斥着「不仅……而且……」的文字,心中难免咯噔一下:这怕是AI写的吧?

unslop的检测器,只不过将这种玄学的嗅觉,转化为了可量产的数字仪器。

毕竟,怀疑一旦入脑,便难以卸载。

过去,「写下来」本身即是一种背书。一个人愿意耗费数小时组织文字,至少证明其态度认真。

如今,即便文笔再漂亮,也可能只换来一句「是AI吧」。

有些人甚至开始刻意避开使用了半辈子的词汇,只因它们「听起来太像AI」。

此刻,「AI味」正演变为席卷文字圈的新型原罪。

颇具讽刺意味的是,直至今天,我们仍未精确测量出这股原罪的具体构成要素。

参考资料:

https://unslop.run/blog/measuring-ai-writing-on-arxiv

编辑:摩西

秒追ASI

相关推荐