ai检测工具盯上学术论文 三分之一arXiv平台沦陷 cs类论文六成被标上ai味 数学类仅0.7% 学者过往未用ai的旧论文也被测出不同程度机器味

ai检测工具盯上学术论文 三分之一arXiv平台沦陷 cs类论文六成被标上ai味 数学类仅0.7% 学者过往未用ai的旧论文也被测出不同程度机器味

新智元报道

arXiv上三分之一的论文,竟是AI炮制?

近日,unslop发布的一份研究报告在境外网络引发剧烈震荡。

过去一年里,该检测器将计算机科学领域65%的新发表论文标红。

网友甚至戏称这一现象为「大泔水时代」。

与之形成鲜明对比的是,同期数学论文的标记率仅为0.7%。

ChatGPT横空出世,曲线瞬间飙升

这项研究梳理了12750篇arXiv论文,时间跨度覆盖从2023年1月至2026年7月。

团队锁定十个学科,每月随机抽取约25篇全文进行分析。

对照组设定在2021至2022年,那是ChatGPT尚未问世、由纯人类主导的年代。

数据显示,2021至2022年间,标记率稳定维持在0.4%;但随着ChatGPT的发布,曲线在数月内急剧攀升。

在最近一个完整季度中,标记率升至32%,而到了2026年初,峰值更是逼近39%。

细分学科来看,计算机科学的形势最为严峻,标记率高达65%。

值得注意的是,在ChatGPT出现之前,这一基数仅为0.2%。短短三年内,数值暴涨了300多倍。

紧随其后的是定量生物学(56.3%)、电气工程(51.3%)以及经济金融(47%);随后依次是应用物理(34%)、统计学(31.3%)、凝聚态物理(24%)、高能物理(14%)和天体物理(10.7%)。

榜单末尾则是数学:0.7%。

同一套检测设备,同一个论文库,两者差距接近100倍。

究竟是数学家们集体坚持手工写作?还是这台机器面对数学公式时完全成了瞎子?

跌至谷底的那个0.7%,源于机器的致盲

其实,谜底已被unslop在报告中自行揭晓。

试想一下,一篇标准的数学论文通常呈现何种面貌?满屏充斥着符号、公式、定理与证明过程,真正以英语写成的散文段落寥寥无几。

偏偏该检测器仅识别文字内容。它关注的是句子结构、用词习惯及段落组织方式。

而在数学论文中仅剩的那几行文字,多为「设X为某某」「由引理3可推导」等格式化表达,这与检测器训练数据中的科学英语几乎不在同一频道。

因此,团队也坦言当前研究存在若干局限:

数学领域的0.7%目前尚不足以说明任何问题。这可能是数学家确实极少使用AI,也可能是检测器无法理解数学论文,但现有数据无法区分这两种情况。

对照组样本量偏小。每个学科仅有200篇ChatGPT前的论文,按0.4%的误报率计算,2000篇中总共只有8篇被标记。这种水平仅能视为粗略估算。

此外,如前所述,检测器存在漏抓现象。因此,这些数字仅代表下限,真实比例只会更高。

越是内卷的领域,越依赖AI

那么,究竟是谁在用AI撰写论文?

答案隐藏在斯坦福另一项历时两年的数据中。

2024年3月,斯坦福大学的Weixin Liang团队率先将审视目光投向同行评审环节:在ICLR 2024的审稿意见中,约10.6%的句子曾被LLM大幅修改。论文本身尚未最终确定,审稿人却已先行使用。

2025年8月,同一团队将样本扩大至112万篇论文,并直接发表于《自然·人类行为》期刊。

研究显示,截至2024年9月,计算机科学论文摘要中使用LLM修改的比例最高已达22.5%。其中,使用频率最高的群体,正是那些频繁发布预印本、身处最激烈竞争领域的研究者。

竞争越激烈的领域,使用程度越深。

在此背景下,AI写作已演变为一场军备竞赛:当同行都借助AI提速时,仅依靠手写的人必然落后一步。

难怪这份报告在X平台上流传甚广的一条转发,其配文首句便是:「提示词:写一篇能发arXiv的论文。」

它捕捉的是「味道」,而非确凿的AI身份

不过,暂勿急于对这65%的数据定罪。

团队在报告中亦承认,检测器无法区分「AI仅润色语法」与「整篇机器代工」,它仅能识别文本中的机器味浓度。

因此,65%的正确解读应为「65%的论文闻起来像AI」,而非「65%的论文由AI撰写」。

棘手之处在于,这种机器味,人类自身也会沾染。

有研究者不信邪,将自己多年前的旧论文投入检测工具,结果27%至74%的内容被标红。

要知道在那个年代,ChatGPT的影子都未曾出现。

原因不难察觉。

翻阅当下的学术期刊,满眼皆是大型语言模型、基准测试、业界最前沿等词汇。措辞越规范,结构越严谨,越容易触发检测器认定的机器特征。

况且,LLM本身就是基于此类论文训练而成。并非学者写得像AI,而是AI生来就模仿学者的口吻。

当所有文字皆成嫌疑对象

事实上,这两年我们一直在做着与检测器相同的事情。

读到一段四平八稳、词句工整、充斥着「不仅……而且……」结构的文字,心里便会咯噔一下:这莫非是AI写的?

unslop的检测器,不过是把这种玄学的嗅觉,转化为一台可量产数字的仪器。

毕竟,怀疑一旦植入脑海,便难以剥离。

过去,「写下来」本身即是一种背书。一个人愿意花费数小时组织文字,至少表明其态度认真。

如今,无论文章写得多么漂亮,都可能只换来一句「这是AI吧」。

有些人甚至开始刻意回避自己使用半辈子的词汇,只因它们「听起来太像AI」。

此刻,「AI味」正演变为席卷文字圈的一种新型原罪。

讽刺的是,直至今天,我们仍未能精确测量这股原罪的具体构成。

参考资料:

https://unslop.run/blog/measuring-ai-writing-on-arxiv

编辑:摩西

秒追ASI