Reed's News
← 返回精选

两篇伪造作者的论文均获口头报告:同行评审中的AI造假

AI 76 volumes94 2026/7/30 3342 字 原文 ↗

以下是译文正文:

下表列出了各学术会议中,存在伪造引用、伪造作者或明显由大语言模型(LLM)生成内容的评审任务数量,以及对应会议的总评审任务量。

会议 Caleb Isaac
NeurIPS(数据集与基准赛道) 5项任务中占2项
NeurIPS(立场论文赛道) 2项任务中占2项
TerraBytes(ECCV研讨会) 2项任务中占1项 5项任务中占4项
WACV 4项任务中占3项 4项任务中占3项
总计 11项任务中占6项(55%) 11项任务中占9项(82%)

深陷这种"垃圾稿件"困境的绝非我们两人。过去一年,已有多项研究揭示了问题的严重性:

这种"垃圾"现象是双向的:

从评审者的角度来看,这一切实在令人恼火。同行评审是我们利用业余时间(常常是夜晚和周末)完成的无偿工作,只因我们深知自己的研究也依赖高质量的评审。花数小时审阅一篇稿件,却发现其中充斥着虚构引用,这种浪费时间的行为让人怒不可遏!如果你连核对参考文献的时间都不愿投入,那试问:a)我们为何要花时间为你评审?b)你投稿的初衷究竟是什么?从评审意见中学习需要反思自己的工作,而这前提是你得真正投入时间打磨研究。

问答环节

今年夏天你们评审了多少篇论文?其中仅因引用问题就会直接拒稿的有多少?

Caleb:11篇(见上表)。其中5篇的参考文献存在伪造作者或整篇虚构论文的情况。两篇WACV投稿的参考文献第一条就给真实论文标注了虚构作者。还有一篇NeurIPS论文满篇都是无意义的虚构术语,足足53页,根本没必要再去核对参考文献。

Isaac:我也评审了11篇:2篇NeurIPS立场论文、5篇TerraBytes研讨会论文、4篇WACV论文。其中9篇都存在问题(简直离谱!)。两篇立场论文全是LLM生成的垃圾内容,其中一篇的逻辑混乱得像疯言疯语。5篇研讨会论文里有4篇存在伪造引用或作者的情况。说实话,唯一一篇人类撰写的论文质量平平,但读起来没让我生气,所以我给了录用意见。

你们见过最恶劣的情况是什么?

Isaac:有两篇论文引用了我认识作者的真实论文,但把作者名字换成了虚构的人。论文主题、会议和其他作者都是真实的,虚构的名字相似度很高,粗略一看很难发现。我建议拒稿并直接向会议组织者举报了这两篇论文……结果它们居然被录用做口头报告,只要求修正虚构的引用就行。

Caleb:我之前提到过那篇53页、满是虚构术语的NeurIPS论文。还有一篇40页的论文也好不到哪去,同样存在虚构引用。其中一篇论文的多数引用旁还附带LLM生成的注释,简直可笑。我曾花大量时间评审一篇WACV论文,觉得质量不错,后来却发现它把SatMAE的作者写成了"Yuyang Cong、Saurabh Khanna、Chen Meng等人",而真实的SatMAE作者列表开头是Yezhen Cong、Samar Khanna和Chenlin Meng(arXiv:2207.08051https://arxiv.org/abs/2207.08051)。

真实论文配虚构作者,和完全虚构的引用,哪种情况更恶劣?

Caleb:两者都表明作者没有花时间认真核对引用,让人怀疑他们是否真的读过所引用的文献,以及引用是否准确,甚至会让人质疑论文其他部分是否也存在虚构内容。

Isaac:在我看来,两者性质相同。如果作者连自己的参考文献都懒得读,甚至不愿让ChatGPT帮忙检查"确保引用真实",那我凭什么相信论文的其他部分、代码和数据集不是同样敷衍?如今生成研究结果和撰写论文比以往任何时候都容易,但认真评审(哪怕是自己的工作)仍需花费数小时。如果作者都不愿通读自己的论文,我又何必浪费时间?存在虚构引用的论文应该直接拒稿,因为它们显然还没达到录用标准。

判断"这是LLM写的"最可靠的三个特征是什么?按可信度排序。

Caleb:1. 典型的LLM句式,比如"不是X,而是Y""真正的X是Y",以及随处可见的粗体格式和破折号;2. 句子极其冗长晦涩,难以理解;3. 过度夸大研究结果。

Isaac:我发现的典型特征是,论文正文或段落中的数字、指标与表格数据不符。这通常是因为作者写完后重新运行了实验,却忘了让LLM更新或验证全文数据一致性。似乎没人会重读自己的论文。另外,Claude特别喜欢把所有数字和细节都塞进正文,哪怕这些细节本该放在附录或代码里。让它写讨论部分时,它常常只是照搬表格里的指标,完全没有原创思考。这些特征比大量破折号、分号和"不是X,而是Y"更隐蔽,但与ChatGPT出现之前(B.C.)的论文写作风格差异明显。

这种情况如何改变了你们的评审流程?

Caleb:现在我读完摘要后,肯定会先扫一遍参考文献(而且会用我们开发的bib-audit工具)。

Isaac:我现在花更多时间寻找LLM生成的痕迹,只为判断是否直接拒稿。我默认大多数论文都是恶意投稿,所有人都是受害者。我会留意这些迹象:LLM声称用某个定制模型达到了SOTA,但性能提升不到1%,且没有多次实验的均值或标准差;本该引用文献的地方却用复杂数学公式凑数;本该放在附录的消融实验却塞进正文;正文中的数字与表格不符。实际上,除了虚构引用,评审这类AI垃圾论文和之前评审人类写的垃圾论文流程差别不大。但值得一读的优质人类撰写论文或有趣论文数量大幅减少了。

你们评审时,花在评估科学内容上的时间多,还是花在寻找LLM痕迹上的时间多?这种模式可持续吗?

Caleb:除了核对参考文献和大致判断"是否是纯LLM输出",我不会刻意寻找LLM痕迹。如果我看不出是LLM写的,那我并不在意。如果你用LLM辅助写出了有趣且实验可重复的论文,那很棒!但如果你直接提交LLM生成的内容,那我们评审还有什么意义?

Isaac:和Caleb一样,我现在更关注的是:这篇论文是完全的垃圾,还是符合会议要求的有趣研究?道理很简单,评审垃圾论文纯粹是浪费时间。现在评审任务更多了,因为很多会议要求投稿者必须评审4-5篇论文。我简直是被迫评审这些垃圾,感觉像活在某种诡异的地狱里。

说实话,你们自己也用Claude做研究和写作。你们的使用方式和那些问题投稿有什么区别?

Caleb:我们确实每天都用Claude,但这篇文章并不是说"不要用LLM"。这篇博客的很多内容最初也是用AI工具起草的,但我们会仔细检查所有输出:验证、编辑、甚至重写。比如,我用Claude起草了文章开头的文献综述,但我通读了它检索到的论文(其中那篇关于LLM评审对抗攻击的论文https://arxiv.org/pdf/2606.10159让我很惊讶),按自己的逻辑重新组织内容,从Claude最初引用的博客文章中找到原始研究,并删掉了一些我认为不相关的细节。学习本身就是写作的乐趣之一!

Isaac:我提交论文前会彻底通读,所以不会出现这类细节错误。如果真有疏漏,那是我的责任,但你得费很大劲才能找到。不过这是我在LLM出现前就一直坚持的习惯。我发现一个有用的技巧:让Claude找出文中模糊的地方,然后用选择题的形式提问,帮我理清思路,这样它辅助写作时我们就能保持一致,这一点至关重要。对于参考文献,我会用bib-audit工具,但仍会通过Google Scholar或IEEE/CVF等数据库手动核对每一条。不过大多数引用我甚至不用查,因为我积累了多年真实的BibTeX条目,存在Zotero库里可以直接复制粘贴。尽早获取他人反馈也很关键,能确保研究思路和表述适合人类阅读。要接受在写作中途彻底修改内容,最好在截止日期前就打磨出合理的版本——我敢肯定,那些最后关头用LLM生成的论文就是赶出来的。最重要的是,在LLM流行之前就培养出了研究品味。我无法想象现在年轻研究者在LLM大行其道的情况下盲目摸索。

在论文写作中,"约束Claude"具体是什么样的?你们需要反复修正哪些问题?

Isaac:我和Caleb聊过回头去读LLM出现前的视觉领域论文,那些论文的讨论部分听起来像是深思熟虑的人类写的。AI生成的内容过于晦涩,哪怕你反复提示它"让论文流畅无误",也很难做到。破折号和分号要少用。现在Fable 5喜欢用冒号代替破折号,还动不动就写出B2B SaaS营销风格的文字,可能是因为它的通用训练数据导致的。我觉得要在既不过于生硬也不过于平淡之间找到平衡——毕竟我们希望领域外的人也能读我们的论文,而过于晦涩的文字读起来毫无乐趣。最近我尝试用一种介于科学写作和ASD-STE100简化技术英语之间的风格写作,效果不错。

Caleb:Isaac说得很全面,我没什么补充。不管是否用LLM辅助,写作时你都得清楚自己想表达什么,以及受众是谁。明确这两点后,再根据受众调整表达方式。默认情况下,Claude等工具的写作风格并不适合科学受众。你有没有过用LLM写邮件,然后觉得"这不像我写的,不能发"的经历?因为收件人会从风格上质疑邮件的真实性。把LLM输出直接粘贴到科学论文里也是同样的道理。如果我看到大量粗体格式、枚举列表或Isaac所说的"营销话术",我就会质疑内容的来源,就像那个假想的收件人会质疑邮件一样。

会议应该要求作者披露LLM使用情况吗?这会改变什么吗?

Caleb:要求披露——或许可以。但能否改变现状——可能不会。再说一遍,如果你用LLM写出了出色的研究论文,结果经得起检验且可重复,我完全支持!我反感的是被要求花时间给那些作者自己都没用心的论文提供反馈。我们得想办法把这类论文从投稿池中筛选出去。

Isaac:我对披露要求持强烈怀疑态度。它对诚信的作者有用,但大多数人不会如实填写。我们在TorchGeo中加入了AI使用政策,分为"未使用LLM""LLM辅助""完全由LLM生成"几个等级,但没人会勾选最后一项自曝其短。所以它有用吗?有点用。但能改变现状吗?未必。我们真正需要的是直接拒稿机制,至少要有一个标记工具,能识别常见的LLM错误,判断论文是否值得评审。现在是评审者在分担直接拒稿的工作,这对仍坚守诚信的评审者来说不公平。顺便提一句,我注意到ICLR现在在OpenReview上公开作者姓名,这显然是为了遏制垃圾论文的一种选择。我猜其他会议也会效仿。

谁该为这种情况负主要责任:作者、导师、领域主席(AC)和组织者,还是会议本身?

Isaac:乏味的答案是所有人都有责任。有趣的答案是作者,因为诚信投稿者和那些为了刷简历而往OpenReview里乱投论文的人之间存在真实的差距。早在LLM出现之前,学术出版的激励机制就备受诟病——Lipton和Steinhardt在2018年就记录了数学滥用、语言误用和激励错位等问题https://arxiv.org/abs/1807.03341。我记得曾有一场争论https://www.reddit.com/r/MachineLearning/comments/1tfh2s9/program_misleading_high_school_students_into/,讨论Kevin Zhu和他的Algoverse公司忽悠高中生家长向NeurIPS提交约500篇论文是否合适。这种垃圾论文必须停止。我们得认真判断哪些想法真正有价值,哪些写成博客就足够。现在你可以把任何课程作业包装成NeurIPS投稿,但问题是,你应该这么做吗?

Caleb:作者们,不要提交低质量论文。Opus 4.6(大概是这个版本)和Karpathy的自动研究仓库刚出来时,我出于好奇用自动研究流程在LandCoverAI数据集上得到了"最优结果",然后让AI生成了一篇"论文"。它看起来像模像样,但我绝不会拿去投稿,因为那算不上真正的研究贡献。导师们,不要让你的学生提交低质量论文。组织者们,想办法筛选掉低质量论文。说起来容易做起来难,因为AI/ML会议的投稿量已经连续几年激增(而且还在增长,我刚看到AAAI 2027收到了4.8万份摘要投稿)。

参考文献审核工具

认真核对参考文献意味着要将每一条目与出版商存档记录比对,逐一检查论文中的标题、年份和每位作者姓名是否一致,每篇论文大概要核对40多条。这项工作机械重复,完全可以自动化——而这正是我们最反感无偿做的评审工作,所以我们开发了自动化工具。我们现在使用的审核工具是bib-audit,这是一款基于MIT许可证的Claude Code技能,发布在我们新的技能市场中:

从命令行安装:

然后让Claude审核你的参考文献,该技能会自动触发。

你可以上传.bib.bbl文件或PDF本身;对于后两种格式,Claude会先将渲染后的参考文献还原为结构化字段(还原参考文献是自然语言处理任务,不是正则表达式能完成的),然后由技能脚本完成后续工作。每条参考文献都会与CrossrefarXivDataCiteSemantic Scholar进行比对,逐字段与存档记录差异分析,并按问题严重程度排序报告:不存在的引用文献、伪造的标识符和作者、真实论文的错误元数据(作者列表截断、预印本与发表版年份不一致),最后才是格式问题。差异分析涵盖完整作者列表,这一点很重要,因为只检查标题是否存在的话,像SatMAE那种替换作者的伪造引用很容易蒙混过关。格式检查规则源自John Owens的《参考文献常见错误》https://www.ece.ucdavis.edu/~jowens/biberrors.html(值得通读一遍),所以在查找伪造内容的同时,还会标记单连字符页码范围、以URL形式存储的DOI,以及`J.D.`式缩写等格式问题。

工具在判定时也很谨慎。如果参考文献没有DOI或arXiv编号,只能通过标题搜索比对,这类结果会作为建议检查项,提示手动核实。评审时正确的做法是如实报告观察结果——比如"arXiv记录的第一作者是Yezhen Cong,而非Yuyang Cong"——把动机判断留给编辑。投稿前先用它审核自己的草稿,就不会在评审阶段被别人查出问题;.bib格式的审核是只读且无依赖的,只有当标识符绑定的信息不匹配时才会报错,因此可以作为预提交检查环节集成到持续集成(CI)流程中。(不是Claude用户?通过 npx skills add isaaccorley/skills可以将该技能安装到Codex、Copilot、Cursor等大多数AI工具中。)

投稿内容(包括参考文献)是保密的,而该审核工具会将部分内容发送给托管LLM处理——尽管LLM不会参与撰写评审意见。ECCV 2026的评审政策规定,"不得使用LLM撰写评审或元评审,无论是本地运行还是通过API调用",同时禁止评审者向LLM分享投稿内容的实质性片段。WACV的评审指南称AI生成的评审是"极不负责任的行为",会导致评审者自己的论文被直接拒稿,其保密规则禁止将投稿内容展示给非评审人员——托管LLM显然不属于评审人员。NeurIPS的LLM政策限制了评审者向LLM服务分享的内容;其AI辅助评审实验是唯一认可的使用途径。

参考文献

由人工验证 :)

会议政策:

工具:

引用格式

@online{robinson2026,
author = {Robinson, Caleb and Corley, Isaac},
title = {Q\&A from the Slop Trenches},
date = {2026-07-30},
url = {https://geospatialml.com/posts/reviewing-ai-slop/},
langid = {en}
}