|
AI审稿对学术杂志的机遇和挑战
假设你是一名编辑或审稿人,桌面上堆积着大量尚未审阅的稿件。你的一些同事正在试用人工智能(AI)驱动的审稿工具,以期减轻工作负担。部分工具可以检查引用错误或计算错误;另一些工具甚至能够评判论文的研究结论是否成立,判断研究是否推动了该领域的知识进展。你会阅读这些AI给出的评估意见吗?会信任它们吗?是否会依据AI意见批评或拒稿?
对于科学界而言,这些问题正变得愈发突出。多年来同行评审体系一直不堪重负,如今生成式人工智能又带来全新的巨大挑战。科学论文发表数量5年内翻了一番,2025年已超800万篇(见下方图表);部分期刊出版商表示稿件投稿量涨幅更为迅猛,大型语言模型(LLM)的普及是重要推手——这类模型短短几分钟就能生成论文初稿。编辑越来越难找到愿意审稿的研究者,导致从投稿到发表的周期拉长,动辄数月甚至一年以上。内容托管商Silverchair今年发布的一份报告显示,仅仅为拿到一份完整审稿意见就十分困难。
部分科研人员与出版商认为,人工智能必将成为解决方案的一环。支持者提出,将同行评审的部分流程自动化,可以加快发表速度,节省科研人员时间。事实上,越来越多审稿人正在使用这类工具:Frontiers出版社面向多个学科的1645名科研人员开展全球调查,结果显示,2025年略超半数受访者会在审稿工作中使用人工智能,包括协助撰写评审意见,部分场景下还用来审查研究方法与统计学内容。尽管许多期刊禁止这类行为,该比例仍较上一年的29%有所上升。
但也有学者对机器能否给出可靠评审意见持怀疑态度,尤其是同行评审中最重要的核心环节,包括评估研究创新性与科学价值,同时还要规避算法偏见、人为钻空子等风险。斯坦福大学博士后研究员约阿希姆·鲍曼研究人工智能对社会的影响,他表示:“同行评审危机真实存在,人工智能看似很有希望,但草率推进大量评审判断环节自动化可能适得其反。我们必须确保所使用的工具能够胜任这项任务。”
激增的审稿压力
生成式人工智能进一步加速了持续数十年的科学论文增长态势,编辑与审稿人疲于应对。
(图表:V. Penney/《科学》杂志;数据来源:Dimensions)
近年来,检验人工智能能力的研究项目与试点试验大量涌现,目标正是解决上述难题。艾伦人工智能研究所与耶路撒冷希伯来大学的研究员汤姆·霍普正在开发AI审稿工具,他说:“如果我们最终能让大语言模型真正做好这件事——显然模型性能正在持续提升,我坚信AI会帮助我们走出这巨大的困境。”弗吉尼亚大学的数据科学家斯蒂芬·特纳则提出:“问题不在于AI能否比肩最优秀的人类审稿人,而在于:在清晰评审标准辅助下的AI协助审稿,是否优于那些受疲劳、情绪影响,质量参差不齐的普通审稿意见。”
目前,多数期刊基本禁止审稿人使用AI工具,直到编辑确定如何借助AI保障高质量评审。然而特纳指出,现实情况往往是“大家在私下、不受监管地使用这些工具。现在这片领域几乎毫无规则,如同蛮荒西部。”
基于以上背景,《科学》杂志整理了这份导读,介绍科研人员关于AI辅助审稿的研究进展,以及如何高效合理使用这类工具。
人类审稿存在固有缺陷
同行评审是学术交流不可或缺的一环。但弗吉尼亚大学儿科肾病方向医师、研究员阿格涅什卡·斯维亚泰茨卡-厄本认为,人类评审意见主观性强,有时流于表面,令人无奈。当审稿人指出她稿件的缺陷时,有些意见仅仅写着:该结果降低了审稿人的研究兴趣。她说:“这非常令人恼火,因为意见没有聚焦科学本身。而且我发现很多审稿人存在敷衍倾向,只是草草浏览,无法做到细致审查。”已有研究证实,人类审稿人更容易青睐知名学者的成果,还会写出措辞尖锐的批评意见。
斯维亚泰茨卡-厄本认为,如果设计得当,AI审稿可以补充甚至超越人类审稿。近期她借助AI为多篇论文和基金申请书提供修改建议,发现效果不错,例如核验结论是否由实验结果推导而来,检查正文、表格与图片中的数值是否前后统一。“最让我印象深刻的是它的客观性。”她说。
多项研究证实,机器生成评审意见的一致性更高。鲍曼及其团队近期开展的研究显示,当AI与人类评审对会议稿件打分时,AI打分结果的离散程度远低于人类。部分研究者将此视为优势,能够修正审稿人粗心疏漏带来的问题。但鲍曼提醒,打分高度趋同也可能催生“知识单一化”,打压非主流创新观点。
另一些学者看重传统同行评审反馈的多样性。马克斯·普朗克生物研究所微生物学家露丝·莱伊说:“我喜欢人类审稿的一点是,你会收到三份完全不一样的评审意见,每个人关注的重点各不相同。失去这种多元性会非常可惜。”
审稿意见之所以差异巨大,根源在于评估研究创新性本身就带有主观性。创新性常被视作同行评审的核心职责,但很难界定与评判。霍普团队就在研发能够辅助评估创新性的AI工具。该方法利用大语言模型提取论文的核心创新论点,检索并归纳已发表的相关文献,评估这篇新论文相较于既往研究有哪些突破。该团队针对某机器学习会议的182篇投稿开展测试,多数情况下,人类评估者认为AI对创新性的评审质量至少不逊于人类撰写的评审意见。不过霍普承认,这套方法有可能漏掉人类专家能够识别的颠覆性成果,并且难以跟上发展极快的前沿学科。评估创新性“是个很有意思的难题,本身就极难评判。”
AI同行评审擅长的领域
大语言模型的一大优势,是完成那些常规、繁琐的正确性核查工作——时间紧张的人类审稿人常常跳过这一步。多年来,出版商一直在使用自动化工具排查论文抄袭、核查研究方法披露是否透明,以及校验其他标准。近期研究表明,大语言模型可以进一步拓展这类能力。
一项研究中,科研人员使用OpenAI的GPT-5评估2018至2025年三大顶尖机器学习会议录用的2500篇随机抽取论文。研究团队在2025年12月的arXiv预印本论文中报道,AI可以基于明确、细分的标准评估论文,例如计算是否正确、正文描述与表格数据是否吻合。AI发现约三分之一论文至少存在一处可能影响结果解读、可重复性或后续应用的错误;人类复核确认其中83%的错误属实,尽管大部分错误不会改变文章核心结论。同时AI检测数学错误的能力优于文本错误。该研究共同作者、斯坦福大学AI研究员邹杰说:“人类审稿人未必有时间逐行通读全文。这体现出AI与人类的互补价值。”
AI可发挥作用的场景
出版商表示,人工智能目前尚不能替代人类评估论文的创新性与整体质量,但研究显示AI能够为这类判断提供参考依据。
制图:A. Mastin/《科学》杂志
另一项arXiv平台2025年5月发布的预印本研究,针对同一稿件,细致对比人类与AI评审意见。总体来看,在常规但耗费人力的任务上(例如运行稿件附带的代码,验证代码能否支撑论文结论),AI审稿人比人类更加严谨。
这项研究是同类研究中规模较大的一项。卡内基梅隆大学博士生金承元及其团队收集了82篇发表于《自然》子刊论文的预印本版本,以及期刊随正式出版文稿一并公开的人类审稿意见。研究人员调用三款主流大模型(OpenAI的GPT、Anthropic的Claude、谷歌Gemini),对这些预印本生成结构化评审。随后团队邀请45名科研人员,对AI评审中3000条独立批评意见打分,评判意见是否准确、是否基于证据、是否具备价值(即能够切实改进论文),同时为每篇论文筛选最优人类评审意见。
综合三项指标来看,所有论文汇总结果中,GPT得分高于最优人类审稿人;三款大模型得分均高于最差人类审稿人。作者报道,大约四分之一AI提出的问题,没有任何人类审稿人发现,而且这些问题并非细枝末节。(AI在部分关键方面也会出现疏漏,详见“AI审稿的短板”)。
部分论文作者已经可以使用专为科研论文设计的核查工具,反馈称在投稿前修改稿件时很有帮助。今年,三场计算机学术会议为作者提供谷歌基于Gemini开发的论文辅助工具,用于检查研究方法、计算过程与证明推导。谷歌科研人员称,在参加神经信息处理系统大会(NeurIPS)、使用该工具的1068位作者中,86%表示该工具帮助很大或有一定帮助。
为回应相关顾虑——未发表稿件输入AI后,内容可能被用于大模型训练或泄露,这款论文辅助工具以及其他稿件评估服务承诺,上传稿件将存储在独立内网私有数据库,不接入互联网。NeurIPS表示,会议评审专家不会看到AI生成的评审意见。
近几个月,预印本平台bioRxiv也新增选项,作者可以将稿件提交至多款AI技术审查工具中的任意一款。AI评审内容仅作者可见,作者可以选择是否修改稿件再上线。部分用户给出正面评价,例如一款名为q.e.d. Science的审查工具。塔夫茨大学发育生物学家、生物工程学家迈克尔·莱伊去年使用了该服务,他说:“在我35年论文投稿生涯里,q.e.d.给出的审查意见比很多同行评审更加严谨、用心,建设性更强,实用性更高。”
AI审稿的短板
尽管金承元的研究发现AI审稿具备优势,但也暴露诸多缺陷。例如,大语言模型给出评估结论的整体正确率低于人类审稿人。有一例AI错误批评一篇中国空气污染相关论文未校正已知数据偏倚,但该研究实际上已经完成校正。金的团队认为,该错误源于大模型固有局限:工作内存存在限制,容易忽略分散在论文多个章节及补充材料里的相关细节。
大语言模型对部分细分学科的研究方法惯例理解有限。例如另一AI审稿人批评大型强子对撞机团队的粒子物理论文,认为数据分析细节不足,降低研究可重复性。但人类审稿人指出,这类数据统一存储在对撞机所属的欧洲核子研究中心(CERN),是粒子物理领域通行惯例,AI并不了解。
总而言之,金承元团队写道:“AI审稿人可以作为补充,但不应取代人类审稿人。AI审稿人与人类审稿人能够识别论文中需要审查的部分,但对所发现问题的解读存在差异,这意味着AI评审小组无法直接替代人类评审小组。”
AI评审还可能提出不合理的额外实验要求。莱伊将自己一篇已发表论文交给q.e.d. Science审核时,AI建议补充大量细节,需要开展耗时的后续实验,但这些实验并非支撑论文核心论点所必需。她说:“AI提出的内容属于下一步研究、下一篇论文要做的工作,会耗费巨量时间。这正是人类判断发挥作用的地方。”
一些科研人员还提到,AI评审文字冗长,容易揪着细枝末节,却无法标出最高优先级的核心问题。雅虎研究院的松吉吉本,在今年美国人工智能协会年会(AAAI)的试点项目中看到一份AI评审(该项目测试AI评估会议投稿)。这份评审分为3个部分,包含34个要点,总计14000字符;而他对同一篇论文的评审仅4000字符。“AI评审篇幅过长,各个要点之间关联性差,信息冗余。”他认为AI生成的摘要流于表面。
模型还会继承训练文本自带的固有偏见,例如更偏好来自知名机构作者的成果。亚利桑那州立大学计算社会科学家安东尼·豪厄尔团队在2025年arXiv预印本论文中报道,实验中,研究人员让大模型评估多篇《美国国家科学院院刊》论文,稿件内容完全一致,仅更换第一作者姓名与所属单位。相较于知名机构作者,大模型更倾向于建议拒掉普通机构作者的稿件。
此外,面对新兴领域或细分方向,可用于模型参考的既往研究较少,AI审稿人很难评判这类成果。多项研究发现,AI存在迎合倾向,给稿件打出的平均分通常高于人类审稿人。鲍曼的研究还表明,如果作者刻意提示大模型改写论文以博取高分,可以诱导AI给出更高评分,他将这种操作称为“论文洗白”。
归根结底,使用AI甚至不一定节省审稿人的时间。伦敦大学学院团队去年在一场会议报告中介绍,研究人员安排24位科研人员评审两篇同类已发表论文,其中一篇要求借助AI辅助。使用AI时,审稿人查阅相关文献的时间变少,但需要额外花费时间核验AI建议的准确性。在一份耗时一小时的评审任务中,最终节省的时间仅有几分钟,不具备统计学意义。
该研究团队成员、人机交互研究者邓肯·布伦比提出,鉴于AI存在各类局限,人类需要抵制AI带来的诱惑:“AI输出的内容越是流畅自然,人们就越容易直接采信这份看似深思熟虑的评审意见,而省略对应的深度思考。”
会议与期刊试水AI审稿
尽管AI评审仍存在诸多不确定性,相关使用规范尚未建立,部分期刊编辑与学术会议仍开展真实场景试点。得克萨斯大学奥斯汀分校机器人研究员乔伊迪普·比斯瓦斯及其团队筹办本年度AAAI会议时,面临投稿量激增、审稿压力巨大的难题。他表示,会议主题为人工智能,团队有责任也有机会研究这一“社会技术问题”,探索AI能否减轻审稿负担。即便如此,争取试点项目立项并不容易。“我在执行委员会任职多年,从未见过一场讨论如此充满争议、耗时漫长。”
团队确定试点目标:测试并收集AI审稿效果数据,同时保留充足人工参与,限制AI评审意见对稿件最终录用/拒稿结果的影响。他们采用一组协同工作的大语言模型,处理本届会议收到的3万份投稿(是上一年投稿量的两倍)。作者除至少两份人类评审意见外,还会收到一份AI评审意见。只有人类评审带有打分与录用建议,且人类审稿人阅读稿件时看不到AI评估。作者随后撰写答辩意见,供会议人类评委做出最终决定。
近6000名作者、审稿人和评委参与调研,在9项质量指标中的6项上,多数受访者认为AI评审优于人类评审,例如评审是否全面、能否提出有价值的研究方案改进建议。但在部分重要维度上作者更认可人类评审:包括评审是否存在技术错误、是否过度放大次要问题。整体来看,作者群体对AI评审的好感度高于审稿人与评委。比斯瓦斯说:“单一份AI评审无法同时满足三类人群。作者希望改进论文;而评委需要一句话总结,判断这项研究是否对领域做出原创贡献——这类判断往往需要人类独有的直觉。通过这次项目,我充分体会到人类专业判断的重要性。”
比斯瓦斯补充道:“我认为可以采用人类+工具的模式,让一位专家能够处理更多稿件,高效利用时间,保证每一篇论文都能获得一定程度的人工审阅。”AAAI计划在2027年会议继续开展该试点,但不会仅依靠AI评审直接拒稿;他预判,这项举措会遭到参会学者强烈反对。
>引用
>我们必须确保所部署的工具能够胜任这项任务。
>——约阿希姆·鲍曼,斯坦福大学
另一机器学习会议——2025国际表征学习大会(ICLR)也开展试验,探究大语言模型能否基于稿件原文和人类初稿评审意见优化评审。审稿人读取AI反馈后,27%的人修改了自己的评审意见,修改后的篇幅平均更长,几乎所有人至少采纳了一条AI给出的建议。独立人类评估小组判定,三分之二这份参考AI修订后的评审意见优于原始版本。《自然·机器智能》2月刊载描述该试验的论文,通讯作者邹杰说:“有这么多审稿人采纳AI建议,我们很惊喜,毕竟审稿人都十分繁忙。”
但伦敦大学学院团队采访该会议审稿人后,得到的反馈褒贬不一。研究显示,部分审稿人认为AI给出的意见冗余,甚至带有说教感,一味建议补充过多细节。一位审稿人告诉研究人员:“我对自己的评审意见有信心,不会盲从AI给出的内容。”
期刊方面,《新英格兰医学杂志》旗下专注医学人工智能的子刊《NEJM AI》去年启动试点“快速通道”:结合AI分析与人类编辑评审,7日内给出录用或拒稿结论。该通道仅面向编辑判断大概率能通过常规评审录用的稿件。稿件不送外部同行评审,由一名编辑独立完成完整人工评审(不借助AI),其他编辑结合人工评审与AI分析,共同决定是否刊发。
哈佛医学院生物医学信息学研究者、该刊高级副主编阿俊·曼莱表示,自2025年11月该通道刊发前两篇论文以来,AI分析质量持续提升,作者与编辑的接受度也不断提高。他说,AI在标记方法学缺陷、提升文稿可读性方面尤其有帮助。但“我们仍然会核验AI提出的结论,对照原文仔细阅读;‘信任,但必须核验’仍是我们的准则。”
曼莱说:“几乎可以肯定,AI未来在《NEJM AI》的评审体系中将承担更多工作。就在不久前,顶尖医学AI期刊在同行评审中使用AI,还是难以想象的事情。我认为相关行业规范正在发生转变。”
doi: 10.1126/science.z6vx92p
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-7 15:55
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社