氢分子医学分享 http://blog.sciencenet.cn/u/孙学军 对氢气生物学效应感兴趣者。可合作研究:sunxjk@hotmail.com 微信 hydrogen_thinker

博文

AI 智能体让科研核验自动化 精选

已有 730 次阅读 2026-8-26 15:02 |系统分类:海外观察

AI 智能体让科研核验自动化

一场顶级学术会议收录 6000 篇论文:人工智能能够复现这些研究结果吗?

黑客松竞赛结果表明,AI 智能体有望科研核验成为常规操作

图片6.png

唐詹森坦言,自己并不是人工智能(AI)研究人员,他的本职是在一家银行负责网络安全风险管理。

但就在本月,他在一场竞赛中拔得头筹。该竞赛要求参赛者利用人工智能,复现世界顶级计算机学术会议——国际机器学习大会(ICML)数千篇已发表论文的实验结果。仅仅19天,他就完成了363篇前沿论文的复现,在1200多名参赛者中位居第一。他取胜的秘诀是什么?是一套由AI智能体组成的工作集群,这些专门用于自主完成特定任务的AI模型,被他称作基于KRACK(知识‑推理‑智能体‑一致性内核,Knowledge, Reasoning, Agency & Coherence Kernel)的“AI智能助手集群”。

本次黑客松由开源AI社区平台Hugging Face与alphaXiv联合发起,提出了一个极具挑战性的问题:依靠AI智能体,能否完成大规模科研成果核验?而这样的规模,靠人类审稿人已经越来越难以实现。换言之,如果输入论文的数据、代码与实验方法,AI是否能够独立复现实验,得到完全一致的结果?

本次竞赛是迄今为止规模最大的一次,尝试用人工智能复现顶级技术会议论文。很多参赛者和唐詹森一样,并非科班出身的AI专家。即便如此,参赛者最终一共完成了2000余篇论文的复现工作;还发现数百条实验结果无法被AI智能体复现,或是找不到证据支撑,其中就包含唐詹森的AI助手排查出的21篇。到目前为止,黑客松的组织者确认,至少有十几篇论文确实存在真实错误,这些问题都被会议的人类审稿人遗漏。

支持该项目的人士表示,这项工作证明AI可以辅助人类同行评审专家,应对会议论文数量暴涨的现状,提升论文质量。Hugging Face机器学习团队负责人、本次黑客松组织者之一阿布巴卡尔·阿比德谈道:“我们已经证明,在理想情况下,每一篇论文投稿时,都可以交由AI智能体尝试复现实验,很多显而易见的问题会在第一时间暴露。这将极大维护科学研究的严谨性。”

近些年来,计算机学术会议的投稿量呈现爆炸式增长。今年ICML会议录用约6000篇论文,数量几乎是上一年的两倍。然而人类审稿人的储备规模并未同步增长,这种供需失衡,已经让同行评审体系濒临极限。

AI能否助力同行评审,这一话题目前仍存在激烈争论。同行评审往往需要对研究的创新性、科学价值做出主观判断,理想状态下,这类评判本应当由人类专家完成。但现实中,复现实验需要大量繁琐的溯源工作,数据、代码以及各类实验材料常常零散分布在互联网各处;并且复现他人工作几乎不会给研究者带来学术回报。阿比德说道:“复现别人的论文,你是发不出自己文章的,对吧?”

但恰恰是这种费力不讨好的工作,非常适合交给AI承担。尤其对于机器学习领域研究:和需要实体实验室的其他学科不同,很多机器学习实验本质就是运行配套代码。

为了验证这一设想,黑客松项目团队首先提取了ICML六千多篇录用论文当中的核心科学结论,交由AI智能体,利用论文附带的代码、数据去核验这些结果。遇到原始数据无法获取的情况,智能体会查找或者生成一套相似的模拟数据集,开展所谓简易复现(toy reproduction)。全部过程均留有日志记录,很多日志完整留存了AI每一步操作与推理链路。最后,由大语言模型GLM‑5.2充当裁判,阅读每一份日志,对每一条实验结果给出四类判定之一:验证通过、证伪、简易复现、无法得出结论。

本次一共核查2226篇论文,大约半数论文至少有一项实验结果被AI独立验证成立;其中266篇论文全部结果复现成功。另有502篇仅完成简易模拟复现;280篇论文受数据缺失等因素,被判定为无法得出结论。

但还有496篇论文,至少存在一项结果被证伪——也就是复现得到的结果和原文不一致,或是存在争议,即不同复现团队给出了完全相反的判定。阿比德表示:“结果比我预想的要糟糕,我本是乐观派。但我们不会直接采信论文的原始结论。”

目前Hugging Face正在复核AI排查出来的问题。现已确认至少12篇论文存在错误结论。其中有一篇曾被选为焦点论文(spotlight paper),审稿得分很高,但当时就已经出现隐患:一位人类审稿人写下评语:“我给出较低置信度,是因为我没有仔细核对全部推导证明。”在阿比德看来,部分被证伪的结果十分关键,足以使得整篇论文的核心论点说服力大幅下降,甚至完全站不住脚。“有些案例,我认为这篇论文本就不应该被接收发表。”

也有一部分问题属于普通疏漏。麻省理工学院博士生伊丹·申费尔德的一篇论文就被AI智能体标记出矛盾。该论文研究AI模型部署之后的持续学习能力:文中理论推导指向某一种方法,但实验数据却显示另一种方法效果更优。申费尔德早已在其他公开代码仓库修正该错误,却忘记更新论文正文。即便如此,申费尔德仍认为,AI能够发现被工作量饱和的ICML人类审稿人漏掉的细节,是一件鼓舞人心的事。

Hugging Face本次黑客松并不是唯一尝试用AI智能体复现ICML论文的项目。上个月,芝加哥大学计算机科学家、初创公司SAI Labs联合创始人谭浩辰,选取该会议120篇口头报告论文(一般视作计算机顶会质量最高的一批论文)开展测试。使用SAI开源AI智能体后,仅有8篇论文超过80%的实验结果可以被复现。该企业提到,其余多篇论文复现成本高得难以承受,估算仅硬件与算力就要耗费高达220万美元。

专有数据、私有代码是另一道普遍障碍,企业主导的研究,外部研究者通常无法获取相关资源。解决复现难题的一条路径,就是学术会议强制作者完整提交代码与数据集。但卡内基梅隆大学从事计算机与AI稿件评审研究的尼哈尔·沙阿表示,这同样会带来代价:企业很可能选择不参与会议。而如今机器学习领域大量成果都来自工业界,这一局面并不理想。

但如果不做硬性要求,就等于接受大量发表的科学论断永远不会被核验。谭浩辰说:“论文里很多结论从来没有任何人验证过,它们完全有可能是错的。如果后续科研都建立在这些未经检验的结论之上,整个知识大厦的根基就是摇摇欲坠的。”

而对于本次黑客松的冠军唐詹森来说,复现工作可以交给专业人员了。他表示:“过程很有意思。”但他也无奈地说,参加这场竞赛几乎耗尽了自己个人账户全部AI计算令牌额度。“现在我得想办法,用剩下的算力去完成本职工作。”



https://blog.sciencenet.cn/blog-41174-1549562.html

上一篇:《生命与地球》携手演绎的演化史诗




    
收藏 IP: 117.143.182.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-26 18:18

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部