||
《自然》近日发表的一项研究(https://www.nature.com/articles/s41586-026-11044-y),介绍了一个名为Paper2Agent的框架,旨在把科研论文从静态文档转变为可以互动的人工智能(AI)助手。研究人员不再需要先通读论文、寻找代码、安装软件,再自行重建分析流程,而是可以通过自然语言直接与“论文智能体”交流。这个智能体能够解释研究方法、复现已发表的分析、将相关方法应用于新的数据集,并在某些情况下整合多篇论文的信息,提出新的研究假设。
Paper2Agent针对的是计算科学中的一个长期问题。如今,许多论文依赖复杂的软件、特定的数据格式和多步骤分析流程。尽管作者通常会提供代码和补充材料,但这些资源往往并不容易安装和使用,尤其对于编程经验有限的研究人员而言更是如此。Paper2Agent能够读取论文及其相关代码库,识别其中的主要分析步骤,配置所需的软件环境,并将部分研究流程转化为可以执行的工具。随后,系统会利用论文中的示例数据运行这些工具,并将结果与原始输出进行比较,以判断其是否能够重现已发表的分析。
研究人员利用多种常用的计算方法展示了这一框架的能力。其中一个例子是AlphaGenome,这是一个用于预测DNA变异如何影响基因调控的模型。Paper2Agent为其生成了多个工具,可以对遗传变异进行评分,分析其在不同组织和细胞类型中的潜在影响,并生成相应的可视化结果。在与人工生成的答案及其他AI系统的比较中,AlphaGenome智能体在结构化问题上表现良好,而且运行速度快于那些直接读取原始代码库的系统。它还可以完成更复杂的任务,例如分析一个与低密度脂蛋白胆固醇相关的遗传变异,并提出可能的因果基因。
不过,这一案例也说明了为什么这类系统应当被视为科研助手,而不是科学权威。原始的AlphaGenome研究重点讨论了几个可能解释该遗传变异效应的基因,而Paper2Agent则根据预测的调控影响以及SORT1在脂质代谢中的已知作用,将SORT1排在了更优先的位置。然而,附近的其他基因同样具有较强证据,因此这一结论仍然只是需要进一步实验验证的假设。重新审视已发表研究的解释可能非常有价值,但计算机预测本身并不能证明某个基因具有真正的生物学因果作用。
研究人员还利用Paper2Agent为Scanpy和TISSUE构建了智能体。Scanpy是一种广泛使用的单细胞RNA测序分析工具,而TISSUE用于空间转录组学分析。当用户提供单细胞数据集后,Scanpy智能体可以依次完成质量控制、数据标准化、降维、聚类以及标志基因分析。其分析结果总体上与研究人员按照原始教程手动完成的结果一致。在更复杂的演示中,研究人员还将三篇不同论文对应的智能体连接起来,用于研究一个与银屑病相关的遗传变异。通过整合基因组预测结果以及独立的CRISPR和Perturb-seq数据,系统将GPR137列为活化CD4⁺ T细胞中一个潜在的因果基因。
在更大规模的评估中,研究人员尝试将100篇计算生物学论文转化为交互式智能体,最终有74篇成功完成了这一过程,并生成了近600个候选工具,其中大多数通过了自动验证。未能成功转换的论文通常存在代码不完整、数据不可用、文档不足或软件环境难以重建等问题。这一结果既体现了Paper2Agent的潜力,也揭示了一个更普遍的事实:科研成果是否具备清晰的代码、完整的数据和可重复的分析流程,将直接影响其能否被其他研究者——或者AI系统——有效利用。
因此,这项研究可能提高科研出版对数据和代码共享的要求。过去,数据共享主要是为了让其他研究者能够复现实验或开展后续分析;在AI智能体参与科研之后,完整、准确且结构清晰的数据、代码、元数据和分析流程,将成为智能体正确理解和使用一篇论文的基础。如果数据不完整、代码无法运行,或者论文中的描述与实际分析流程不一致,AI系统不仅难以复现原始结果,还可能在此基础上产生错误的分析和结论。未来的出版标准或许不仅需要关注论文是否提供数据和代码,还需要进一步强调这些资源是否完整、可执行、可追溯,并能够随着软件环境和数据版本的变化得到持续维护。
这一趋势还可能改变同行评议的方式。除了阅读论文、评估研究问题和判断结论是否重要,期刊和审稿人未来或许还会增加一些执行性检查,例如验证代码能否运行、图表是否与源数据一致、统计分析是否可以重现,以及核心流程能否在独立数据集上合理执行。这类自动化检查不能取代专家对研究设计、生物学意义和临床价值的判断,但可以成为额外的质量控制层,帮助发现传统评审中容易遗漏的技术问题。论文中的可重复计算结果与作者对这些结果的生物学或临床解释,也需要更加清楚地区分。AI系统可以按照代码执行分析、生成图表,甚至提出可能的机制,但它未必能够可靠判断这些结果是否足以支持因果结论,或是否具有真正的临床意义。未来的论文可能需要更明确地区分哪些内容是可以直接复现的分析输出,哪些内容是依赖专业判断的解释性结论,从而避免把AI完成了计算误认为AI已经验证了科学主张。
Paper2Agent还可能推动论文从一次性发表的产品,转变为需要持续维护的研究资源。软件包、数据库、API接口和计算环境都会随时间变化,一个今天能够运行的论文智能体,几年后可能因为依赖的软件更新或数据链接失效而无法使用。因此,作者、期刊和数据库可能需要建立版本管理、变更记录和长期维护机制,既要保留论文最初发表时的可复现版本,也要清楚标注后续更新是否只涉及技术修复,还是已经改变了原始分析和科学结论。
另外,作者责任和AI使用规范也会面临新的问题。如果一个智能体在将已发表方法应用于新数据时产生错误,责任应由谁承担?更合理的答案仍然是人类研究者,而不是把责任归于AI系统。设计、验证和使用智能体的研究人员,需要对分析流程和最终结论负责。期刊也可能需要制定更明确的政策,要求作者披露AI在数据分析、假设生成、图表制作和文字撰写中的具体作用,并说明哪些结果经过了人工复核和独立验证。
这项技术还可能改变科学文献的检索和使用方式。研究者未来或许不只是搜索关键词和阅读摘要,而是可以让AI寻找具有兼容数据、分析方法或研究问题的论文,并自动连接不同研究中的工具和资源。这有可能加快跨学科合作,帮助研究者更快发现可以组合的方法。然而,这种机制也可能带来新的偏差:数据结构更规范、代码更完整、机器可读性更好的论文,可能在AI驱动的检索体系中获得更多关注,而一些有价值但数字化程度较低、资源共享不够完善的研究则可能被进一步忽视。
可执行的论文代码会带来安全、隐私和知识产权问题。一个能够自动运行代码、下载数据和调用外部服务的智能体,可能暴露软件漏洞,或者不适合直接处理临床、个人或受知识产权保护的数据。构建和维护这类系统也需要较强的计算基础设施,可能进一步扩大资源充足的实验室与小型研究团队之间的差距。因此,未来在推动论文智能体发展的同时,也需要建立严格的访问权限、数据保护、安全审查和利益冲突管理机制。
Paper2Agent也提醒我们必须加强对已发表研究的持续质量控制。如果一篇论文包含错误的数据、无法复现的分析流程,或未经充分支持的科学结论,那么将其转化为AI智能体可能会放大这些问题,使错误更容易被传播、重复甚至进一步用于新的研究。因此,未来的科研出版不仅需要在发表前加强对数据、代码、统计分析和研究结论的核查,也需要在发表后建立更加有效的监测、纠错和撤回机制。对于已经发表但存在问题的论文,应及时发布更正,澄清其适用范围,或在必要时撤稿;对于新的论文,则应尽可能确保其数据和分析流程完整、透明并能够被独立验证。这并不意味着今后可以保证所有问题都在发表前被发现,也不意味着AI能够替代编辑、审稿人和研究者。更现实的目标,是建立一套能够更早发现问题、降低错误传播,并及时修正或撤回不可靠研究的出版体系。尤其是在研究成果可以被智能体自动调用、组合和进一步扩展之后,论文的错误不再只是被少数读者误解,而可能被快速嵌入新的分析和结论之中。因此,可靠性、可追溯性和持续纠错将成为未来科研传播的重要组成部分。
这项研究更广泛的意义,可能在于它提示了科学传播的一种新可能。未来,一篇论文或许不再只是供人阅读的文章和供人下载的代码库,还可以配套一个交互式智能体,帮助研究者理解、复现和拓展其中的工作。如果这一设想能够大规模实现,科研论文可能会变得更加易于使用、重复验证和相互连接。但只有当研究内容本身经过充分审查,数据和代码足够可靠,AI系统的使用过程足够透明,并且人类研究者仍然对最终判断负责时,论文智能体才可能真正促进科学积累,而不是成为传播错误的放大器。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-20 19:18
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社