一、时代的转折:生物学研究正面临根本性变革
现代生物学的核心挑战已不再是数据生成,而是数据解读。随着高通量测序技术的普及,单台设备日产出量已达数十GB至TB级别,全球科研与医疗机构持续汇交的数据总量早已突破PB量级。单细胞RNA测序能生成数百万个独立的细胞图谱,空间组学技术则将这些叙事编织进组织结构中,创造出多TB级别的组织学和基因表达马赛克。其结果不仅是数据洪流,更是一场解读危机——人类专家曾经是黄金标准,如今却与这些数据的规模和复杂性形成了根本性错配。
正是在这一背景下,AI技术正在孕育深刻变革。正如中国科学院院士陈润生在香山科学会议上强调的:“生物大数据与AI的深度融合,将系统性重塑整个生命科学研究体系。”
二、基础模型:学习生命的语言
2.1 从序列到细胞的跨越
基础模型(Foundation Models)是这场变革的基石。这些模型在海量无标签数据上进行预训练——包括全部已测序的基因组或科学文献——学习其领域内的基本统计模式,即所谓的“语法”。这种预训练阶段创建了强大的“基础模型”,它们编码了对数据模态的通用理解。
当前,生命科学领域的基础模型已覆盖多个维度:
- 序列层面:DNA、RNA和蛋白质序列模型,能够进行结构预测和序列生成
- 细胞层面:单细胞和空间组学模型,能够进行细胞类型注释和扰动效应预测
2.2 多模态融合的挑战与前景
然而,当前基础模型的训练语料仍主要局限于序列信息或单细胞转录组数据等单一模态。国家生物信息中心韩大力研究员指出:“如何让AI模型真正理解和融合多模态数据,是当前面临的核心技术难题,也将是未来实现突破的关键所在。”
百图生科推出的xTrimo Universe模型集正是应对这一挑战的尝试。该模型体系覆盖化学结构、蛋白质、RNA、DNA、细胞五个生物尺度,包含六大基础模型:xTrimoChem、xTrimoProtein、xTrimoRNA、xTrimoDNA、xTrimoCell、xTrimoText,形成了一个庞大的“生物模型宇宙”。
三、自主智能体:从工具到科学家的跃迁
3.1 AI智能体的核心特征
如果说基础模型是“大脑”,那么AI智能体(Agent)就是让这个大脑能够主动行动的“身体”。与传统生物信息学方法相比,AI智能体具有显著优势:不仅能自主从海量数据中学习规律,无需依赖预设的先验知识即可挖掘深层关联,“更重要的是,它具备知识创造能力——基于已学规律生成新知识,并通过智能体实现自我迭代与持续进化。”
AI智能体的三个核心特征使其区别于被动工具:
1. 自主性:无需逐步的人工指令即可操作,能根据中间结果做出决策
2. 规划与记忆:维护项目的运行记忆,规划多步骤工作流以实现目标
3. 工具集成:能够以协调的方式使用其他软件和数据源
3.2 多智能体系统:虚拟科研团队
2025年9月,百图生科联合普林斯顿大学、斯坦福大学、浙江大学等团队发布的BioLab系统,标志着AI原生科学研究时代的到来。BioLab采用八个协作的“虚拟研究员”架构:
- 规划智能体:担任总设计师角色,将研究目标分解为可执行的子任务
- 推理智能体:负责科学逻辑推理,制定详细实验策略
- 记忆智能体:保存过程信息,支持长期学习与策略改进
- 检索增强智能体:在数以亿计的文献、数据库与知识图谱中查找信息
- 工具智能体:调用具体的生物计算工具执行任务
- 代码执行智能体:自动生成并运行科研代码
- 审查智能体:检查推理与结果的科学合理性
- 报告智能体:整理输出实验报告与研究总结
这一体系模仿了真实科研团队的组织方式——有人提出问题、有人设计方案、有人验证结论。不同的是,BioLab团队的成员全是AI。
3.3 从虚拟筛选到湿实验验证
NVIDIA发布的BioNeMo Agent Toolkit为AI智能体提供了专业领域的工具与技能。NVIDIA创始人兼首席执行官黄仁勋指出:“前沿模型是大脑,BioNeMo是科学工具箱。两者结合,赋予了AI智能体博士级研究助理的专业技能和超级计算机的运行速度。”
借助该工具包,智能体能够完成多个关键工作流:
- 虚拟筛选:生成和筛选化合物、与靶点对接、预测结合强度,将筛选周期从数天缩短至几分钟
- 基因组分析与靶点发现:将原始测序数据转化为高优先级的基因洞察
- 蛋白质结合物设计:在实际工作开始前通过计算方式设计和验证候选物
- 深度生物医学研究:将真实世界数据与推理模型相连接
四、典型案例:AI科学家的实战表现
4.1 作物育种领域的突破
上海人工智能实验室联合崖州湾国家实验室和中国农业大学,推出了生物育种领域首个自主科学发现系统“丰登·基因科学家”。该系统基于首个种业大模型“丰登”研发,能模拟分子生物学家自主开展作物基因功能研究。
测试结果显示,“丰登·基因科学家”在知识整合、功能推断与实验设计等环节表现突出,多项量化指标优于国际主流OpenManus智能体与DeepSeek-R1语言模型。在水稻研究中,科研人员依据该系统设计的多轮实验方案,发现了多个基因的新功能,包括可通过调控植物激素平衡影响株高的基因,以及与光合效率密切相关的多个基因。在玉米研究中,智能体精准预测出多个与株高、穗位等关键农艺性状紧密相关的候选基因。
4.2 抗体设计的端到端自动化
BioLab在抗体设计领域展现了令人瞩目的能力。在其案例验证中,系统接到“为癌症治疗设计一种针对巨噬细胞的抗体”的任务后,自动执行了从文献挖掘、靶点筛选到抗体优化的全过程。
更具突破性的是第二个案例——T细胞靶点发现与抗体优化的计算-实验闭环。BioLab在接收“基于T细胞的癌症免疫治疗设计一项治疗策略”的指令后,优先提名PD-1作为靶点,并自动生成可执行协议:在原代人T细胞中用CRISPR-Cas9敲除PDCD1。按协议完成的湿实验显示,模型给出的活性预测与IFN-γ分泌读数之间存在显著正相关。
更令人惊叹的是,BioLab优化的抗体变体Pem-MOO-2在剂量依赖性实验中,其IC值提升近3倍(0.01 nM vs.亲本的0.027 nM),且保持了与亲本抗体相当的可开发性特征。这意味着BioLab不仅提出假设,还创造了更强的抗体——并在现实实验中被验证。
五、挑战与瓶颈
尽管前景广阔,这场变革仍面临多重战略瓶颈:
5.1 数据层面的困境
- 数据“孤岛化”:生物数据长期维持着美国NCBI、欧洲EBI和日本DDBJ“三足鼎立”的格局,我国虽积极推进数据共享,仍面临数据库国际影响力有限、共享机制不健全等问题
- 高质量数据集匮乏:数据质量参差不齐,难以支撑系统性突破
5.2 技术与范式层面的挑战
- AI模型可解释性不足:AI模型的优化目标与真实生物学问题之间存在显著的“对齐鸿沟”
- 多模态整合困难:高价值的跨维度组学数据尚未实现系统化整合与深度应用
- 基础设施依赖:我国在高端生物信息软件和高精度生物模拟计算硬件上仍依赖国外技术
5.3 人才与评价体系
现有评价体系与科研组织模式亟待优化,以适应跨学科创新需求。
六、未来展望:从“数字生物学家”到“自驱动实验室”
6.1 科研范式的新图景
“生物大数据正在驱动一场深刻的智能科学变革,一个由‘AI智能体设计实验、自动化实验室执行、数据结果闭环反馈’构成的全新科研范式正加速形成。”北京中关村学院院长刘铁岩表示。
这场变革的核心在于构建一个融合跨模态、跨学科的数据、物理规律和科学知识的“统一科学基础模型”,同时研发自主可控的软硬件协同设计基座。
6.2 通向“智能共生”网络
中国科学院院士贺福初介绍的人体蛋白质组导航(π-HuB)计划,以DIKW(数据-信息-知识-智慧)为路径,致力于构建全球最大的蛋白质组动态图谱,实现从“描述生命”到“预测生命”的跨越。贺福初补充道:“最终将形成能够动态演化、涌现群体智慧的‘智能共生’网络,完成从描述、预测到决策的完整闭环。”
6.3 发展与约束的平衡
在推进技术发展的同时,陈润生特别强调要加快构建完善的AI约束体系:“当前过度强调AI技术的能力赋予,却忽视了对应的约束技术体系发展。”这需要建立法律法规与伦理准则,研发可解释性分析技术,开发安全防护技术,防范技术滥用与系统风险。
七、结语
从基础模型到自主智能体,AI正在从“帮助科学家分析数据”的工具,进化为能够独立完成科学发现的“数字生物学家”。这种转变不仅是技术层面的突破,更代表了科学研究范式的根本变革。正如一篇综述文章所指出的:“通过从静态模型转向主动智能体,我们正在见证‘数字生物学家’的崛起——一个准备重塑生物医学研究的AI协作者。”
这场变革的关键在于构建一个“人类在环中”的协作模式,将人类直觉与人工智能的力量紧密结合。当AI智能体能够理解科学知识、使用科学工具并执行科学工作流,我们迎来的将是一个加速发现、个性化医疗和精准农业的新时代。
***
参考文献
AI 生物大数据:香山科学会议聚焦生命科学研究范式变革,科学网,2025年11月
NVIDIA 发布 BioNeMo Agent Toolkit——加速科学发现的智能体工具,NVIDIA博客,2026年6月
人工智能实验室联合开发:AI“丰登”变身作物育种科学家,2025年8月
Streamline automated biomedical discoveries with agentic bioinformatics,Brief Bioinform,2025年9月
From foundation models to autonomous agents in biology,DOAJ,2026年
百图生科重磅推出BioLab:让AI成为真正的科学家,2025年10月
上海交通大学第三届“AI for Bioengineering暑期学校”,2025年8月
From foundation models to autonomous agents in biology,Maxapress,2026年
From foundation models to autonomous agents in biology(HTML版),Maxapress,2026年
AI 生物大数据:香山科学会议聚焦生命科学研究范式变革,科学网/中国科学院,2025年11月
https://blog.sciencenet.cn/blog-2636671-1545554.html
上一篇:
水稻地理扩散的基因组历史与生态学下一篇:
抵御洪流与把握机遇:人工智能时代科学出版体系的反思与重构