||
长久以来,人类对生命基因组的干预拥有清晰的技术边界:基因测序实现对天然基因组的读取解析,CRISPR等基因编辑技术实现对现有基因组的定点修饰与改造。但从零从头设计、合成并获得具备完整自主复制、特异性侵染活性的全长功能性活体基因组,一直是合成生物学难以突破的核心壁垒,此前尚无成熟的全域技术方案。
单链DNA噬菌体ΦX174是诠释基因组演化精巧性的经典模型:其基因组仅含5000余碱基对,却通过重叠读码框、非编码调控序列嵌套的紧凑结构,编码11种功能蛋白,单碱基的突变极易引发多基因功能连锁损伤,基因组容错率极低。正是这种历经数十亿年自然演化形成的严谨碱基排布逻辑,让人工从头设计完整功能性基因组长期难以实现。近日,斯坦福大学Arc研究所Brian L. Hie团队依托基因组语言大模型Evo系列,成功突破该技术瓶颈,相关研究成果于2026年8月6日正式发表于Science(DOI:10.1126/science.aec2657)。该研究预印本版本已于2025年9月在bioRxiv平台公开,为业内先期提供了技术参考。
DNA版大模型:学习亿万年演化沉淀的基因语法
本研究核心创新,是将适配全基因组序列学习的Evo1、Evo2基因组语言模型,应用于噬菌体全长基因组的从头生成设计,区别于传统仅生成蛋白序列、短基因片段的AI生物模型,其技术逻辑可通俗理解为“专门学习ATCG碱基排布规则的基因组大模型”,完整流程分为三步:
1. 海量无监督预训练:依托海量原核生物天然基因组数据集开展预训练,让模型自主学习基因组的碱基保守性、基因排布范式、顺式调控元件匹配规则及演化约束条件,掌握天然基因组的底层构建逻辑;
2. 定向约束微调:以天然噬菌体ΦX174为功能模板构建微调数据集,严格设定实验安全边界:训练数据完全剔除动植物致病病毒、人类致病病毒序列,模型生成宿主严格限定为非致病性大肠杆菌,从数据源头规避高风险序列生成;
3. 智能生成与多维度筛选:模型自主生成数十万条全新噬菌体全长基因组序列,通过生物信息学模拟,淘汰碱基结构紊乱、基因无法正常表达、丧失侵染与复制潜力的无效序列,最终筛选出近300条合规候选序列,开展全长DNA化学合成与活体功能验证。
无中生有:16株全新人工噬菌体实现活体侵染
研究团队将合成的全套全新基因组导入合规大肠杆菌宿主进行活体培养,实验结果实现重大技术突破:大部分AI生成序列无法完成宿主侵染与自我复制,无法形成清晰菌斑;最终筛选获得16株具备完整生物活性的全新人工噬菌体,可稳定完成宿主识别、衣壳组装、自我复制、裂解宿主的完整生命周期。
• 基因组序列与现有天然噬菌体无高度同源区段,具备独特的碱基组合与基因排布模式,属于完全人工创制的新型噬菌体序列;
• 保留精准宿主特异性,侵染动力学、增殖活力呈现多样化表型;
• 冷冻电镜结构解析证实,部分人工噬菌体可整合差异化的外源包装蛋白,组装形成稳定的新型衣壳结构,展现出天然噬菌体不具备的结构可塑性。
更具临床价值的是耐药菌拮抗实验:研究人员将多株AI人工噬菌体复配为噬菌体鸡尾酒制剂,可有效裂解对天然ΦX174噬菌体产生特异性耐药的大肠杆菌菌株;而同等条件下,天然噬菌体混合制剂无法突破细菌耐药屏障,充分验证了AI设计噬菌体的功能优越性。
该成果堪称合成生物学领域的“莱特兄弟时刻”:过往AI生物生成技术仅局限于蛋白质序列、单基因片段等局部生物元件设计,该研究首次实现功能性噬菌体全长基因组的从头设计、合成与活体功能复现,完整打通“AI智能设计—化学人工合成—活体生物验证”的全闭环技术链路,标志着生成式AI正式进入全基因组尺度的生命设计领域。
近景:耐药菌危机的全新解药方案
当前全球抗生素滥用引发的细菌耐药性危机日益严峻,噬菌体疗法作为精准抗菌的绿色替代技术,已成为抗感染领域的研究热点。但传统天然噬菌体筛选体系存在明显短板:依赖自然样本筛选、研发周期冗长、细菌易快速演化抗性、功能无法定向改造,极大限制了临床规模化应用。而本研究建立的AI基因组生成框架,可根据靶标致病菌特征定向、快速、批量创制新型功能性噬菌体,有效规避天然噬菌体的固有缺陷,大幅缩短噬菌体药物研发周期,为耐药菌感染的精准治疗提供了全新技术路径。
远景阴影:生成生命的能力,跑在了监管之前
Science同期配发的专业评述文章《AI-designed viral genomes》精准点出该领域的核心矛盾[2]:生成式生命设计技术的迭代速度,显著领先于全球生物安全治理体系的建设速度。需要明确的是,本研究严格恪守科研安全规范:实验数据集无动植物及人类致病病毒、实验宿主限定非致病大肠杆菌、研究产物仅为靶向杀菌的细菌噬菌体,不属于致病性病毒,实验风险可控。但从技术本质而言,基因组大模型的序列生成能力具有通用性,技术逻辑不区分物种与病原类型,仅通过数据集与参数约束界定生成对象,存在技术泛化的潜在风险。
目前,全球尚未形成统一的AI基因组设计、长片段DNA合成、人工生命体实验的标准化管控体系。商用长片段DNA合成技术已高度成熟,“AI一键设计全长基因组—企业快速合成—实验室活体验证”的技术链路已完全打通,但对应的序列风险筛查机制、实验权限分级管控、人工生命体溯源监管、跨国科研协作规制等制度体系仍存在明显短板,技术创新与安全监管存在时间差。
写生命的AI,需要同步配套规则手册
生成式AI赋能全基因组人工设计,是合成生物学的颠覆性突破,既为生物医药、绿色抗菌、生态调控带来重大机遇,也让人工生命创制的生物安全风险从“远期隐患”变为“现实议题”。平衡技术创新与生物安全,需要学界、产业界与监管部门协同完善多重防控体系,筑牢科研安全底线:
1. 针对基因组大模型搭建内置安全筛查机制,拦截高风险序列生成;
2. 完善长片段DNA合成企业强制序列审核流程;
3. 建立AI合成生物实验分级管控、数据访问权限体系;
4. 推动统一的国际合成生物治理框架,平衡创新与风险。
当AI掌握了书写基因组、设计简单生命的底层语法,人类的科研使命便不再局限于突破技术边界、挖掘创新价值,更要主动构建适配新技术的安全规则与治理体系。技术狂奔的时代,创新探索与安全规制必须同步迭代、双向并行,才能让生成式生命技术始终服务于人类健康与公共安全。
参考文献
[1] KING S H, DRISCOLL C L, LI D B, et al. Generative design of bacteriophages with genome language models[J]. Science, 2026, 393(6811): aec2657. https://doi.org/10.1126/science.aec2657
预印本:2025年9月发布于bioRxiv平台
[2] INGLESBY T V, HANKE M S. AI-designed viral genomes: The generation of functional viral genomes has urgent biosafety and biosecurity implications[J]. Science, 2026, 393(6811): 563-564. https://doi.org/10.1126/science.aej8512
#AI 设计噬菌体 #生成式生物学 #Science2026 #合成生物学与生物安全
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 21:47
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社