|
药企保密数据大幅提升AI蛋白质模型性能
一套使用制药企业2万余条蛋白质结构数据训练的人工智能系统,性能优于仅使用公开数据的类AlphaFold模型。
> 配图说明:蛋白质带状结构特写,黑色背景下数字线框渲染出粉、蓝色螺旋结构。
> 将制药企业的数据纳入训练,能够改进基于人工智能的蛋白质结构模型。
对于药物研发而言,AlphaFold这类蛋白质折叠模型面临一个数据难题:公开数据库内的数据量不足。部分科学家提出,想要提升这类AI工具的性能,就需要补充大量能够反映蛋白质‑药物相互作用的实例数据。
各大药企的资料库中封存着数以万计的蛋白质结构,这是极具潜力的数据来源。近日,一个制药企业联盟发布报告:利用这批数据训练蛋白质折叠AI模型,可以显著提升模型性能。
该团队基于OpenFold3(AlphaFold 3的开源复现版本)搭建新模型,训练数据集包含20 000多条药企专有蛋白质结构。这套新模型,不管对比仅用公开数据训练的同类模型,还是各家企业单独使用各自私有数据集训练得到的模型,表现都更加出色。该研究目前仅发布博客文章,尚未经过同行评审,模型也未对外公开。
参与该项目的纽约哥伦比亚大学计算生物学家穆罕默德·阿尔库赖什表示:“把这些全部数据加进去之后,模型性能得到相当大的提升。”
他表示,该研究结果进一步说明,应当构建类似的公开数据集,以此强化蛋白质折叠人工智能。英国政府投入最高800万英镑(折合1080万美元)支持的OpenBind项目就是其中一例,该项目上个月释放了数百个全新蛋白质结构,另有数千个结构正在整理产出。
尚未开发的数据宝库
蛋白质数据库(PDB)存储超过20万条实验测定的蛋白质结构,是AlphaFold 2训练数据的基石。依托该数据库,AlphaFold 2实现极高精度的蛋白质结构预测,这项突破也斩获了2024年诺贝尔化学奖。
后续迭代版本AlphaFold 3新增预测蛋白质与其他分子(包括候选药物)相互作用的能力。但英国阿斯泰克斯制药公司计算化学与信息学副总裁保罗·莫滕森指出,PDB库中,实验测得的、药物样分子结合蛋白的结构样本相当稀少,大概仅有1万条。
数据匮乏给药物研发工作带来阻碍。已有研究表明:当AlphaFold 3以及其他“共折叠”模型(用于预测蛋白之间结合的结构),需要预测和训练集分子差异极大的分子相互作用时,预测精度会断崖式下跌1。
研究人员表示,想要让这类工具更好服务药物研发,就必须获取更多数据——这也是研究人员将目光投向药企海量分子结构资料库的原因。
这些结构诞生于药物研发项目,通过X射线晶体学、冷冻电镜等技术解析。很多蛋白质结构从未上传至公共数据库,因为它们关联企业处于保密阶段的药物研发管线。这批私有资料库总规模尚不明确,但有估算认为,其数据总量甚至可能超过PDB公共数据库。
伊利诺伊州芝加哥市艾伯维制药公司计算药物研发负责人约翰·卡拉尼卡斯去年向《自然》杂志表示:“PDB库里缺失的数据,恰恰就保存在我们企业的内部数据库当中。”
预测能力获得提升
为验证企业自有数据能否用于优化蛋白质折叠模型,艾伯维、阿斯泰克斯以及多家药企于去年组建协作网络——AI结构生物学网络(AISB网络)。
该项目对原本只使用PDB公开数据训练的OpenFold3开展微调训练,额外加入20167条蛋白质‑候选药物(配体)结合的结构数据。这批结构来自五家药企;数据处理方式可以保证各家的专有信息不会外泄。
AISB网络的研究发现,补充这批数据确实提升了预测效果。研究团队使用从训练集中预留出的1056个蛋白质‑配体结构做测试:AISB模型对其中过半样本实现高精度预测。与之对比,公开版OpenFold3仅三分之一样本达到同等精度;另一款开源模型Boltz‑2大约为40%。该团队计划将论文投稿至同行评审期刊。
卡拉尼卡斯称:AISB模型性能超过各家企业只用自身私有数据训练的共折叠工具,这充分体现了数据汇集共享带来的增益。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-22 10:58
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社