||
流匹配(Flow Matching)作为一种新兴的生成建模框架,近年来在药物发现领域取得了显著突破,尤其是在基于结构的配体生成方面展现出巨大潜力。以下是该领域的主要研究进展:
核心模型:FLOWR 及其系列1. FLOWR 模型2026年5月,辉瑞与阿斯利康联合团队在《Nature Computational Science》上发表了 FLOWR 模型,这是流匹配在基于结构的药物设计(SBDD)中的代表性工作。FLOWR 将连续与离散流匹配与 E(3)-等变最优传输相结合,通过高效的蛋白口袋编码模块实现三维配体生成。
关键性能指标:
在 SPINDR 测试集上,PoseBusters 有效性达 0.88,RDKit 有效性达 0.94
推理速度较现有扩散模型快 20-70 倍(100步采样快20倍,20步采样快70倍)
生成配体的应变能(90.05 kcal/mol)显著低于 PILOT 模型(120.10 kcal/mol)
AutoDock Vina 平均打分达 -6.93,优于参考分子的成功率为 29.5%
FLOWR.MULTI 通过掩码与结构补全(Inpainting)机制,无需重新训练即可支持多种药物设计任务:
相互作用条件生成:相互作用恢复率从从头生成的47.1%提升至 76.1%
骨架约束/官能团约束生成:支持骨架跳跃(scaffold hopping)、骨架延展和片段连接
在 Lp-PLA2(5YEA)和 PDK(4MPE)靶点验证中,生成的候选分子对接打分和合成可及性(SA score)全面超越参考配体
2026年7月,研究团队进一步推出了 FLOWR.ROOT,这是一个统一的多功能基础模型:
将口袋条件配体生成与多端点结合亲和力预测(pIC₅₀、pKi、pKd、pEC₅₀)集成于单一架构
采用三阶段训练策略:大规模预训练(数十亿配体构象和数百万蛋白-配体复合物)→精选共晶数据精炼→LoRA参数高效微调
支持推理时重要性采样引导,无需外部打分函数即可实现单目标或多目标设计
为支持流匹配模型训练,团队基于 PLINDER 数据集构建了 SPINDR(Small molecule Protein Interaction Dataset, Refined):
经过严格结构修复流程(局部能量最小化、添加显式氢原子、推断原子级相互作用图谱)
最终包含 35,666 个高质量蛋白-配体复合物
有效解决了现有数据集(如CROSSDOCKED2020、PDBbind)存在的结构缺陷和数据泄漏问题
2026年7月,另一研究团队提出了 Perturbed Flow Matching (PFM):
通过扰动条件概率路径设计,引入口袋结合位点信息和原子类型-坐标耦合信息
在 CrossDocked2020 数据集上平均 AutoDock Vina 打分达 -7.12
有效分子生成速度较此前最优方法快 21.3 倍
流匹配模型相比传统扩散模型的主要优势包括:
推理效率高:确定性动力学路径减少采样步骤,实现数量级加速
构象质量好:生成配体的物理合理性和交互准确性更高
多任务统一:可在单一框架内实现从头生成、片段设计、条件约束等多种任务
研究团队指出,当前方法仍存在若干限制:
显式氢原子建模时配体有效性下降
训练数据对化学空间和构象空间覆盖有限
未考虑蛋白柔性、诱导契合或别构调节效应
生成构象的应变能仍高于真实晶体结构
未来方向包括:扩大训练数据规模、引入蛋白构象系综、整合药代性质与合成可及性约束、开展前瞻性实验验证等。
小结流匹配技术正在重塑基于结构的药物发现范式。从 FLOWR 到 FLOWR.ROOT,该技术已从单一配体生成工具发展为集生成、预测、优化于一体的统一平台,其推理速度和生成质量的显著提升为药物研发提供了新的可能性。然而,这些方法仍需与药物化学专业知识及实验验证相结合,以充分发挥其实践价值。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-14 21:20
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社