材料展望Materials Futures分享 http://blog.sciencenet.cn/u/MF2026

博文

字节跳动 Seed:THEMol——汇集 30 亿次 DFT 计算的分子扭转、Hessian 矩阵与能...

已有 153 次阅读 2026-9-18 15:21 |个人分类:AI FOR SCIENCE|系统分类:论文交流

THEMol dataset: torsion, Hessian, and energy of molecules

1.  文章导读

THEMol 是目前规模最大的公开 DFT 数据集,包含约 30 亿个 DFT 标注构象。

高质量量子化学数据是构建分子力场和机器学习势函数的基础,但现有公开数据往往难以同时覆盖广阔的化学空间、充分的分子构象以及 Hessian 矩阵等二阶信息。为补足这类数据,ByteDance Seed 团队构建并开放了 THEMol(Torsion, Hessian, and Energy of Molecules)数据集。在后期大规模数据生产阶段,团队依托火山引擎量子化学 SaaS 平台完成高通量 DFT 能量与梯度计算,将数据集扩展到约 30 亿个 DFT 标注构象。THEMol 面向闭壳层有机分子,覆盖 12 种常见元素和最多含 50 个重原子的分子体系;结构优化、扭转扫描、Hessian 计算和电子密度衍生的原子性质分别组织在五个相互关联的子集中。这些数据可用于传统分子力场参数化、机器学习势函数的分子内预训练和有机分子势能面研究。

关键词量子化学数据集、Hessian 矩阵、分子构象、MBIS 原子性质

CitationJiashu Liang, Tianze Zheng*, Yu Xia, Xingyuan Xu, Xu Han, Zhi Wang, Siyuan Liu, Ailun Wang, Yu Liu, Shiqian Tan, Dongfei Liu, Zhichen Pu, Yuanheng Wang, Qiming Sun, Xiaojie Wu, Wen Yan*. THEMol dataset: torsion, Hessian, and energy of molecules [J]. AI for Science. DOI: 10.1088/3050-287X/ae9e52.

2. 本文要点

要点1:12 种元素覆盖,适用于药物、电解液和离子液体

THEMol 的分子主要来自公开数据库 UniChem,另有常用力场训练数据、已发表配体研究中的化合物和内部收集数据。团队依据芳香环数量、极性表面积、类药性、元素类型和杂化类型等描述符筛选分子,并切分较大的结构,尽量保留局部化学环境。数据生成流程还直接纳入了大量具有片段特征的完整分子,以降低单一切分策略造成的采样偏差。研究者随后枚举预测 pKa位于 0 至 14 的质子化状态,得到约 400 万个经过质子化状态扩展的候选片段。数据最终覆盖 H、B、C、N、O、F、Si、P、S、Cl、Br 和 I 共 12 种元素,可用于药物发现、电解液和离子液体等多类有机化学体系。

要点2 :个数据子集,覆盖构型、轨迹、Hessian 和原子性质

THEMol 按照分子势能面的不同信息层次组织五个子集。Hessian 子集包含 3,102,537 个平衡态结构及其 Hessian 矩阵,可提供局部曲率和振动相关信息;HessianRelax 子集保留对应结构优化轨迹,共记录 281,123,880 个构象。TorsionScan 子集通过环内和非环扭转扫描采样构象变化,覆盖 2,436,985 个独特分子、4,192,791 个“分子—扭转角”组合,并提供 93,994,576 个完成约束优化的构象。TorsionScanRelax 进一步保存 3,090,560 个独特分子、4,914,677 个“分子—扭转角”组合的约束优化轨迹,其中包含 110,235,160 个目标扭转角和 2,993,685,868 个轨迹构象。MBIS 子集为 3,082,151 个分子提供原子电荷、偶极矩、四极矩、原子体积及 Slater 函数参数等电子密度衍生的原子性质。用户可以按任务选择最终构型、完整优化轨迹、二阶导数或原子多极矩,不必为单一用途下载和处理全部数据。

子集数据规模(统计对象)主要内容
Hessian3,102,537 个独特分子平衡态结构及其 Hessian 矩阵
HessianRelax4,811,722 个独特分子;281,123,880 个轨迹构象无约束结构优化轨迹中的坐标、能量与力
TorsionScan2,436,985 个独特分子;4,192,791 分子扭转角组合;93,994,576 个约束优化构象扭转扫描的构象、能量与力
TorsionScanRelax3,090,560 个独特分子;4,914,677 分子扭转角组合;110,235,160 个目标扭转角;2,993,685,868 个轨迹构象每个目标扭转角对应的约束优化轨迹
MBIS3,082,151 个独特分子原子电荷、偶极矩、四极矩、原子体积等电子密度衍生性质

点3:四年积累,30亿级DFT标注的数据生产与质量控制

THEMol 的数据积累历时近四年;在后期大规模生产阶段,团队使用以 GPU4PySCF 为计算引擎的火山引擎量子化学 SaaS 平台,通过 GPU 加速和云端任务调度提高计算吞吐。平台提供 Python 客户端 volcengine-qcclient,用户可以用脚本提交和管理量子化学计算任务。这套基础设施支撑 THEMol 扩展到 30 亿级 DFT 标注构象,企业和科研用户也可以通过同一客户端运行类似的高通量量子化学工作流。

THEMol 的质量控制覆盖理论水平、结构筛查和约束验证。除 MBIS 子集外,THEMol 的量子化学计算采用 B3LYP-D3(BJ)/DZVP 理论水平,以兼顾大规模分子内势能面采样的计算成本与精度,并与 OpenFF Sage 参数化所使用的参考数据保持兼容。MBIS 子集主要采用 PBE0/def2-TZVPD 计算电子密度(对于碘原子,改用能够提供全电子密度的 DZVP 基组,以满足 MBIS 算法的要求)。在数据清洗阶段,团队移除开壳层分子以及重复的分子或“分子—扭转角”记录,检查几何优化收敛性、弛豫前后的成键一致性,并验证扭转约束角及其原子索引。对于 Hessian 数据,剔除整体平移和转动对应的近零模后,其余 Hessian 本征值须为正,以确认所得结构为局部极小点。这些规则不能消除所有计算差异,但每项筛选都有明确标准,便于复查。

要点4 :数据、代码和工具全部开放,支持检索、读取和模型训练

THEMol 采用 CSV 与 HDF5 结合的发布格式。CSV 文件保存 UUID、映射 SMILES 和 HDF5 路径等索引信息,HDF5 文件按 UUID 组织坐标、能量、力、Hessian 或 MBIS 属性,分别承担快速检索和大规模数组存储。每个 UUID 都根据分子确定性生成;在 TorsionScan 和 TorsionScanRelax 子集中,扭转原子索引也参与标识,因此同一分子的不同扭转任务可以稳定区分。数据集已在 Hugging Face 公开,配套 GitHub 仓库提供验证工具、示例数据加载器和统计脚本,研究者可据此检查和读取数据,并构建自己的训练流程。

fig1.png

图1. THEMol 的元素覆盖、分子大小、优化构象数及有效扭转约束分布。

总结与未来展望

THEMol 将弛豫结构、优化轨迹、扭转扫描、Hessian 矩阵和电子密度衍生原子性质整合进同一开放数据体系,为分子内势能面建模提供了较完整的数据组合。团队通过火山引擎量子化学 SaaS 平台完成了 30 亿级 DFT 单点计算。THEMol 的核心定位是闭壳层有机单分子的分子内势能面,适合用于分子力场参数化、构象与扭转建模及机器学习势函数预训练。除数据规模外,五个子集之间还有清晰的对应关系,并采用统一的数据接口和公开的处理工具。使用这些数据时,仍需考虑不同量子化学引擎可能带来的细微差异、少见配位环境覆盖不足,以及部分重卤素体系的数值挑战。团队计划继续扩展特殊配位状态等当前覆盖不足的化学空间,并通过公开仓库发布数据更新。

注:部分内容可能由 AI 生成,具体内容参见原文:https://aiforsci.net/article/doi/10.1088/3050-287X/ae9e52



https://blog.sciencenet.cn/blog-3658900-1553111.html

上一篇:中国科学院物理研究所黄学杰、东莞材料所田孟羽团队:数据驱动的球形MDGNN模型指导高镍三元正极精准掺杂




    
收藏 IP: 202.104.160.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...
扫一扫,分享此博文

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-18 17:49

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部