科研进展

东莞材料所 | 发布OpenGEM26有机分子数据集与GPTFF-mol力场——我国首个自主可控的小分子AI-ready数据资源

发布时间:2026-07-28 来源:东莞材料科学与技术研究所

中国科学院东莞材料科学与技术研究所联合中国科学院物理研究所,于7月23日正式发布开源有机分子数据集OpenGEM26(Open Generated Ensemble of Molecules, 2026)与配套机器学习势函数GPTFF-mol。该结果发布于:https://arxiv.org/abs/2607.21369。该数据集覆盖H、C、N、O、S、Cl六种元素,包含约20万种独特有机分子与440万种分子构象。OpenGEM26与GPTFF-mol的同步开源,标志着我国在有机分子人工智能势函数领域拥有了具备国际竞争力的自主数据资源,有效扭转了长期依赖海外数据平台的局面。

数据,是人工智能驱动有机分子模拟研究范式的核心基础设施。作为AI for Science的重要方向,有机小分子AI力场是药物发现、催化设计、高分子合成与含能材料等关键领域的前沿工具。其规模化应用的关键,在于高质量、大体量的标准化训练数据集——数据集规模、元素覆盖、计算精度与构型多样性,共同决定了模型的精度上限与适用边界。

过去十余年,欧美主要团队在该方向构建了一批标杆性数据集。2014年发布的QM9数据集核心论文累计被引逾3000次,收录约13.4万种含C/H/N/O/F五种元素、最多9个重原子的稳定小有机分子及其B3LYP/6-31G(2df,p)级别量子化学性质,长期作为机器学习分子势函数训练与考核的事实基准。2017年发布的ANI-1数据集核心论文被引约430次,从GDB化学空间枚举出约2000万种非平衡构象,并通过后续ANI-1x/ANI-1ccx以主动学习与迁移学习策略将参考精度推至耦合簇水平。然而,上述主流数据集存在三大共性局限:一是计算级别整体偏低(B3LYP为主),参考数据精度受限;二是元素覆盖普遍聚焦于C/H/N/O/F,而硫、氯两类在药物分子、催化体系与含能材料中扮演关键角色的有机元素则长期缺位。三是非平衡构象收录不足,使训练得到的势函数在化学反应过渡态、键断裂等远离平衡态区域普遍失效。

图1. OpenGEM26数据集数据量和结构空间覆盖度远大于QM9数据集。

在国内,有机分子领域长期缺乏规模化、有组织的AI-ready数据生产能力。高校、科研院所及产业界普遍依赖QM9、ANI等海外开源数据集进行模型训练,自建数据集在元素覆盖范围、计算精度级别和持续更新能力等方面,与国际水平相比仍有差距。特别是在面向有机小分子机器学习势函数的AI-ready训练数据方面,缺口较为明显。OpenGEM26的推出,填补了这一空白。


图2. 通过降维可视化算法看出OpenGEM26数据集数据量和结构空间覆盖度远大于QM9数据集。

OpenGEM26基于GDB-13分子库筛选构建,量子化学计算在ωB97X-D泛函下采用Def2-SVP基组完成初步优化,并以Def2-TZVP基组获取高精度参考结构,包括经验色散校正,整体精度优于QM9所采用的B3LYP级别。数据集完整保留了结构优化过程中每一步的力与坐标信息,并补充大量非平衡构象,使训练得到的势函数在化学反应过渡态区域具备泛化能力。键长、键角分布及降维可视化算法(t-SNE嵌入可视化)等多维对比表明,OpenGEM26在能量、键长、键角三个维度上的构型空间覆盖度均显著优于QM9,并覆盖QM9所不能及的非平衡态区域。

在此基础上,团队基于前期发布的GPTFF图神经网络+Transformer通用无机材料力场框架,训练出有机分子专用势函数GPTFF-mol。该模型采用节点-边编码、三体相互作用模块与自动微分求力机制,将原子局部环境映射为原子能量贡献,求和得到体系总能。经测试集严格评估,GPTFF-mol能量预测精度优于1meV/atom,与高阶量子化学方法结果高度一致;力预测优于开源标杆ANI-2x,逼近当前国际最准确模型;推理速度较密度泛函理论计算快五至六个数量级。

图3. GPTFF-mol 模型在测试集原子化能回归任务的平均绝对误差评估: 模型能量预测精度优于0.82meV/atom,力精度优于ANI-2x。

在应用验证层面,团队以丁烷构象旋转与酮-烯醇互变异构两项经典有机反应为考题,让GPTFF-mol与ANI-2x、ET_qm9等模型进行对比。结果表明,GPTFF-mol准确复现了DFT级别势能面图像,并在过渡态及其邻近区域表现出稳健的预测能力,而基于QM9训练的同类模型已严重偏离。这一在远离平衡态区域的稳健泛化能力,对于药物合成路径设计、催化剂筛选与新型含能材料研发具有直接应用价值。

GPTFF-mol与OpenGEM26的发布,是团队继GPTFF通用无机材料力场、Atomly材料科学数据库、MatChat材料科学AI智能体之后,在“AI+材料”全链条布局上的又一核心成果。至此,团队构建的数据-模型-应用三位一体基础设施已实现从无机晶体到有机分子的全栈覆盖,为我国在药物发现、催化设计、高分子及含能材料等关键领域的自主可控研发奠定坚实基础,同时也为全球相关研究者提供了高质量开源工具与基准数据集。

技术文档地址:https://arxiv.org/abs/2607.21369

GPTFF-mol模型:

https://github.com/atomly-materials-research-lab/gptff/tree/main/pretrained/molecular


来源:新材料数智化研究部


附件下载: