基于 fairchem 的 ODAC25 数据集全解:近 7000 万次 DFT 计算驱动的 MOF 直接空气捕获吸附势能库
基于 fairchem 的 ODAC25 数据集全解近 7000 万次 DFT 计算驱动的 MOF 直接空气捕获吸附势能库【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocpODAC25Open DAC 2025是 FAIR Chemistry fairchem 仓库中用于直接空气捕获Direct Air Capture, DAC吸附剂发现的旗舰数据集包含近 7000 万次 DFT 单点计算覆盖 CO₂、H₂O、N₂、O₂ 四种吸附质在近 15000 个金属有机框架MOF中的吸附构型。本文以 docs/dac/datasets/odac25.md 为骨架结合仓库中的模型配置、评测配置、VASP 计算脚本与配套资源系统讲解该数据集的规模与构成、*.aselmdb数据格式、PBED3 计算标签、下载与加载方式、配套预训练模型选择以及 MOF 吸附能计算的完整实战方案。数据集概览ODAC25 数据集的核心属性如下表所示这些属性直接决定了它面向的训练任务能量与力的回归和适用场景DAC 吸附剂高通量筛选属性值规模约 7000 万次 DFT 计算领域金属有机框架MOFs吸附质CO2、H2O、N2、O2MOF 结构数约 15000 个标签总能eV、原子受力eV/Å理论级别PBED3VASP许可CC BY 4.0下载Hugging Face 平台 facebook/ODAC25 仓库ODAC25 包含 CO₂、H₂O、N₂、O₂ 四种吸附质在近 15000 个 MOF 中的吸附体系 DFT 单点计算结果可用于训练面向 DAC 应用的 SOTA 机器学习原子间势MLIP。所有结构均带有使用 VASP 以 PBED3 泛函计算得到的总能eV与原子力eV/Å。数据集的完整信息可在官方 Hugging Face 站点获取使用过程中如有问题可在本仓库提交 GitHub Issue。从 ODAC23 到 ODAC25一次规模与化学多样性的双重扩展ODAC25 是 ODAC23 数据集 的显著扩展版本。仓库在 ODAC23 文档中明确标注其为Deprecated已弃用并建议所有新项目改用 ODAC25。ODAC23 提供约 100 万条 S2EF 结构约 1 万条 IS2RE 结构、仅覆盖 CO₂ 吸附质而 ODAC25 将规模提升至近 7000 万条 DFT 计算并扩展至四种吸附质。在化学与构型多样性方面ODAC25 的扩展体现在三个方向功能化 MOFfunctionalized MOFs引入官能团修饰的框架结构拓展配体化学空间高能 GCMC 放置构型high-energy GCMC-derived placements通过巨正则蒙特卡洛GCMC模拟生成高能吸附位点构型覆盖能量更高的吸附状态合成生成框架synthetically generated frameworks使用合成方法程序化生成的新颖框架结构。这种多样性设计使得在 ODAC25 上训练的模型对未见过的 MOF 化学环境具有更好的外推能力这正是 DAC 吸附剂筛选任务中 OODout-of-distribution泛化所必需的。数据格式ASE DB 兼容的*.aselmdb文件ODAC25 数据集以ASE DB 兼容的 LMDB 文件*.aselmdb形式提供。LMDBLightning Memory-Mapped Database是一种内存映射数据库适合存储海量结构-标签对并支持随机访问配合 PyTorch DataLoader 可高效进行批量训练与评测。仓库中用于评测的配置直接体现了这种格式的加载方式。以 odac-s2ef-id.yaml 为例评测流程通过AseDBDataset加载aselmdb文件并用AdsorptionSinglePointRunner执行单点能量/力预测runner: _target_: fairchem.core.components.calculate.AdsorptionSinglePointRunner calculator: ${calculator} evaluate_total_energy: False adsorption_energy_model: False input_data: _target_: fairchem.core.datasets.atoms_sequence.AtomsDatasetSequence dataset: _target_: fairchem.core.datasets.ase_datasets.AseDBDataset config: src: ${cluster.data_root_dir}/odac/s2ef/test reducer: _target_: fairchem.core.components.benchmark.JsonDFReducer target_data_keys: [energy, forces] benchmark_name: ${benchmark_name} index_name: sid从该配置可以确认两点实现事实加载入口AseDBDataset位于 ase_datasets.py是读取*.aselmdb的标准数据集类通过src指向数据文件所在目录评测目标JsonDFReducer的target_data_keys: [energy, forces]明确对应数据集的两种标签评测指标以sid作为结构索引。同目录下的 odac-s2ef-ood.yaml 采用了完全相同的 runner/reducer 结构仅将数据源切换为ood_linker_topology这类域外测试集说明 ODAC 系列数据遵循统一的域内 多域外评测约定。标签与计算设置PBED3VASP单点计算数据集所有结构均标注了总能eV与原子力eV/Å计算级别为PBED3VASP。仓库中的 setup_vasp.py 脚本展示了与这一理论级别一致的 VASP 参数设置可用于复现 MOF 与 MOF吸附质体系的弛豫calc Vasp( nwrite2, istart0, ggaPE, # PBE 泛函 ivdw12, # DFT-D3 色散修正 encut600.0, # 平面波截断能 600 eV ismear0, sigma0.2, ispin2, # 自旋极化 precAccurate, ediff1e-5, ediffg-0.05, nsw2000, ibrion2, isif3, # 空 MOF同时弛豫原子位置与晶胞 kpts((1, 1, 1),), # 单 k 点大晶胞 MOF 的常见选择 gammaTrue, isym0, ... )脚本中ggaPE对应 PBE 泛函、ivdw12对应 DFT-D3 色散修正与数据集声明的 PBED3 理论级别一致脚本同时提供了两类弛豫模式空 MOF 使用isif3同时弛豫原子位置与晶胞参数已预弛豫的 MOF吸附质体系使用isif2仅弛豫原子位置。需要注意的是该脚本面向 ODAC 系列数据生成过程中的结构弛豫流程而 ODAC25 数据集中直接提供的标签来自单点计算single-point calculations即对固定几何结构计算能量与力。下载与加载ODAC25 数据集托管于 Hugging Face 平台facebook/ODAC25仓库。除直接下载外仓库还提供了统一的批量下载脚本。对于 ODAC 系列的大型数据文件可从仓库根目录运行python src/fairchem/core/scripts/download_large_files.py odac该命令由 src/fairchem/data/odac/README.md 文档说明用于下载 ODAC 相关的大型数据资源包括超胞信息等辅助文件。下载完成后即可通过上文的AseDBDataset配置直接接入训练或评测管线无需额外的格式转换。配套预训练模型UMA 与 eSEN 的选择策略针对 ODAC25 数据集仓库在 docs/dac/models.md 中发布了两套预训练模型并给出了明确的选型建议吸附质推荐模型说明CO₂、H₂OUMA在全部 FAIR Chemistry 数据集含 ODAC25 子集上训练N₂、O₂eSENODAC25 专用仅在 ODAC25 上训练选型逻辑非常清晰UMA 只在 CO₂ 和 H₂O 两种吸附质上训练过且对这两种吸附质与 eSEN 性能相当由于 UMA 未覆盖 N₂ 和 O₂这两类吸附质强烈建议使用专门的 eSEN 模型。从 pretrained_models.json 可以确认 eSEN 模型的具体注册信息esen-sm-filtered-odac25: { filename: esen_sm_odac25_filtered.pt, repo_id: facebook/ODAC25, ... element_refs: { filename: odac_elem_refs.yaml } }, esen-sm-full-odac25: { filename: esen_sm_odac25_full.pt, repo_id: facebook/ODAC25, ... }可见 eSEN 提供了esen-sm-filtered-odac25过滤版与esen-sm-full-odac25完整版两个变体且均从facebook/ODAC25拉取权重并配套odac_elem_refs.yaml元素参考能量文件用于能量标签的归一化对齐。ODAC25 相关论文与模型的引用信息详见 models.md 与 fair_chemistry_papers.md。实战应用基于 ODAC 数据的 MOF 吸附能计算ODAC 系列数据集与预训练模型最典型的应用是计算 MOF 中的气体吸附能。仓库在 adsorption_energy.md 教程中给出了完整方案。对于单个吸附质分子在 MOF 中的吸附能定义为$$ E_{\mathrm{ads}} E_{\mathrm{MOFCO2}} - E_{\mathrm{MOF}} - E_{\mathrm{CO2}} $$其中每个能量项均为对应化学体系弛豫态的能量。刚体 MOF 场景Mg-MOF-74 中的 CO₂ 吸附能教程首先以 Mg-MOF-74CSD 码OPAGIX文献报道 CO₂ 吸附能约 -0.40 eV为例演示刚体假设下的单点计算。加载预训练模型并挂载到 ASE 结构上from fairchem.core import FAIRChemCalculator, pretrained_mlip predictor pretrained_mlip.get_predict_unit(uma-s-1p2) calc FAIRChemCalculator(predictor, task_nameodac) mof_co2.calc calc mof.calc calc co2.calc calc E_ads ( mof_co2.get_potential_energy() - mof.get_potential_energy() - co2.get_potential_energy() ) print(fAdsorption energy of CO2 in Mg-MOF-74: {E_ads:.3f} eV)其中task_nameodac将计算器指向 ODAC 任务专用的能量归一化与元素参考设置。教程配套的输入结构文件位于 structures 目录OPAGIX.cif、OPAGIX_w_CO2.cif、co2.xyz。柔性 MOF 场景WOBHEB 中的 H₂O 吸附能刚体假设会忽略吸附质诱导的 MOF 形变。教程进一步演示了柔性 MOF 处理流程先分别弛豫空 MOF 与 MOF吸附质体系再从吸附态几何中剥离吸附质、对空 MOF 进行二次弛豫并以空 MOF 原始弛豫能量与二次弛豫能量的较小者作为参考能量 $E_{\mathrm{MOF}}$对应代码中的E_mof min(E_mof_empty, E_mof_rerelax)。以 CSD 码WOBHEB的缺陷结构WOBHEB_0.11_0为例H₂O 吸附能计算结果与 DFT 参考值-0.699 eV高度接近。教程还将吸附能分解为宿主-客体相互作用项与 MOF 形变项$$ E_{\mathrm{int}} E_{\mathrm{MOFH2O}}(r_{\mathrm{MOFH2O}}) - E_{\mathrm{MOF}}(r_{\mathrm{MOFH2O}}) - E_{\mathrm{H2O}}(r_{\mathrm{MOFH2O}}) $$$$ E_{\mathrm{MOF,deform}} E_{\mathrm{MOF}}(r_{\mathrm{MOFH2O}}) - E_{\mathrm{MOF}}(r_{\mathrm{MOF}}) $$当 MOF 视为刚体时 $E_{\mathrm{int}}$ 即等于 $E_{\mathrm{ads}}$若不考虑吸附质诱导形变会高估吸附能的绝对大小。这一完整工作流正是 ODAC25 大规模数据所要支撑的核心物理量预测。仓库配套资源除数据集本身外src/fairchem/data/odac/ 目录还沉淀了 ODAC 系列的衍生产物promising_mof/ODAC 论文发现的高潜力 MOF 清单包含完整pristine与缺陷defective结构的 CSV 列表及对应 CIF 结构文件promising_pristine_MOFs.csv、promising_defective_MOFs.csv可直接用于下游筛选验证force_field/经典力场FF对标分析资源README 说明其包含 FF 交互能计算数据data_w_ml.json、复现论文 Figure 5 的 FF_analysis.py 脚本以及基于 LAMMPS Interface 与 UFF4MOF 力场的 CO₂/H₂O 示例计算FF_calcs/目录下的in.lammps、data.frame等文件setup_vasp.py上文提到的 VASP 弛豫配置脚本支持从 CIF 生成 MOF 与 MOF吸附质两套 VASP 输入。许可与引用ODAC25 数据集采用Creative Commons Attribution 4.0 LicenseCC BY 4.0许可发布。任何使用该数据集或相关模型的出版物请引用以下文献misc{sriram2025odac25, title{The Open DAC 2025 Dataset for Sorbent Discovery in Direct Air Capture}, author{Anuroop Sriram and Logan M. Brabson and Xiaohan Yu and Sihoon Choi and Kareem Abdelmaqsoud and Elias Moubarak and Pim de Haan and Sindy Löwe and Johann Brehmer and John R. Kitchin and Max Welling and C. Lawrence Zitnick and Zachary Ulissi and Andrew J. Medford and David S. Sholl}, year{2025}, eprint{}, archivePrefix{arXiv}, primaryClass{}, url{}, }综合来看ODAC25 凭借其近 7000 万次 DFT 计算的规模、四种吸附质与功能化/合成 MOF 带来的化学多样性以及*.aselmdb标准格式与 fairchem 数据管线AseDBDataset的无缝衔接已成为 DAC 吸附剂筛选场景下训练与评测 MLIP 的核心数据资产——配合 UMA/eSEN 预训练模型开发者可直接在 MOF 体系上完成吸附能预测、OOD 泛化评测与高潜力吸附剂初筛。【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考