研究论文

迁移学习预测金属/共价有机骨架材料内小分子气体自扩散系数研究

  • 彭天资 a, ,
  • 沈嘉克 a, ,
  • 郭淑雅 c ,
  • 夏潇潇 , d, * ,
  • 李炜 , a, b, *
展开
  • a 暨南大学国际能源学院 珠海 519070
  • b 暨南大学能源电力研究中心 珠海 519070
  • c 暨南大学化学与材料学院广东省重点实验室超分子配位化学研究所 广州 510632
  • d 海军工程大学 武汉 430033

收稿日期: 2025-11-27

  网络出版日期: 2026-02-04

基金资助

项目受国家自然科学基金(52306012)

广东省基础与应用基础基金(2025A1515012565)

Transfer Learning Predicted the Self-Diffusion Coefficients of Light-Gas in Metal/Covalent Organic Frameworks

  • Peng Tianzi a ,
  • Shen Jiake a ,
  • Guo Shuya c ,
  • Xia Xiaoxiao , d, * ,
  • Li Wei , a, b, *
Expand
  • a School of International Energy, Jinan University, Zhuhai 519070, China
  • b Energy and Electric Power Research Center, Jinan University, Zhuhai 519070, China
  • c Guangdong Provincial Key Laboratory of Supramolecular Coordination Chemistry, College of Chemistry and Materials Science, Jinan University, Guangzhou 510632, China
  • d Naval University of Engineering, Wuhan 430033, China

These authors contributed equally to this work.

Received date: 2025-11-27

  Online published: 2026-02-04

Supported by

National Natural Science Foundation of China(52306012)

Guangdong Basic and Applied Basic Research Foundation(2025A1515012565)

摘要

气体分子在金属(Metal-organic Frameworks, MOFs)/共价(Covalent-organic Frameworks, COFs)有机骨架材料内的扩散系数是重要的物化性质, 显著影响其在气体存储与分离、化学催化等应用中的性能. 分子动力学模拟是分析扩散系数的主要手段之一. 随着新型纳米多孔材料种类的高速增长, 机器学习辅助分子动力学模拟预测扩散系数策略备受关注. 但机器学习也面临着不同数据库及各类气体分子存在差异导致泛化预测精度受限的问题, 尤其是各类材料数据库发展显著失衡, 迁移学习能有效解决此问题, 提升泛化预测性能. 本研究通过分子动力学模拟预测8种气体分子(H2、CH4、H2S、CO2、N2、C2H6、C3H8、C4H10)在MOFs骨架内的自扩散系数, 通过集成和神经网络两类算法进行迁移学习预测COFs内扩散系数, 发现轻量梯度提升树模型迁移后预测精度最高, 且气体的动力学直径、极化率和结构的受限孔直径是重要的描述符. 本工作证明了迁移学习在多类数据库中辅助预测扩散系数的可行性, 为新型纳米多孔材料的泛化学习提供了新的策略.

本文引用格式

彭天资 , 沈嘉克 , 郭淑雅 , 夏潇潇 , 李炜 . 迁移学习预测金属/共价有机骨架材料内小分子气体自扩散系数研究[J]. 化学学报, 2026 , 84(3) : 305 -315 . DOI: 10.6023/A25110385

Abstract

The self-diffusion coefficient of gas molecules within metal/covalent organic frameworks (MOFs/COFs) is a critical physicochemical property that profoundly impacts their performance in gas storage, separation, chemical catalysis, and so on. Molecular dynamics (MD) simulation is a primary approach to assessing the self-diffusion of light-gas in nanoporous materials. With the explosive number of nanoporous materials, machine learning-assisted computational screening to accelerate the investigation of self-diffusion and explore their structure-property relationship has attracted much attention. However, the asymmetric development of the database between MOFs and other nanoporous materials (such as COFs) led to a data imbalance that challenged the development of machine learning for other porous materials, especially for computation-ready experimental (CoRE) databases. Meanwhile, transfer learning (TL) can mitigate such a challenge to enhance generalization by importing similar information extracted from a well-established database (such as CoRE MOFs). This study employs molecular dynamics simulations to predict the self-diffusion coefficients of eight light gases (H2, CH4, H2S, CO2, N2, C2H6, C3H8, C4H10) in the CoRE MOF database and five light gases (H2, CH4, H2S, CO2, N2) in the CoRE COF database. By utilizing the descriptor obtained from the nanoporous structure and the gas molecule, three ensemble-based and network-based transfer learning algorithms were trained. In detail, there are seven geometric descriptors obtained from the structure, including the largest cavity diameter (LCD), pore limiting diameter (PLD), largest free path diameter (LFPD), density (ρ), unit cell, void fraction (VF) and pore volume (PV), and four chemical descriptors obtained from light gas, including kinetic dynamic (Dia), quadrupole moment (Qua), polarizability (Pol) and dipole moment (Dip). The Two-Stage TrAdaBoost.R2 algorithm is adopted to adjust the parameter for the ensemble model for transfer learning, whereas the fine-tuning strategy is performed for the neural network for TL. Among them, the light gradient boosting machine (LGBM) was identified as a promising transfer learning model for high-accuracy (R2=0.802) prediction of the self-diffusion. The kinetic diameter, polarizability of gas molecule, and pore limiting diameter of nanoporous structure are emerging as dominant descriptors with relative importance is 14%, 14%, and 12%, in which small Dia, Pol, and large PLD benefit the diffusion. Furthermore, the transfer learning LGBM model can predict the self-diffusion of three types of gas (C2H6, C3H8, C4H10) with a Spearman's correlation coefficient (SRCC) equal to 0.821. This work validates the feasibility of transfer learning-assisted high-throughput screening, offering a feasible approach for deep learning and cross-material studies of nanoporous materials under data scarcity constraints.

1 引言

金属有机骨架材料(Metal-Organic Frameworks, MOFs)[1-3]与共价有机骨架材料(Covalent Organic Frameworks, COFs)[4]是近年来受到广泛关注的两类新型纳米多孔材料. 它们具有极高的比表面积、可精确调控的孔径尺寸, 以及高度多样化的拓扑结构[5]. 其中MOFs由金属离子或金属团簇与有机连接体通过配位键自组装形成, 具有结构多样性和功能可设计性等优势; 而COFs主要由轻质元素(如C、H、O、N、B等)通过强共价键连接构筑, 相比MOFs还具有密度低、化学性质较为稳定等优点[6]. 这些特性使MOFs和COFs在气体储存[7-8]与分离[9-11]、化学催化[12-13]及质子传导[14-16]及储能[17]等方面展现出显著的应用潜力[6], 涌现出一系列对这两类材料的预测筛选、性能评估及定向合成研究[18].
在多孔材料的各类应用中, 气体分子的自扩散系数是衡量其传质行为的关键指标参数[19], 对其存储与分离、催化性能等涉及传热传质过程的应用具有重要影响. 典型的, 如在气体储存过程中, 其关系到吸附剂充放气(loading/unloading)的动力学行为, 过于缓慢的扩散将导致充放气困难, 而过快的扩散又可能引起稳定性问题. 例如Walenszus等[20]通过原位1H脉冲场梯度核磁共振(NMR)和分子动力学模拟(MD)研究了不同负载量正丁烷在柔性DUT-49(Cu)中的扩散系数, 发现初始随着强相互的位点被逐渐占据, 气体扩散系数逐渐增大, 而当吸附量进一步增大至接近饱和, 孔道阻塞效应显著, 扩散系数大幅下降了约4个数量级. Chen等[21]则通过MD研究了正已烷在NU-100系列MOFs中扩散系数与负载量的关系, 总体而言均符合扩散系数首先下降至最小值, 而后增大至最大值并再度下降这一规律. 这是由于低压下正己烷分子吸附在微孔孔道内导致扩散系数下降, 而压力增大后气体分子较多位于中孔内引发扩散系数提升, 当吸附量进一步增大导致中孔也堵塞后, 迁移通道显著下降, 使扩散系数再度降低. Borah等[22]对甲烷、乙烷、丙烷和正丁烷的储存和运输的研究中, 发现孔道内存在乙烷等气体分子时, 甲烷分子的扩散系数并未受到显著影响; 催化反应体系中, 采用对反应物拥有更高扩散系数的催化剂能够提高催化效率, Liu等[23]成功构建了一种具有中空介孔结构的MOFs材料, 实验和分子动力学模拟都表明该结构显著促进了反应底物4-氯苯乙烯在孔道内的传质与扩散过程, 从而提升了其在催化4-氯苯乙烯氧化反应中的效率. 因此对自扩散系数进行准确预测与系统评估, 能够为高性能多孔材料的定向设计与快速筛选提供理论依据, 进而推动其在低碳能源、工业气体纯化及环境治理等领域的实际应用.
随着计算材料科学的迅猛发展, 高通量计算筛选已成为一种高效的研究范式, 被广泛用于从大规模材料数据库中高效识别具有优异性能的材料, 深入阐明构效关系[24], 如通过分子动力学模拟方法批量预测MOFs数据库中气体的自扩散系数及其他关键物性参数[25]. 而借助高通量筛选产生的数据, 训练机器学习模型预测诸如扩散性质等是前沿发展方向[26-27]. Ren等[28]采用分子动力学模拟计算了稀有气体Xe在4873种MOF材料的自扩散系数, 开发了新型能量描述符并探究了Xe扩散系数与各类特征描述间的构效关系, 随后训练了XGBoost (eXtreme Gradient Boosting)预测自扩散系数, 其均方根误差(root-mean-square error, RMSE)低至0.26, 并发现受限孔直径是影响预测值的主要描述符. Guo等[29]则预测了10种小分子气体(C2H6、Xe、CH4、Kr、N2、H2S、O2、CO2、H2和He)的自扩散系数, 除了结构描述符外, 通过引入气体的描述符, 提升了机器学习模型预测的准确度. 目前训练的机器学习模型仍存在局限性, 尤其是训练和预测的均是基于同种数据库, 如hypothetical MOFs (hMOFs)或CoRE (Computation-Ready, Experimental) MOFs, 缺乏面向其他数据库或诸如COFs数据库的泛化预测研究[30], 尤其是专门面向COFs气体扩散性质的公开数据库[31]. 其次, 由于MOFs与COFs在化学构筑单元、孔道化学环境等方面存在本质差异, 基于MOFs数据训练的机器学习模型在直接应用至COFs体系时泛化能力显著下降, 如基于特定MOFs(如ZIF-8)训练的机器学习模型预测COFs结构性质[31]时预测精度显著下降. 而迁移学习(Transfer Learning, TL)作为一种先进的机器学习范式, 其核心思想在于将从一个大规模数据集(源域)中学习得到的知识、特征或模型参数, 有效地迁移到另一个数据相对稀缺但任务相关的迁移域中, 从而提升目标性质预测的准确性与泛化能力[32]. 近年来, 这一方法逐渐受到多孔材料计算研究领域的关注, 已有一些研究工作尝试将迁移学习策略应用于辅助高性能多孔材料的筛选与设计中, 展现出优异的效果[33].
本工作聚焦CoRE MOFs/COFs数据库, 通过高通量计算筛选分子模拟, 建立8/5种气体的自扩散系数数据集. 采用纳米材料孔道结构特征作为几何描述符和气体分子的动力学直径等作为物化性质描述符, 基于MOFs数据集训练了三类机器学习集成算法和神经网络模型, 迁移学习预测COFs性能. 结果表明, 迁移学习模型相比MOFs预训练模型直接泛化预测COFs自扩散系数具有更高的准确性, 且可泛化预测未迁移的气体种类. 本研究为多孔材料内小分子气体自扩散性能的跨数据库预测提供了有效的迁移学习框架, 揭示了影响自扩散性质的构效关系, 为高效传质的纳米多孔材料筛选提供了行之有效的方法.

2 模型与方法

2.1 数据库

本工作使用的纳米多孔材料结构数据均源自于公开数据集, 包括CoRE MOF-2024 DB[34]数据库中的6963个金属有机框架结构数据, 和CoRE COF-v7.0数据库[35]中的1242个共价有机框架结构数据. 采用MOFs数据作为源域进行模型的预训练, 将COFs数据作为迁移域, 并从迁移域中随机选取部分数据参与迁移学习训练, 剩余的COFs数据则作为迁移域的训练测试集.

2.2 分子动力学模拟和特征描述符

2.2.1 分子动力学模拟

对于6963种MOFs和1242种COFs结构, 本工作均通过分子动力学模拟(Molecular Dynamic, MD)计算获知多种气体的自扩散系数, 其中MOFs有8种气体(H2、CH4、H2S、CO2、N2、C2H6、C3H8、C4H10), COFs有5种气体(H2、CH4、H2S、CO2、N2). MOFs和COFs晶体均采用固定结构, 忽略骨架柔性形变对扩散系数的影响, 采用UFF (Universal force field)[36]力场描述, 电荷则为Eqeq方式计算获得, 气体分子则采用TraPPE (Transferable Potentials for Phase Equilibria Force Field)[37]力场描述. 分子动力学模拟在开源软件RASPA[38]中开展, 系综为无限稀释状态下的NVT, 温控采用Nosé-Hoover热浴算法, 温度设置为303 K. 库仑力采用Ewald方法计算, 截断半径设置为1.28 nm, 精度为1×10−6. 共运行5 ns, 时间步长为5×10−4 ns, 其中预平衡时间2.5 ns, 剩余2.5 ns为计算时间, 1000步采样1次, 以上力场在预测晶体内气体性质方面已经经过广泛验证[39-40]. 通过MD获得的均方位移, 依据Einstein- Stokes[41]公式计算自扩散系数, 其详细计算过程见支持信息S1. 基于此, 针对纳米多孔材料内各类气体分子的自扩散系数构建了MOFs源域与COFs迁移域数据集, 在删去由于模拟未平衡等原因导致的空值数据及扩散系数异常值后, 最终包含55704和6199条数据. MOFs结构中扩散系数拟合R2≥0.9占97.04%的比例, 0.9>R2≥0.8的占2.49%的比例, R2<0.8的占0.47%的比例. COFs结构中扩散系数拟合R2≥0.9占99.47%的比例, 0.9>R2≥0.8的占0.35%的比例, R2<0.8的占0.17%的比例. 代表性的拟合结果见支持信息S1的Fig. S2.

2.2.2 描述符

因自扩散系数与多孔材料孔道特征等几何描述符具有显著的相关性[42], 选取了7个几何描述符作为机器学习模型的输入特征. 均由Zeo++软件[43]计算得到, 包括最大腔体直径(LCD, 单位nm)、孔隙限制直径(PLD, 单位nm)和最大自由路径腔体直径(LFPD, 单位nm)由半径为0.1655 nm的氮气分子探针计算得到. 而密度(ρ, 单位g•cm−3)、单位晶胞体积、孔隙率和单位质量孔体积无需探针可直接计算得到, 后三者分别记为PV(1)、PV(2)和PV(3). 对于气体分子, 采用四类物理性质[29]作为描述符参与气体分子自扩散系数的预测, 分别为动力学直径(Dia, 单位nm)、极化率(Pol, 单位nm3)、四极矩(Qua, 单位C•m2)和偶极矩(Dip, 单位D). 其中Qua和Dip为零则正常记为0. 以上描述符总结列于表1中. 本工作也尝试了诸如AP-RDF化学信息描述符, 从支持信息Fig. S4, S5和Table S5, S6可以看出, 加入AP-RDF描述符未显著提升LGBM模型预测H2扩散系数的精度, 各类AP-RDF描述符对机器学习预测的影响权重均较低(小于0.01), 总和最大影响权重也未超过0.08, 因而没有采用AP-RDF描述符. 最终选定以上参数作为描述符, 描述符的优化过程详见支持信息S2.
表1 描述符及其缩写和单位列表

Table 1 List of descriptors, their abbreviations, and units

Descriptors Abbreviations Units
Largest Cavity Diameter LCD nm
Pore Limiting Diameter PLD nm
Largest Free Path Diameter LFPD nm
Framework Density ρ g•cm−3
Unit Cell Volume PV(1) nm3
Porosity PV(2)
Pore Volume per Unit Mass PV(3) cm3•g−1
Kinetic Diameter Dia nm
Polarizability Pol nm3
Quadrupole Moment Qua C•m2
Dipole Moment Dip D

2.3 机器学习与迁移学习

研究的机器学习与迁移学习流程如图1所示, 采用Scikit-Learn开源库、LightGBM开源库集成提供的三种基于树模型的算法和基于PyTorch搭建的神经网络算法训练迁移学习模型, 具体为随机树森林(Random Forest, RF)、极限梯度提升树(eXtreme Gradient Boosting, XGBoost)、轻量梯度提升树(Light Gradient Boosting Machine, LGBM)和深度神经网络(Deep Neural Networks, DNN), 其中DNN为四层网络结构. 对于LGBM等树模型的算法, 数据无需归一化处理, 而对于DNN算法, 数据集进行了线性归一化处理. 在预训练中, 将源域数据集中的MOFs按4∶1的比例分为训练集与测试集进行5折交叉验证训练, 并结合贝叶斯优化搜索最优模型参数, 评估机器学习模型预测精度采用决定系数(R2[44])、均方误差[45](mean-square error, MSE)和斯皮尔曼秩相关系数[46](Spearman’s correlation coefficient, SRCC). 优化后的迁移学习超参数见支持信息S3. 相关的MOFs和COFs的数据库、预训练和迁移学习代码已上传至github:
https://github.com/agptz483/Transfer-Learning-Predicted-the-Self-Diffusion-Coefficients-of-Light-Gas-in-Metal-Covalent-Organic-F.
图1 MOFs迁移学习预测COFs内小分子气体自扩散系数流程图

Figure 1 The flowchart of transfer learning based on MOF datasets to predict the self-diffusion of light-gas in the COFs dataset

对于迁移域数据集, 本工作从中随机选取2500条数据, 即平均每一种气体分子约有500条数据参与迁移学习的训练, 剩余的COFs数据则作为迁移域的目标集. 而后对RF、XGBoost、LGBM三种集成算法采用Two-Stage TrAdaBoost R2[47]方法进行迁移学习, 该算法能够识别源域中与目标域具有较高分布相似性的数据成分, 并将其有效信息迁移至目标域任务中进行重复运用. 在迭代优化过程中, 系统动态调整不同样本的权重分配, 逐步降低源域中与目标域关联性较弱实例的贡献度, 同时增强源域与目标域中强相关性实例的影响权重, 从而引导模型在参数更新过程中实现精准且高效的迁移学习; 对于DNN则采用Fine-tuning微调方法[48]进行了以下三种迁移学习策略:
DNN_1: 仅微调输出层; DNN_2: 微调输出层和最后一层隐藏层; DNN_3: 微调输出层和第一层隐藏层.
通过Fine-tuning对选定的层在迁移域的训练中进行参数和权重的微调从而更新模型以适应迁移域的预测.

3 结果与讨论

3.1 构效关系

为了观察MOFs与COFs数据库的结构特征以及气体性质差异, 本工作采用了t分布随机邻域嵌入(t-SNE)算法[49]对以上数据进行了降维可视化分析. 结果如图2所示, MOFs与COFs在孔径大小上存在一定差异, 且不同气体种类的特征点在二维空间中呈现明显的聚类分布, 说明孔径等结构特征的分布差异与气体种类的区分对自扩散系数的预测可能有着重要影响. 如图2(b)所示, 8类气体呈现出各异的分布特性. 其中, MOFs数据集的PLD大小大概分布在0~3.5 nm, 而COFs数据集的PLD大小大概分布在0~9 nm. 对于其他的描述符, COFs倾向于拥有更小的ρ和更大的PV. 且相比于MOFs, COFs的几何描述符表现出较为显著的分布差距.
图2 数据集的t-SNE分布图

(a)~(d)依次分别为总数据集、总数据集以气体区分, MOFs数据集、COFs数据集的t-SNE分布图, 其中(a)、(c)和(d)以log(PLD)着色

Figure 2 t-SNE Distribution of MOF and COF Datasets

t-SNE distribution plots of datasets, Panels (a)~(d) correspond to the entire dataset, the entire dataset divided by gas molecule, the MOFs dataset, and the COFs dataset, which (a), (c), and (d) are colored by the log(PLD), respectively

图3进一步展示了各几何描述符与自扩散系数间的构效关系. 由于自扩散系数数值量级差距过大, 对自扩散系数采用了对数化(lgD)处理. 虽然MOFs与COFs数据集的各描述符与自扩散系数在数据与数值范围上存在差异, 但整体而言呈现出相似的趋势, 也即小孔径的结构扩散系数较低, 随着孔径增大扩散系数升高, 两类结构相似的趋势是进行迁移学习的基础. 不同种类气体的自扩散系数与描述符间的构效关系则略有差异, 以H2为例, MOFs结构的LCD、PLD、LFPD小于0.5 nm时, 其自扩散系数较低(-4.0<lgD<-3.0), 当孔径超过0.5 nm后, 自扩散系数显著增大至-2.5至-1.5区间内; 而对于N2而言, 其自扩散系数在孔径超过0.5 nm后的值相对较小, 位于-4.0至-3.0之间. 整体而言, 对于分子量较大, 与骨架相互作用强的气体分子, 如H2S、CO2等其扩散系数偏低, 而小分子的H2、CH4扩散系数偏高. 此外, 密度与各类气体的自扩散系数与LCD、PLD、LFPD的趋势相异, 随着密度增大, lgD呈现出较为线性的下降趋势.
图3 几何描述符与自扩散系数的构效关系

(a)~(g)依次分别为LCD、PLD、LFPD、ρ、PV(1)、PV(2)、PV(3)与各类气体分子自扩散系数对数值的散点图, 其中主图中的是COFs, 小图中的是MOFs, 气体分子的种类由散点的形状和颜色区分

Figure 3 Structure-property relationships of geometric descriptors and self-diffusion coefficients

The scatter plots illustrate the relationships between geometric descriptors and the logarithmic self-diffusion coefficient (lgD) of gas molecules in frameworks. Panels (a)~(g) correspond to the largest cavity diameter (LCD), pore limiting diameter (PLD), largest free path diameter (LFPD), framework density (ρ), unitcell volume, void fraction, and unit mass pore volume (PV(1), PV(2), PV(3)), respectively. Main plots represent COFs, with insets showing MOFs. Gas molecule types are distinguished by scatter point shapes and colors

对于PV(1)、PV(2)和PV(3)而言, 其与自扩散系数的构效关系和孔径类描述符略有不同. 其中PV(1)表征晶胞尺寸大小, 由图3(e)可知, 大部分MOFs与COFs结构晶胞尺寸分布在0~300 nm3与0~100 nm3内, 仅有32个MOFs大于300 nm3且最大值为1462.829 nm3, 19个COFs大于100 nm3且最大值为839.154 nm3, 而大尺寸晶胞并未带来自扩散系数的显著提升. 对于PV(2)而言, 可以发现其与自扩散系数(lgD)呈现较为线性的增长趋势且各类气体分布区间相对集中. 而对于PV(3)而言, 自扩散系数表现出显著的快速增长而后接近上限的趋势, 转折大致位于3~4 cm3•g−1范围内.
图4进一步展示了各类描述符之间的Pearson相关系数. 对于MOFs而言, 其中LCD、PLD、LFPD和PV与lgD呈现正相关趋势, 其相关系数r位于0.17~0.38区间内, 其中PV(2)最高为0.38. 这是因为PV(2)表征的孔隙率较大时, 气体分子在扩散过程中受到的相互作用和限制较弱, 有利于扩散系数的增大. 而ρ、Dia、Pol、Dip、Qua与扩散系数表现出负相关趋势, 其相关系数位于-0.04~-0.58区间. 其中Dia、Pol与扩散系数的相关性超越了孔径等几何描述符性质. 结合图3可知, 较大分子动力学直径与极化率会显著阻碍气体分子的扩散, 因而表现出极高的相关性. 另一方面, 由于并非所有气体分子都具有四极矩和偶极矩, 因此Qua和Dip对大多数分子的扩散特性影响较小, 但部分极性气体除外, 例如CO2, N2, H2S[18].
图4 描述符的Pearson相关系数热图

描述符与自扩散系数之间的Pearson相关系数热图, (a)对应MOFs数据集, (b)对应COFs数据集

Figure 4 Pearson correlation heatmap of descriptors

Heatmap of Pearson correlation coefficients between descriptors and the self-diffusion coefficient. Panel (a) corresponds to the MOFs dataset, and panel (b) corresponds to the COFs dataset

3.2 预训练

为了实现预测COFs内多种气体自扩散系数的迁移学习, 首先基于结构样本量充足的MOFs数据集训练各类算法得到预训练模型. 如前所述, 包括三种树分类模型(RF、XGBR和LGBM)和一种神经网络(DNN)模型, 每类预训练模型都结合贝叶斯超参数优化和5折交叉验证. MOFs预训练和直接泛化预测的R2、Spearman相关系数和R2表2.
表2 MOFs预训练与COFs直接泛化预测结果

Table 2 MOFs pretraining and COFs direct generalization prediction results

Model MOFs COFs
R2 SRCC MSE R2 SRCC MSE
RF 0.806 0.855 0.051 0.716 0.805 0.091
XGBR 0.813 0.862 0.049 0.666 0.785 0.108
LGBM 0.817 0.863 0.048 0.683 0.792 0.102
DNN 0.792 0.841 0.054 0.669 0.786 0.107
各类预训练模型在MOFs数据集上的预测精度较为接近, 性能最优的为LGBM模型, 其R2为0.817, Spearman秩相关系数为0.863, MSE为0.048. 而DNN预训练模型的精度则相对较低, 其R2=0.792, SRCC=0.841, MSE=0.054, 与其他性能相对较好的预训练模型相比并无显著差异. 而以预训练模型直接泛化预测COFs数据库的R2普遍偏低(0.666<R2<0.716), 精度并不理想, 表明若对其他类型数据库进行泛化预测, 需要采用迁移学习策略[50].

3.3 迁移学习

将MOFs数据集作为源域, 以COFs数据集作为迁移域, 从COFs数据集中随机选取2500项数据(约40%)参与迁移学习训练, 剩余的COFs数据则作为迁移域的目标集. 按上文所述, 对三种集成机器学习算法和神经网络模型分别采用Two-Stage TrAdaBoost R2方法和Fine-tuning微调方法进行迁移学习, 结果如表3图5所示.
表3 COFs直接学习与迁移学习结果

Table 3 COFs direct learning and transfer learning results

Learning Way Model COFs
R2 SRCC MSE
Direct
Learning
RF 0.809 0.852 0.063
XGBR 0.826 0.866 0.057
LGBM 0.827 0.866 0.057
DNN 0.781 0.841 0.072
Transfer Learning RF 0.775 0.822 0.071
XGBR 0.791 0.833 0.068
LGBM 0.803 0.842 0.064
DNN_1 0.771 0.826 0.074
DNN_2 0.753 0.819 0.080
DNN_3 0.760 0.830 0.078
图5 自扩散系数预测值与模拟值的比较

各模型的自扩散系数预测值与模拟值之间的散点图, (a)~(f)依次对应RF、XGBR、LGBM、DNN_1、DNN_2和DNN_3

Figure 5 Comparison of predicted and simulated self-diffusion coefficients

Scatter plots of predicted versus simulated self-diffusion coefficients (D) for different models. Panels (a)~(f) correspond to Random Forest (RF), Extreme Gradient Boosting Regression (XGBR), Light Gradient Boosting Machine (LGBM), and three Deep Neural Network models (DNN_1, DNN_2, DNN_3), respectively

总体而言, 各模型的迁移学习结果相比MOFs预训练模型直接泛化预测的结果都有显著提升, 且和MOFs的预训练结果与COFs的直接学习结果几无差异. 其中表现最好的是LGBM的迁移学习(R2=0.803, SRCC=0.842, MSE=0.064). 神经网络三种模型中仅微调输出层的DNN_1模型表现最好, 其R2=0.771, SRCC=0.826, MSE=0.074. 相比之下, 调整输出层和最后一层隐藏层的DNN_2在预测较大值的扩散系数时表现不佳, 可能是由于少量COFs数据集的加入未能充分反应构效关系, 导致模型预测出现偏移.
为了深入理解多孔材料晶体结构和气体分子性质等各特征描述符对迁移学习预测结果的影响, 采用SHapley Additive exPlanations (SHAP)方法分析了LGBM和DNN_1两种迁移学习模型中的影响权重. 如图6a所示, 在LGBM迁移学习模型中, Dia、Pol和PLD三者是权重最高的描述符, 分别为14%, 14%和12%. 较小的Dia和Pol可以显著推高迁移学习预测的自扩散系数, 较大的Dia和Pol则相应的使预测的自扩散值偏低. 而PLD主要影响框架对气体分子的筛选能力, 其允许较小的气体分子通过, 并且阻断较大气体分子的扩散, 对于气体分子的扩散具有类似“瓶颈”的作用. 因此Dia与PLD的匹配程度对气体分子在框架中的扩散有着重要影响[51-52]. Pol高的气体分子, 尤其是非极性大分子(CH4、C2H6、C3H8、C4H10), 可能与框架产生较强的相互作用, 不易扩散.
图6 模型的SHAP值解释图

(a)对应LGBM, (b)对应DNN_1, 其各自的左图为SHAP值重要性, 右图为特征密度散点图

Figure 6 SHAP value interpretation of model

SHAP value interpretation plots for different models. Panel (a) corresponds to Light Gradient Boosting Machine (LGBM), and panel (b) corresponds to Deep Neural Network (DNN_1). The left plot in each panel shows SHAP value importance, and the right plot shows the feature density scatter plot

此外, 无论是对框架的直接学习还是迁移学习, DNN的性能均低于另外三种树模型集成算法, 从图6中对其的SHAP分析可知, DNN中Qua和Dip的重要性远远高于LGBM中的, 说明DNN更关注气体分子与框架之间的相互作用而非框架的几何特征, 但这些气体分子物理性质描述符的数据分布较窄, DNN可能过分放大了它们的作用; 而LGBM这样基于树模型分裂机制的算法能更好地平衡所有特征. 其次, DNN更适用于高维度的数据[53], 而本工作使用的描述符较少. 因此, 关于气体分子在框架中的扩散与吸附的研究还可以考虑采用化学描述符、能量描述符等, 可以有效地提升预测精 度[42], 但同时也会伴随时间成本和计算量的增加.
最后, 为系统评估最终构建的迁移学习模型(性能较好的LGBM+Two-Stage TrAdaBoost.R2与DNN_1)在未知气体体系中的泛化能力, 本研究将其直接应用于CoRE COFs数据库内未参与模型训练过程的三种气体(C2H6、C3H8、C4H10)的自扩散系数预测任务. 值得一提的是, 迁移学习过程中未引入任何关于这三种气体在COFs材料中的数据作为训练输入或微调依据. 具体而言, 对三种气体的所有COFs样本进行自扩散系数预测, 再按预测值从小到大排序, 为防止样本选取过于紧密或稀疏而失去一般性, 本工作从最小值开始每隔5条数据选取1条, 共筛选30条代表性样本, 最后对这30条样本进行分子模拟以获得真实模拟值, 并与预测值进行分析比较. 如图7所示, LGBM+Two-Stage TrAdaBoost.R2模型输出的预测值与模拟值之间的SRCC达到0.821±0.005, DNN_1则为0.767±0.008, 且LGBM算法的模拟与迁移学习预测的对数扩散系数结果误差均不超过0.5. 这一统计指标表明, 该迁移学习模型能够准确捕捉不同COF材料对气体自扩散系数相对大小的排序规律, 正确反映气体分子在不同框架结构中扩散难易程度的相对顺序. 以LGBM为例, 支持信息Fig. S6展示了不同随机种子下2500条COFs样本参与的迁移学习、相同COFs训练量的直接学习和MOFs直接泛化预测的SRCC结果, 表明此规模迁移数据量下, 迁移学习(R2: 0.794±0.003; SRCC: 0.838±0.003)可与采用COFs数据集直接训练(R2: 0.793±0.002; SRCC: 0.838±0.004)的精确度近乎相同, 随机种子的影响较小. 而对于未见数据集中的C2H6、C3H8、C4H10, 迁移学习预测的SRCC为0.821±0.005, 远高于COFs直接学习的SRCC结果(0.662±0.009), 展现出了迁移学习优异的泛化性能. 以上表明在数据库样本量不足等情况下, 迁移学习可以为高通量计算提供预筛选的策略, 支撑研究人员从相似的候选材料数据库中快速、有效地识别出扩散系数的高、低水准, 进而开展后续的分子动力学模拟, 从而大幅降低整体流程中的计算资源消耗.
图7 (a)迁移学习LGBM模型预测C2H6、C3H8、C4H10三类气体在30种COF结构中的自扩散系数; (b)迁移学习DNN_1模型预测C2H6、C3H8、C4H10三类气体在30种COF结构中的自扩散系数

Figure 7 (a) The transfer learning-based LGBM model predicts the self-diffusion of C2H6, C3H8, and C4H10 among 30 COF structures. (b) The transfer learning-based DNN_1 model predicts the self-diffusion of C2H6, C3H8, and C4H10 among 30 COF structures

4 结论

本研究采用分子动力学模拟计算得到了8种气体在6963种CoRE MOFs和5种气体在1242种CoRE COFs中的自扩散系数, 构效分析表明孔道结构与气体种类等性质对自扩散系数有着重要影响. 基于获知的MOFs/COFs自扩散系数数据库, 利用纳米多孔材料的LCD、PLD、LFPD、PV(1~3)和气体分子的Dia、Pol、Qua、Dip作为描述符, 训练了3种集成学习算法(RF、XGBR、LGBM)和三类深度学习(DNN)模型. 研究发现LGBM是迁移学习效果最好的算法, 其R2接近0.802, 而DNN迁移学习模型中最佳的是仅微调输出层的模型. 分析其SHAP值重要性得到Dia和Pol能显著阻碍气体分子的扩散, 且PLD是孔道结构中影响扩散的重要几何描述符. 此外, 通过对三种不在迁移样本数据集(C2H6、C3H8、C4H10)中气体的预测, 发现LGBM的SRCC达到0.821, 且算法的模拟与迁移学习预测的对数扩散系数结果误差均不超过0.5, 表明了未加入此类数据的情况下, 迁移学习模型能够正确反映COF材料对其他类别气体自扩散系数的排序规律.
本工作聚焦于小分子气体在MOFs/COFs结构中的自扩散系数的机器学习模型构建和描述符选取, 研究证明了迁移学习辅助高通量筛选自扩散系数的可行性. 在数据库样本量不足、结构多样性缺乏等情况下, 基于某类材料较为完备的数据库, 迁移学习可以支撑研究人员从多种相似的候选材料数据库中快速、有效地评估自扩散系数性质, 进而开展后续的分子动力学模拟以及实验研究, 为存在数据规模限制的纳米多孔材料的深度学习和跨材料学习提供了新的方法.
(Cheng, B.)
[1]
O'Keeffe M.; Peskov M.A.; Ramsden S.J.; Yaghi O.M.; Acc. Chem. Res. 2008, 41, 1782.

DOI

[2]
Zhou H.-C. J.; Kitagawa S. Chem. Soc. Rev. 2014, 43, 5415.

DOI

[3]
Gao C.; Zhang S.-T.; Pang H. Acta Chim. Sinica 2025, 83, 962 (in Chinese).

DOI

(高春, 张松涛, 庞欢, 化学学报, 2025, 83, 962.)

DOI

[4]
Feng X.; Ding X.; Jiang D. Chem. Soc. Rev. 2012, 41, 6010.

DOI

[5]
Furukawa H.; Cordova K. E.; O'Keeffe M.; Yaghi O. M. Science 2013, 341, 974.

[6]
Ding S.-Y.; Wang W. Chem. Soc. Rev. 2013, 42, 548.

DOI

[7]
Furukawa H.; Yaghi O. M. J. Am. Chem. Soc. 2009, 131, 8875.

DOI

[8]
Makal T. A.; Li J.-R.; Lu W.; Zhou H.-C. Chem. Soc. Rev. 2012, 41, 7761.

DOI

[9]
Gong L.; Ye Y.; Liu Y.; Li Y.; Bao Z.; Xiang S.; Zhang Z.; Chen B. ACS Appl. Mater. Interfaces 2022, 14, 19623.

DOI

[10]
Wu Z.-L.; Zhang L.; Chen Y.; Li J.-P.; Li L.-B. Acta Chim. Sinica 2025, 83, 917 (in Chinese).

DOI

(吴子林, 张璐, 陈杨, 李晋平, 李立博, 化学学报, 2025, 83, 917.)

DOI

[11]
Yan B.; Song J.-H.; Zhang D.-L.; Guan Z.-J.; Fang Y. Chin. J. Chem. 2025, 43, 1078.

DOI

[12]
Kalidindi S. B.; Yusenko K.; Fischer R. A. Chem. Commun. 2011, 47, 8506.

DOI

[13]
Ma L.; Abney C.; Lin W. Chem. Soc. Rev. 2009, 38, 1248.

DOI

[14]
Ban M.-H.; Shuang Y.-Z.; Yang A.-P.; Zheng C.-Y.; Zhang W.; Xu F. Acta Chim. Sinica 2025, 83, 1435 (in Chinese).

DOI

(班渺寒, 双亚洲, 杨安平, 郑长勇, 张伟, 徐飞, 化学学报, 2025, 83, 1435.)

DOI

[15]
Li C.-Q.; Yu J.-J.; Feng X. Acta Chim. Sinica 2025, 83, 1223 (in Chinese).

DOI

(李澄秋, 余嘉俊, 冯霄, 化学学报, 2025, 83, 1223.)

DOI

[16]
Zhang K.; Wu L.; Zhang Y.; Zhang H.; Wu D. Chin. J. Chem. 2025, 43, 61.

DOI

[17]
Cui Y.-Q.; Li J.-Y.; Sun J.-K. Acta Chim. Sinica 2025, 83, 624 (in Chinese).

DOI

(崔雨琪, 李军玉, 孙建科, 化学学报, 2025, 83, 624.)

DOI

[18]
Luo X.; Chen Y.; Lin J.-T.; Luo J.; Xia R.-Q.; Yin N.; Lin Y.-M.; Duan H.; Ren S.-B.; Gao Q.; Ning G.-H.; Li D. Chin. J. Chem. 2025, 43, 1199.

DOI

[19]
Mu W.; Liu D.-H.; Yang Q.-Y.; Zhong C.-L. Acta Phys.-Chim. Sin. 2010, 26, 1657 (in Chinese).

DOI

(穆韡, 刘大欢, 阳庆元, 仲崇立, 物理化学学报, 2010, 26, 1657.)

[20]
Walenszus F.; Bon V.; Evans J. D.; Kaskel S.; Dvoyashkin M. J. Phys. Chem. Lett. 2020, 11, 9696.

DOI

[21]
Chen H.; Snurr R. Q. Langmuir 2020, 36, 1372.

DOI

[22]
Borah B.; Zhang H.; Snurr R. Q. Chem. Eng. Sci. 2015, 124, 135.

DOI

[23]
Qin Y.; Han X.; Li Y.; Han A.; Liu W.; Xu H.; Liu J. ACS Catal. 2020, 10, 5973.

DOI

[24]
Gao Z.; Wang H.; Qu Z.-G. J. Ind. Eng. Chem. 2025, 76, 4259 (in Chinese).

(高正, 汪辉, 屈治国, 化工学报, 2025, 76, 4259.)

[25]
Liu Z.-L.; Li W.; Liu H.; Zhuang X.-D.; Li S. Acta Chim. Sinica 2019, 77, 323 (in Chinese).

DOI

(刘治鲁, 李炜, 刘昊, 庄旭东, 李松, 化学学报, 2019, 77, 323.)

DOI

[26]
Li W.; Liang T.-G.; Lin Y.-C.; Wu W.-X.; Li S. Prog. Chem. 2022, 34, 2619 (in Chinese).

(李炜, 梁添贵, 林元创, 吴伟雄, 李松, 化学进展, 2022, 34, 2619.)

DOI

[27]
Wang S.-H.; Xue X.-Y.; Cheng M.; Chen S.-C.; Liu C.; Zhou L.; Bi K.-X.; Ji X. Acta Chim. Sinica 2022, 80, 614 (in Chinese).

DOI

(王诗慧, 薛小雨, 程敏, 陈少臣, 刘冲, 周利, 毕可鑫, 吉旭, 化学学报, 2022, 80, 614.)

DOI

[28]
Ren E.; Coudert F.-X. J. Phys. Chem. C 2024, 128, 6917.

DOI

[29]
Guo S.; Huang X.; Situ Y.; Huang Q.; Guan K.; Huang J.; Wang W.; Bai X.; Liu Z.; Wu Y.; Qiao Z. Adv. Sci. 2023, 10, 2301461.

DOI

[30]
Li W.; Cai Z.-L.; Li S.; Wu W.-X. Sep. Purif. Technol. 2025, 378, 134533.

DOI

[31]
Park J.; Kim H.; Kang Y.; Lim Y.; Kim J. JACS Au 2024, 4, 3727.

DOI

[32]
Zhuang F.; Qi Z.; Duan K.; Xi D.; Zhu Y.; Zhu H.; Xiong H.; He Q. P IEEE 2021, 109, 43.

DOI

[33]
Park H.; Kang Y.; Kim J. ACS Appl. Mater. Interfaces 2023, 15, 56375.

DOI

[34]
Zhao G.; Brabson L. M.; Chheda S.; Huang J.; Kim H.; Liu K.; Mochida K.; Pham T. D.; Prerna; Terrones G. G.; Yoon S.; Zoubritzky L.; Coudert F.-X.; Haranczyk M.; Kulik H. J.; Moosavi S. M.; Sholl D. S.; Siepmann J. I.; Snurr R. Q.; Chung Y. G. Matter 2025, 8, 102140.

DOI

[35]
Tong M.; Lan Y.; Yang Q.; Zhong C. Chem. Eng. Sci. 2017, 168, 456.

DOI

[36]
Rappe A. K.; Casewit C. J.; Colwell K. S.; Goddard W. A., III; Skiff W. M. J. Am. Chem. Soc. 1992, 114, 10024.

DOI

[37]
Chen B.; Potoff J. J.; Siepmann J. I. J. Phys. Chem. B 2001, 105, 3093.

DOI

[38]
Dubbeldam D.; Calero S.; Ellis D. E.; Snurr R. Q. Mol. Simul. 2015, 42, 81.

DOI

[39]
Wilmer C. E.; Leaf M.; Lee C. Y.; Farha O. K.; Hauser B. G.; Hupp J. T.; Snurr R. Q. Nature Chem. 2012, 4, 83.

DOI

[40]
Demir H.; Keskin S. Mol. Syst. Des. Eng. 2021, 6, 627.

DOI

[41]
Han C.; Verploegh R. J.; Sholl D. S. J. Phys. Chem. Lett. 2018, 9, 4037.

DOI

[42]
Sung I. T.; Cheng Y.-H.; Hsieh C.-M.; Lin L.-C. Ind. Eng. Chem. Res. 2025, 64, 1859.

DOI

[43]
Willems T. F.; Rycroft C.; Kazi M.; Meza J. C.; Haranczyk M. Microporous Mesoporous Mater. 2012, 149, 134.

DOI

[44]
Ozer D. J. Psychol. Bull. 1985, 97, 307.

DOI

[45]
Hodson T. O. Geosci. Model Dev. 2022, 15, 548.

[46]
Wissler C. Science (New York, N.Y.). 1905, 22, 309.

[47]
Al-Stouhi S.; Reddy C. K. In Machine Learning and Knowledge Discovery in Databases, Lecture Notes in Computer Science 6911, Eds.: Gunopulos,D.; HofmannT.; MalerbaD.; VazirgiannisM.,Springer, Berlin, Heidelberg, 2011, pp. 60-75.

[48]
Anderson G. W.; Castano D. J. Phys. Lett. B 1995, 347, 300.

DOI

[49]
Cai T. T.; Ma R. J. Mach. Learn. Res. 2022, 23, 1.

[50]
Chen S.-C.; Cheng M.; Wang S.-H.; Wu J.-K.; Luo L.; Xue X.-Y.; Ji X.; Zhang C.-C.; Zhou L. Chem. J. Chinese U. 2023, 44, 1 (in Chinese).

(陈少臣, 程敏, 王诗慧, 吴金奎, 罗磊, 薛小雨, 吉旭, 张长春, 周利, 高等学校化学学报, 2023, 44, 1.)

[51]
Qiao Z.; Peng C.; Zhou J.; Jiang J. J. Mater. Chem. A 2016, 4, 15904.

DOI

[52]
Guan Y.; Huang X.; Xu F.; Wang W.; Li H.; Gong L.; Zhao Y.; Guo S.; Liang H.; Qiao Z. Nanomaterials 2024, 14, 1074.

DOI

[53]
Cai Z.; Li W.; Chung Y. G.; Li S.; Liang T.; Wu T. Sep. Purif. Technol. 2024, 348, 127752.

DOI

文章导航

/