ARTICLES

High-Throughput Screening of Ullmann Reaction Conditions and Study of Their Regularity

  • Zaixiang Guo ,
  • Yun Zou ,
  • Peihao Cheng ,
  • Fujun Li ,
  • Shengyang Tao , *
Expand
  • School of Chemistry, Dalian University of Technology, Dalian, Liaoning 116024

†The authors contributed equally to this work.

Received date: 2025-07-09

  Revised date: 2025-10-16

  Online published: 2025-12-10

Supported by

National Natural Science Foundation of China(22372025)

Fundamental Research Funds for the Central Universities(DUT22LAB607)

Fundamental Research Funds for the Central Universities(DUT22QN226)

Copyright

© 2026 Shanghai Institute of Organic Chemistry, Chinese Academy of Sciences

Abstract

Although classical physical organic chemistry theories have undergone significant development, it remains challenging to rapidly determine the optimal reaction conditions and elucidate possible mechanisms for specific reactions. In recent years, high-throughput experimentation and data-driven analysis have emerged as powerful tools to address these challenges. In this study, an automated high-throughput experimental platform combined with big data and machine learning techniques was employed to optimize the reaction conditions and investigate the mechanism of the Ullmann coupling for the synthesis of pirfenidone (5-methyl-1-phenylpyridin-2(1H)-one). A total of 984 different reaction conditions were screened using the automated platform. This approach not only identified the optimal copper/ligand combination but also revealed, through a combination of machine learning and statistical analysis, that oxalamide ligands and short Cu-L interaction distances are key factors contributing to higher yields in the Ullmann coupling for pirfenidone synthesis.

Cite this article

Zaixiang Guo , Yun Zou , Peihao Cheng , Fujun Li , Shengyang Tao . High-Throughput Screening of Ullmann Reaction Conditions and Study of Their Regularity[J]. Chinese Journal of Organic Chemistry, 2026 , 46(3) : 993 -999 . DOI: 10.6023/cjoc202507012

近几十年来, 过渡金属催化的交叉偶联反应通过实现高效和选择性的键形成, 极大地推动了有机合成方法. 其中, Ullmann偶联反应以其多功能性脱颖而出, 它是一种在铜催化下形成C—C和C—杂原子键(例如C—N、C—O和C—S)的方法. 该反应由Ullmann于1901年首次提出[1], 最初通过化学计量的铜粉促使芳基溴化物自偶联生成联苯化合物, 这一发现奠定了Ullmann型反应的基础. 此后, Ullmann、Goldberg和Hurtley等[2-4]对其进行了扩展, 使其能够形成各种C—N、C—O、 C—S和C—C键. 尽管经典的物理有机化学理论已经有了较大发展, 但在应对具体反应时, 仍较难快速确定反应的最优条件和可能的反应机制. Ullmann反应的优化面临多重挑战, 不同反应条件(碱、配体、催化剂和溶剂等)的重要性在不同反应体系中存在差异[5-8]. 其反应优化和机理研究过程中实验工作量需求大, 经常需要长时间反复试错, 实验成本较高.
近年来, 人工智能(AI)正引领化学研究范式的深刻变革[9]. AI工具既能从海量实验数据与物理建模成果构建的数据库中解析构效关系[10], 又能预测分子行为、推动药物发现[11-13], 甚至能结合机器人的执行技术推动有机化合物的自动化合成[14]. 高通量实验(HTE)因其生成数据的巨量性与多样性, 成为人工智能应用于反应发现与优化的重点关注方向. 以高通量实验为代表的自动化技术通过并行筛选海量反应样本, 结合数据分析方法快速锁定最优合成路径, 突破了传统试错法的效率瓶颈[15]. 当前, 这种基于高通量实验、大数据与人工智能深度融合的工作流程[16-17], 使数据驱动的研究模式逐步成为化学研究的重要手段[18-19]. 吡非尼酮(Pirfenidone)的化学名为5-甲基-1-苯基-2-(1H)-吡啶酮, 是一种具有广谱抗纤维化作用的吡啶酮类化合物, 可通过防止和逆转纤维化瘢痕形成, 被用于治疗特发性肺纤维化[20]. 该化合物合成路径的关键步骤是2-吡啶酮的N-芳基化. Ullmann偶联反应是实现该转化的方法之一. 我们选择以2-羟基-5-甲基吡啶与溴苯合成吡非尼酮作为模板反应(Scheme 1), 研究Ullmann偶联反应条件的快速优化与催化机理研究. 之所以选择该反应, 是因为其产物吡非尼酮具有明确的药物应用前景.
图式1 铜催化的Ullmann偶联反应作为模板反应

Scheme 1 Copper-catalyzed Ullmann coupling reaction as a template reaction

本研究通过结合自动化高通量实验与大数据及机器学习技术, 依托其快速筛选优势与高效数据分析能力, 通过自动化高通量筛选确定铜催化的Ullmann偶联反应合成吡非尼酮的最优条件, 并利用筛选过程中产生的数据集训练机器学习模型, 系统探究催化剂-配体组合的构效关系及其对反应产率的影响规律.

1 结果与讨论

1.1 高通量筛选

考虑到初步筛选的数据集大小, 恒定了部分对机理影响较小的反应条件, 包括时间、温度和浓度. 反应条件中的溶剂、碱、催化剂和配体选择优先考虑其商业可用性和Ullmann文献报道中常见的类型的骨架及其衍生物, 设计了一个由4种碱、2种溶剂、8种催化剂和12种配体的多样化条件组合. 采用Unchained Labs自动化高通量筛选实验平台进行实验设计, 在96孔板中进行微摩尔级别的实验. 该设备通过集成温控、加样与监测模块, 并利用机械臂协同调度实现全流程自动化, 即固体/液体加样、孔板转移、温控反应、在线监测和数据记录, 快速完成768组不同条件组合的初步筛选(图1a).
图1 (a)初步筛选的反应产率热图; (b)二次筛选的反应产率热图

Figure 1 (a) Heat map of reaction yields of the primary screening; (b) Heat map of reaction yields of the secondary screening

Reaction conditions: 2-hydroxy-5-methylpyridine (1.0 equiv.), bromobenzene (1.5 equiv.), catalyst (10 mol%), ligand (10 mol%), base (2.0 equiv.) and solvent (0.6 mL), at 140 ℃ for 10 h. The yield of the product was determined by HPLC using 1,3,5-trimethoxybenzene as an internal standard

比较初步筛选中各条件下最高和最低平均产率差异范围(图2), 研究发现该反应的主要影响条件是催化剂和配体. 考虑到实验与药品获取的成本, 将研究重点放在了催化剂和配体组合上, 力求更好地了解催化剂和配体之间对反应性的影响, 并利用这一认识来改善反应性能和通用性.
图2 (a)初步筛选不同配体的平均产率; (b)初步筛选不同催化剂的平均产率; (c)初步筛选不同碱的平均产率; (d)初步筛选不同溶剂的平均产率

Figure 2 (a) Average yields of different ligands in preliminary screening; (b) average yields of different catalysts in preliminary screening; (c) average yields of different bases in preliminary screening; (d) average yields of different solvents in preliminary screening

根据对催化剂与配体的初步筛选结果来看: 催化剂中铜离子为+1, +2价态的卤素铜盐(如CuBr为+1价, CuBr₂为+2价)均有较好产率, 而CuCN整体产率不高. 配合物铜盐在部分条件下有较好产率. 中性配体4,7-二甲氧基-1,10-菲咯啉效果较好, 但同为中性的其他联吡啶骨架和菲咯啉骨架效果一般.
在初步筛选的基础上, 固定新的基础条件碱和溶剂, 并进一步拓展了催化剂与配体的种类. 催化剂中补充了不同价态与种类的铜盐, 配体中继续补充二酮类、苯胺基(氧代)乙酸类和草酰胺类等Ullmann反应文献中常见单阴离子和双阴离子配体的基本骨架及其衍生物, 在768组中的96组基础上补充了216组, 共312组.
通过分析二次筛选的热图数据(图1b)发现, 在其他相同条件下不同催化剂-配体组合对反应产率之间有影响. 对于Ullmann反应, 高效的催化剂-配体组合需要形成稳定的Cu(I)或Cu(Ⅲ)中间体, 促进氧化加成或还原消除步骤. 相同催化剂下草酰胺类配体(如L15、L21、L24、L25、L26)普遍高产(产率高于60%), 而联吡啶类(L1、L7、L8、L9)和膦配体(L2、L4)则表现较差. 高产率配体通常具有双配位点、芳香环结构及给电子基团(甲氧基、羟基、甲基), 配体L11的4,7-二甲氧基菲咯啉刚性结构强化配位能力, 相反, 低产配体多存在空间位阻(如三环己基膦)或电子效应不匹配(如4,4-二甲基联吡啶). 从催化剂角度, 卤素铜盐(CuBr、CuI)整体优于其他铜盐, 其中一价铜盐(CuBr)的催化效果普遍优于二价铜盐(如CuBr₂). 值得注意的是, 草酰胺配体对CuI、CuBr和CuCl等卤素铜盐展现出强适应性, 例如L26与CuI组合产率达90%, 而联吡啶类配体在不同铜盐中均表现较差, 这种差异表明配体取代基的位置/种类(如L19与L26的取代基差异导致31% vs 90%的产率)和催化剂抗衡离子的电子特性共同影响催化循环. 我们认为催化剂-配体组合可能具有一定的共同结构特征(立体结构和电子结构), 从而在所用的条件下提高反应产率.

1.2 结合机器学习的规律性分析

图3a为模型的构建工作流程图, 表示通过单节点决策树模型对二次筛选的312组数据的多项描述符进行分类, 目的是为了探寻催化剂-配体组合与产率之间的重要影响因素. 决策树的分裂规则是在分裂时都会选择能最大限度区分类别的特征(依据如基尼指数/信息增益). 如果某个特征(比如催化剂-配体之间相互作用距离d)能单独很好地区分产率成功(1)和失败(0), 它就会被优先选中. 在本文中该Cu-L相互作用距离d<1.919 Å是由决策树算法自动生成的最优切分点, 即当描述符为Cu-L相互作用距离d<1.919 Å时, 能较好将数据集分为成功与不成功两类. 分类结果和散点图表明(图3b), 目前数据集较有效地将催化剂-配体组合分为两组(草酰胺类和非草酰胺类). 在237组反应中, 共有107组采用草酰胺类配体(占237组的45%). 当Cu-L相互作用距离d<1.919 Å时, 共有79组反应. 其中70组(占79组的89%)属于草酰胺类配体. 此外, 产率超过60%的反应共有25组(占79组的32%), 均采用草酰胺配体.
图3 (a)决策树分类模型及其将Ullmann C-N偶联的催化剂-配体组合分类为开启或关闭反应性的准确性; (b)使用Cu-L计算的相互作用距离(d)分析数据

Figure 3 (a) Decision tree classification model and its accuracy in classifying catalyst-ligand combinations as “on” or “off” reactive states in the Ullmann C-N coupling reaction; (b) correlation between reaction yield and the Cu-L interaction distance (d)

Red dots represent oxamide ligands, black dots represent non-oxamide ligands. The vertical dashed lines indicate the 60% yield threshold distinguishing “on/off” reactivity and the calculated d threshold of 1.919 Å, highlighting the significance of d in determining reaction yield

催化剂-配体之间相互作用距离d与Cu-L复合物在反应中的稳定性密切相关, 表明Cu-L复合物在催化循环中的稳定性可能影响其进入催化循环的能力或其进行氧化还原的能力[21], 这是Ullmann偶联反应中的关键步骤. 实验数据显示, 当Cu-L相互作用距离d<1.919 Å时, 高产率(>60%)的反应集中在这一范围, 尤其是采用草酰胺类配体的反应, 这一结果表明, Cu-L复合物的稳定性可能影响是催化反应的重要因素.
我们猜测草酰胺类配体具有特定的结构特征, 使之有更强的配位能力或更合适的空间构型, 从而优化Cu-L相互作用, 使其能够与铜中心形成更稳定的复合物. 对于非草酰胺类配体, 由于无法与铜中心形成足够稳定的复合物, 导致产率降低.

1.3 统计分析

Shapiro-Wilk检验显示产率数据显著偏离正态分布(p<0.05). 鉴于非正态特性, 优先采用Mann-Whitney U检验, 但鉴于样本量较大, t检验结果仍可作为参考. 分组分析表明: 草酰胺配体组的平均产率(42.45%)显著高于非草酰胺组(25.08%), 而短距离组产率(43.43%)亦显著优于长距离组(27.69%). 两类检验均支持组间差异的显著性(t检验: t=6.686/5.153, p<0.05; Mann-Whitney U检验: U=10311/8588, p<0.05). 相关性分析显示, d与产率呈负相关(Pearson r=-0.150, p<0.05; Spearman r=-0.224, p<0.01), 表明随距离缩短可提高产率. 效应量分析(Cohen’s d: 配体类型d=0.89, 距离分组d= 0.79)表明, 组间差异不仅具有统计学意义, 更达到Cohen准则定义的大效应量(d≥0.8), 表明草酰胺配体的产率优势具有实际意义.
数据可视化结果进一步支持上述结论: (1)分位数-分位数图(Q-Q图)(图4b)显示数据点显著偏离对角线(尤其中间区域及高产率区), 结合分布直方图(图4a), 共同验证产率的非正态性; (2)箱线图显示草酰胺组及短距离组的产率中位数、四分位数范围均更高, 且离群值(图4c)分布表明其他潜在因素(如底物结构、温度等)可能影响产率. 上述结果表明: 草酰胺配体与较短的Cu-L相互作用距离(d<1.919 Å)是提高Ullmann反应产率的重要因素.
图4 (a)产率的分布直方图; (b)产率的正态Q-Q图, 红线对角线为正态参照线; (c)配体类型对产率的影响, 对于草酰胺和非草酰胺两类配体的产率分布; (d) Cu-L相互作用距离(d值)对产率的影响, 对于d<1.919 Å和d≥1.919 Å两类组合的产率分布

Figure 4 (a) Distribution histogram of yield; (b) normal Q-Q plot of yields, the red diagonal line is the normal reference line; (c) the effect of ligand type on yield, the yield distribution of oxamide and non-oxamide ligands; (d) the effect of Cu-L interaction distance (d value) on yield, the yield distribution of the two combinations of d<1.919 Å and d≥1.919 Å

2 结论

总的来说, 本研究通过自动化高通量筛选设备, 筛选共984组不同的Ullmann反应条件下的吡非尼酮的合成, 确定了最佳的催化剂-配体组合(CuI与L26组合产率达90%). 通过决策树算法确定Cu-L相互作用距离d是该反应的重要描述符, 并结合统计分析, 进一步验证草酰胺配体与短Cu-L相互作用距离(d<1.919 Å)是提高Ullmann偶联合成吡非尼酮中产率的重要影响因素.

3 实验部分

3.1 仪器与试剂

Unchained Labs自动化高通量筛选平台, 高通量实验反应器(96孔, 配1.2 mL玻璃瓶), 岛津SHIMADZU LC-20A高效液相色谱仪(配Hypersil ODs 25 μm ID 4.6 mm×250 mm色谱柱), Bruker AVANCE NEO 600M核磁共振波谱仪. 除非另有说明, 所有原料、试剂及溶剂均购自 Adamas、麦克林及阿拉丁公司, 直接使用.

3.2 实验方法

3.2.1 高通量实验筛选

采用Unchained Labs平台, 依次向装有磁力搅拌子的1.2 mL玻璃瓶中加入2-羟基-5-甲基吡啶(6.5 mg, 0.06 mmol, 1.0 equiv.)、碱(2.0 equiv.)、催化剂(10 mol%)、配体(10 mol%)、溶剂(0.1 mol/L)、溴苯(10 μL, 0.09 mmol, 1.5 equiv.), 在充氮气手套箱封装, 在140 ℃和400 r/min条件下搅拌反应10 h. 冷却至室温, 加入1,3,5-三甲氧基苯内标(0.1 mol/L甲醇溶液), 用甲醇进一步稀释, 通过高效液相色谱(HPLC)进行分析, 测定产率. HPLC采用溶剂甲醇/水(VV=7∶3)持续21 min, 流速为1.0 mL/min, 柱箱温度30℃, 检测器为254 nm.

3.2.2 建模算法考虑

为了探寻催化剂-配体组合与产率之间的相互关系, 模型构建工作流程见图3a. 二次筛选优化的高产率结果具有一定的共同结构特征, 从而在所用的条件下提高反应产率.
决策树是一类非线性算法, 所建模的反应输出与所用描述符之间的关系不需要假设为线性关系. 根据数据集提供的描述符, 将数据递归划分为节点, 以提高节点的纯度. 当训练集数据集的产率分布区间输出范围广泛时, 可作为合适的分析工具. 该算法最简单的形式只涉及一个节点(反应阈值), 可用于阐明关键数据结构. 排除了Cu(MeCN)₄BF4、Cu(MeCN)₄PF6及清洗部分数据缺失后进行计算, 主要是考虑到收敛性问题: 含四个MeCN配体的体系需更大基组和更高理论级别(如考虑色散校正的DFT-D3), 显著增加计算成本.
将清洗后的第二次筛选数据集(237组), 以产率为60%(高产率)作为阈值进行拆分. 构建一个由计算得出的描述符集. 将催化剂与配体的配合物结构进行密度泛函理论优化, 计算在[B3LYP/6-31G*]级别(level)下进行. 从这些优化结构中提取分子描述符, 用于统计建模, 包括立体结构特征(例如埋藏体积百分比, VBur%)、局部电子特征(例如NBO电荷)和立体结构和电子特征共同影响因素(催化剂-配体之间相互作用距离d). 将这些实验数据点与相对应的计算参数结果匹配, 作为数据集(训练∶测试=7∶3).

3.2.3 统计分析部分

为了更严谨地验证Cu-L相互作用距离与反应产率的关系, 基于237组实验数据, 通过Python进行分组统计分析. 根据配体类型及Cu-L相互作用距离(d)将数据划分为草酰胺与非草酰胺配体组、短距离组(d<1.919 Å)与长距离组(d≥1.919 Å), 分别计算产率的均值、标准差及95%置信区间, 并进行显著性检验与相关性分析. 显著性检验采用t检验和Mann-Whitney U检验, 用于评估组间差异的统计学显著性; 相关性分析则通过Pearson相关系数(衡量线性关系)和Spearman相关系数(评估非线性趋势)量化d与产率的关联性. 此外, 通过Q-Q图及箱线图可视化数据分布特征.
辅助材料(Supporting Information) 提供了筛选结果、数据集和相关代码. 这些材料可以免费从本刊网站(http://sioc-journal.cn/)上下载.
(Lu, Y.)
[1]
Ullmann, F.; Bielecki, J. Ber. Dtsch. Chem. Ges. 1901, 34, 2174.

DOI

[2]
Ullmann, F. Ber. Dtsch. Chem. Ges. 1903, 36, 2382.

DOI

[3]
Goldberg, I. Ber. Dtsch. Chem. Ges. 1906, 39, 1691.

DOI

[4]
Hurtley, W. R. H. J. Chem. Soc. 1929, 1870.

[5]
Yang, Q.; Zhao, Y.; Ma, D. Org. Process Res. Dev. 2022, 26, 1690.

DOI

[6]
Dai, L.-X. Prog. Chem. 2018, 30, 1257 (in Chinese).

(戴立信, 化学进展, 2018, 30, 1257.)

DOI

[7]
Sambiagio, C.; Marsden, S. P.; Blacker, A. J.; McGowan, P. C. Chem. Soc. Rev. 2014, 43, 3525.

DOI PMID

[8]
Bhunia, S.; Pawar, G. G.; Kumar, S. V.; Jiang, Y.; Ma, D. Angew. Chem. Int. Ed. 2017, 56, 16136.

DOI

[9]
Emmert-Streib, F. Mach. Learn. Knowl. Extr. 2021, 284.

[10]
Nandy, A.; Duan, C.; Taylor, M. G.; Liu, F.; Steeves, A. H.; Kulik, H. J. Chem. Rev. 2021, 121, 9927.

DOI

[11]
Xiong, J.; Zhang, W.; Wang, Y.; Huang, J.; Shi, Y.; Xu, M.; Li, M.; Fu, Z.; Kong, X.; Wang, Y.; Xiong, Z.; Zheng, M. Nat. Mach. Intell. 2025.

[12]
Wang, J.; Qin, R.; Wang, M.; Fang, M.; Zhang, Y.; Zhu, Y.; Su, Q.; Gou, Q.; Shen, C.; Zhang, O.; Wu, Z.; Jiang, D.; Zhang, X.; Zhao, H.; Ge, J.; Wu, Z.; Kang, Y.; Hsieh, C.-Y.; Hou, T. Nat. Commun. 2025, 16, 4416.

DOI

[13]
Sheikholeslami, M.; Mazrouei, N.; Gheisari, Y.; Fasihi, A.; Irajpour, M.; Motahharynia, A. Sci. Rep. 2025, 15, 13445.

DOI

[14]
Coley, C. W.; Thomas, D. A.; Lummiss, J. A. M.; Jaworski, J. N.; Breen, C. P.; Schultz, V.; Hart, T.; Fishman, J. S.; Rogers, L.; Gao, H.; Hicklin, R. W.; Plehiers, P. P.; Byington, J.; Piotti, J. S.; Green, W. H.; Hart, A. J.; Jamison, T. F.; Jensen, K. F. Science 2019, 365, eaax1566.

DOI

[15]
Goldfogel, M. J.; Guo, X.; Meléndez Matos, J. L.; Gurak, J. A., Jr.; Joannou, M. V.; Moffat, W. B.; Simmons, E. M.; Wisniewski, S. R. Org. Process Res. Dev. 2022, 26, 785.

DOI

[16]
Matthews, A. D.; Peters, E.; Debenham, J. S.; Gao, Q.; Nyamiaka, M. D.; Pan, J.; Zhang, L.-K.; Dreher, S. D.; Krska, S. W.; Sigman, M. S.; Uehling, M. R. ACS Catal. 2023, 13, 16195.

DOI

[17]
Xu, L.; Zhu, J.; Shen, X.; Chai, J.; Shi, L.; Wu, B.; Li, W.; Ma, D. Angew. Chem. Int. Ed. 2024, 63, e202412552.

DOI

[18]
Williams, W. L.; Zeng, L.; Gensch, T.; Sigman, M. S.; Doyle, A. G.; Anslyn, E. V. ACS Cent. Sci. 2021, 7, 1622.

DOI

[19]
Benavides-Hernández, J.; Dumeignil, F. ACS Catal. 2024, 14, 11749.

DOI

[20]
Richeldi, L.; Yasothan, U.; Kirkpatrick, P. Nat. Rev. Drug Discov. 2011, 10, 489.

DOI PMID

[21]
Samha, M. H.; Karas, L. J.; Vogt, D. B.; Odogwu, E. C.; Elward, J.; Crawford, J. M.; Steves, J. E.; Sigman, M. S. Sci. Adv. 2024, 10, eadn3478.

DOI

Outlines

/