深度文章
信息来源:mixtureofexperts.co 2026.08.26 04:10 约 13 分钟 商业洞察 新发布

美国在下一个化学合成黄金时代中的作用

这仍是我在学习中的内容。我对这方面的了解还处于初期阶段,因此可以将其视为对近期与该领域一些专家的对话,以及我所阅读和听取的相关内容的总结。

20 世纪中叶是化学领域最为成果丰硕的时期之一。哈伯-博施工艺已通过合成肥料开始改变农业面貌;杜邦公司则发明了尼龙。在医学领域,这一时期诞生了首批合成抗菌药——磺胺类药物,以及为现代精神药理学发展奠定基础的氯丙嗪。在“天然产物合成黄金时代”,有机化学家们逐渐掌握了构建更多复杂天然分子的技术,包括生物碱、类固醇、维生素和抗生素等。伍德沃德与科里将合成方法转变为一门系统化的规划学科。事实上,科里对逆向合成分析的规范化研究,正是许多人工智能路线规划工具的基石。

如今,化学依然推动着世界上许多重大的突破。材料化学让我们拥有了锂离子电池;在现代硬件与医药领域中,化学也无处不在——无论是半导体制造、高性能聚合物,还是用于缝合线、导管及植入物的材料,都离不开化学的作用。在 COVID-19 mRNA 疫苗的研发中,化学同样起着关键作用:脂质纳米颗粒能够保护脆弱的 mRNA,并帮助其进入细胞。

大多数已获批的药物同样依赖于合成化学与药物化学。GLP-1 类药物的兴起就是一个很好的例子:这类药物的第一代产品是以多肽为基础的,但目前的重点则是开发可口服的小分子药片。KRAS G12C 抑制剂则是另一个例子,它证明了长期以来被认为“无法用于制药”的、作为肿瘤生长驱动因子的 RAS 蛋白其实也可以成为治疗靶点。

但化学领域的突破绝非易事。在药物研发过程中,大约 90%的项目最终都会失败。大型制药公司能够承受这样的失败率,而大多数企业则无法做到。与此同时,大量的化学合成及定制合成生产能力已经转移到了海外,尤其是中国和东欧地区;乌克兰战争更是凸显了这一脆弱性。其背后的原因其实与美国工业空心化的整体趋势如出一辙。合成化学相对容易从其他研发领域中分离出来,随着时间推移,制药公司逐渐将那些他们认为最具价值的工作(如知识产权、靶点发现以及产品商业化)留给自己,而将更多的合成与制造工作外包给那些劳动力成本更低、拥有优秀科学人才,且至少从历史上看环境与监管要求较为宽松的地区。

这使得美国的化学合成与制造体系变得十分脆弱,尤其是在小分子药物领域。好消息是,人工智能有望通过开辟新的化学空间来加速化学研究进程。目前的模型已经足够成熟,能够提出有潜力的候选分子,但仍然缺乏必要的数据,尤其是反应失败记录以及合成/检测结果。而合成正是获取这些缺失数据的途径,正因如此,美国的合成能力才具有战略意义。

在开始之前需要说明的是,本文主要探讨小分子药物发现领域的应用,因为这是最典型的例子;不过在材料科学、催化领域以及能源化学中,同样存在着设计-制造-测试这一瓶颈问题。

为何蛋白质 AI 率先发展

我们在蛋白质工程和抗体设计领域已经见识过这种发展趋势。全新蛋白质模型的出现将人类在蛋白质设计中所做的手工工作与实验操作简化为推理过程,从而打开了原本无法用于药物开发的靶点以及新的生物制剂开发途径。AlphaFold 2 使得人们能够可靠地预测蛋白质的 3D 结构;而 RFdiffusion 与 ProteinMPNN 则允许人们通过勾勒出目标蛋白质的形状来设计新的蛋白质,再寻找能够形成该结构的氨基酸序列。2025 年,Baker 实验室发表了关于全新丝氨酸水解酶设计的成果;研究人员还利用人工智能从零开始设计抗体。Nabla 团队则报告了针对 GPCR 和肽-MHC 复合物这两种难以攻克的靶点的全新抗体设计成果,这些进展为开发更具个性化特征的生物制剂奠定了基础。

有两点使得这成为可能:

  1. 实验循环速度极快:研究人员可在一轮实验中合成并筛选数千种蛋白质变体,因此即便最初的成功率较低,也能获得有用的反馈。
  2. 相关数据其实早已存在:蛋白质数据银行中存储着数十年来已解析的分子结构数据,而序列数据的数量更是结构数据的多倍。

合成化学则有所不同。例如,小分子药物需要复杂的多步骤合成路线,而优化这些路线时必须权衡合成复杂性与难以预测的药剂学特性之间的矛盾。换句话说,模型虽然可以提出某种结构,但该结构仍需实际制造并经过测试。合成化学更难被建模、更难进行搜索,也更难从中学习经验,正因如此它的发展速度一直落后于蛋白质工程。

为何化学是下一个领域

结构预测已进入原子级精度时代。

如今的模型能够模拟所有类型分子之间的相互作用,包括蛋白质、配体、水、离子以及对生物功能至关重要的其他分子。

AlphaFold 3 将结构预测的范围从单纯的蛋白质扩展到了与其它辅因子结合的蛋白质,包括小分子。Boltz-1 和 Chai-1 则将类似的功能引入了更易使用的工具中。与此同时,计算化学与材料科学也在发展出属于自己的通用模型。诸如 MACE-MP-0 和 MatterSim 这样的机器学习型原子间势能模型,能够以比传统方法更快、更低的成本模拟各种分子和材料中的原子相互作用。

高级特性方面的进展。

我们正在从分子结构层面进一步探索对药物设计至关重要的其他特性,比如结合亲和力、合成可行性、开发潜力、代谢情况以及毒性。

Boltz-2 增加了结合亲和力预测功能。BoltzMol-1 则通过将基于模型的排序方法与溶解度、脂溶性及渗透性等性质筛选机制相结合,进一步将其应用于小分子候选药物的发现。Axiom 也在采用类似的性质预测方法来评估毒性。

推理模型非常适合用于化学领域。

具备工具使用能力的智能体模型非常适合用于多步骤优化,而化学本质上就是一种推理问题。正如蛋白质语言模型通过将蛋白质视为序列而受益一样,化学智能体或许也能通过将合成任务视为逐步推理的问题来获得优势。

在药物化学中,任何结构上的变化都可能影响药物的效力、选择性、溶解度、代谢情况、毒性以及合成难度。化学家们必须逐一分析这些相互之间的权衡关系,而人工智能则能够帮助他们以更快的速度和更大的规模进行探索。

美国在下一个化学合成黄金时代中的作用
ChemCrow 将 LLM 与化学领域的专用工具以及机器人合成系统相连接。该系统能够对各项任务进行逻辑分析,挑选出如逆向合成或反应流程预测之类的合适工具,并通过相连的实验室平台来执行实验。来源.

ChemCrow 展示了 LLM 智能体如何将推理能力与化学领域专用工具相结合,从而提升性能并带来新的功能。而 ChemIQ 这类新的评估标准则体现了推理模型在处理化学问题方面的能力正不断提升。

数据依然缺失。

尽管化学领域正以新的方式展现出可建模的特性,但我们目前仍缺乏足够的数据。

合成化学的设计空间极为广阔。据估计,具有药物特性的化合物数量可能高达 10^60 种。即便采用更为保守的估算,数量依然巨大:仅包含原子数不超过 17 的有机小分子的 GDB-17,其化合物数量就有 1660 亿种。目前可检索的化合物库规模最大者也仅有 8.3 万亿种。作为对比,收录了各类分子及其生物活性的公共数据库 ChEMBL 37,其中不同的化合物种类仅有约 1001.29 百万种。

在合成方面,问题更为严峻,因为小分子药物的合成路线相关数据在很大程度上取决于药物发现工作的成败。这些知识大多属于隐性信息,从未被公开披露,那些失败的反应也极少被记录下来,因此仅通过检索现有文献是无法获取这些信息的。2022 年有一篇论文探讨了失败实验的重要性,指出报告偏差会扭曲反应模型,并认为负面结果属于最宝贵的缺失数据之一。开放反应数据库便是旨在改变这一状况的举措之一。

美国在下一个化学合成黄金时代中的作用
开放反应数据库中的反应产率分布情况。橙色柱状图代表从美国专利局获取的专利数据,这类数据明显偏向于高产率的反应。换言之,专利文献中大多记载的是那些成功的反应。蓝色柱状图则显示经过筛选的非美国专利局数据,其中很多来自高通量实验,包含了大量失败或低产率的反应。资料来源.

而药物化学领域的问题更为棘手。我们现有的数据严重偏向于特定的药物靶点以及已被探索过的化学空间区域。不幸的是,这些研究过程中所做的决策在专利文献中很少被记载,而且往往只关注那些能够通过合成、结合实验以及期刊发表筛选的分子。一些公司正试图通过直接生成新数据来填补这一空白。例如 Leash 公司就通过让数百万种化合物与数百种蛋白质进行测试,来收集大规模的结合数据。但即便如此,这些努力仍受到合成条件的限制。

如果希望生成式人工智能能够用于发现新的药物、材料、催化剂以及工业化学品,我们就需要更丰富的数据,以便了解哪些物质可以制造、哪些无法制造、哪些试验失败了以及失败的原因。

合成技术能够生成数据

这些数据必须来自那些真正用于合成新分子的系统。这些系统需要记录所发生的一切,并将这些结果反馈给模型。换言之,合成过程将为学习循环奠定基础。

因此,下一代化学基础设施需要三样东西。

  1. 更低的合成成本:通过新型化学技术与自动化手段降低费用。模型的性能会随着数据的增加而提升,而每个分子的成本则决定了我们能够生成多少数据。

  2. 更广泛的合成方式:通过多步骤反应探索新的化学可能性。模型需要能够接触到那些超出现有骨架范围的化学物质,因为目前大多数化合物库中的分子都基于这类骨架构成。其目标在于制造出不同的分子,而不仅仅是增加分子的数量。

  3. 更快的周转速度:代理学习能够获得更及时的反馈。一个需要数月时间才能完成单个分子的设计、制备、测试及学习过程的系统,无法为模型提供足够的反馈,使其快速提升性能。

要同时实现这三点,就需要采用智能体集成技术,也就是闭环学习系统。合成平台本身必须成为该学习系统的一部分,从而能够负责规划合成路径、执行反应、记录失败情况、分析结果,并决定下一步应尝试的替代路径。

这一基础设施的各个组成部分已经开始出现。Chemify、Onepot、B12、Lila 以及 Biosero 都在努力将路线规划、反应执行、纯化、分析以及数据收集整合为一个统一的“制造-测试-学习”系统。Periodic Labs、CuspAI 和 Radical AI 也在材料领域开展类似的工作,而其中的难点在于如何将模型与能够进行合成并不断优化这些模型的实验室联系起来。

美国在下一个化学合成黄金时代中的作用
化学领域的设计-制造-测试-学习循环。在 AlphaFlow 这一自动化实验室系统中,它会执行实验,将数据反馈给学习模块,并利用这些反馈来决定下一步该进行哪些实验。来源.

学术研究也显示了具备闭环系统的自主实验室所带来的优势。例如,在与实际实验进行直接对比时,贝叶斯优化在效率与一致性方面都优于专业化学家。由阿姆斯特丹大学蒂莫西·诺埃尔领导的团队开发出了 RoboChem,该系统每周能够优化 1001 至 20 种不同分子的合成过程。另一款名为 AlphaFlow 的自主流体实验室则找到了一种包含 40 个参数的多步骤合成路径,其效果优于传统合成方法。

这些案例共同表明,化学正逐渐变得可编程。但只有当它与物理世界相连接时,这一特性才有意义。对美国而言,这意味着合成能力已上升为战略基础设施。

美国无法租用这样的未来

那种能够将可编程化学与物理世界相连的基础设施必须在美国建立。

合成能力将日益具备战略重要性。谁能掌控更高效的分子制造流程,谁就能在药物研发、材料科学、农业、能源以及国防领域占据优势。目前,在制造业和稀土产业等其他实体经济领域,我们也已经看到了这一趋势的体现。

美国的制药与生物技术供应链在很大程度上依赖于中国。根据 2026 年的一份 CFR 报告,“中国不仅拥有相关手段,还表现出将美国对药品的依赖转化为攻击工具的意愿——其具备在药品供应链的几乎各个环节实施控制的结构性条件。”新兴生物技术安全委员会也警告称,中国在生物技术领域的发展势头十分强劲,“采取行动的窗口期正在逐渐关闭”。与此同时,中国的生物医药产业正逐渐成为全球专利许可业务的重要来源地,2025 年中国的专利许可交易量已占到该年度总交易量的 80%。

华盛顿方面已经开始采取行动。2025 年 12 月,《BIOSECURE 法案》正式生效。该法案确立了明确的流程,用于判定哪些生物技术供应商构成国家安全威胁,并将其排除在联邦合同与资助之外。2026 年 6 月,五角大楼将药明康德列入其 1260H 条款规定的“中国军事企业”名单中。药明康德是一家中国的合同研发生产组织,其化学业务部门在 2024 年承接了 1,187 个新的小分子药物项目;即便面临各种限制,其在美国的业务营收仍增长了 32%。美国国防部被禁止与这些企业直接开展合作。从 2027 年 6 月开始,这一限制也将适用于那些依赖这些技术成果的国防部合同,包括那些将吴希亚科作为供应商的美国企业。吴希亚科正在起诉要求被移出该名单,但目前尚未有裁决。此外,2026 年 7 月,232 条款关税正式实施,对中国和印度等国的专利药品、其活性成分以及关键起始材料征收 100%的关税。

在商业层面,各企业也纷纷采取行动。礼来公司已投入 270 亿美元用于美国本土的制造业建设;诺华则投入 230 亿美元以扩大其在美国的制造与研发规模。

下一个黄金时代

生成式人工智能将带来海量创新理念。而真正的瓶颈在于如何将这些理念转化为分子,再将分子转化为数据,最后把数据转化为更优的模型。

这一循环必须在这里建立起来。美国对外国,尤其是中国的依赖,已不再仅仅是成本或研发周期方面的不便,它正逐渐演变成一种国家安全威胁。如果继续将药物发现的基础工作外包,美国就无法在借助人工智能进行分子发现领域保持领先地位。

因此,在美国建立基于人工智能的合成能力是未来十年最重要的机遇之一。人工智能与机器人技术能够改变合成领域的经济模式,提升国内化学产业的竞争力。例如,较小的团队也能进行更多实验,从而获得更多数据,并实现比传统实验室工作流程更快的反馈循环。

私营企业应当承担这些基础设施的建设工作,而政府则应为其创造便利条件。政府可通过资助那些具有前瞻性的基础设施、通过采购来创造需求、为国内制造业提供信贷支持与贷款担保,以及制定数据标准,从而让失败的实验也能转化为有用的训练数据,来实现这一目标。

要重新建立对试剂、前体、溶剂、活性药物成分以及特种化学品的获取渠道,仅靠软件和机器人技术是不够的,可能需要十余年的时间。正因如此,美国必须立刻行动起来。合成化学的上一个黄金时代为我们带来了化肥、聚合物、抗生素、合成药物,以及现代生活所需的诸多工业基础;下一个黄金时代所带来的成果或许会更加巨大。

特别感谢 Dylan Reid、高文豪、Geoffrey Smith 和 Paul Gamble,他们在协助梳理本文中的诸多观点以及审阅文章稿件方面给予了极大帮助。

作者注:仅使用 LLM 进行轻度文字编辑(拼写、语法及清晰度)。内容、含义、语气和结构均未改变。

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读