跳到正文
北京时间
原文
Anthropic:Research(发表成果 · 网页)·· 2026-06-05精选AI 评分65

Anthropic:让Claude成为化学家

Making Claude a chemist

AI 导读

Anthropic与顶尖化学家合作,提升Claude在化学领域的实用性。首个白皮书测试Claude在NMR谱图分析上的表现:在20个化合物上,对比Claude Opus 4.7、Opus 4.6、Sonnet 4.6与ChemDraw、MestReNova的正向预测(从结构预测谱图)和反向结构解析(从实验谱图推断结构)能力。所有化合物选自模型训练截止日期后发布的ChemRxiv预印本,以避免选择偏差。

推荐理由

化学家可能几年后回头看会记起这篇,Claude Opus 4.7 在 NMR 预测上追平了 ChemDraw,还顺手做了反向结构解析——专业软件不干的事,它用更接近人类日常输入的方式做到了。

正文 · AI 翻译

Making Claude a chemist

我们正与世界一流的合成化学家、计算化学家和分析化学家合作,让 Claude 在化学领域表现得更出色。在这篇文章中,我们分享这项工作的首批成果——Anthropic 的化学家 David Kamber 考察了 Claude 在化学家最常用的分析输入——NMR 谱图上的表现。

在处理分子时,化学家需要在白板上的手绘结构式、仪器读数、数据库查询字符串以及专利和出版物中的技术符号之间来回切换。这些表示形式编码的是同一套底层化学信息,但每一种都要求不同类型的熟练度。例如,咖啡因的草图能让化学家看出它与腺苷(人体的困倦信号)的相似之处,并预测它通过阻断受体让我们保持清醒。然而,同一张草图却无法帮助化学家将它与其他外观几乎相同的分子区分开来。

理解化学家正在处理的是什么分子至关重要。化学支撑着从我们摄入的食物和药物,到我们的乳液、油漆和塑料的一切。在相同原子之间改变几个键的连接方式,葡萄糖就变成了果糖——分子式相同,但经由完全不同的代谢途径处理。把一个分子翻转成它的镜像,镇静剂就变成了致畸剂,正如沙利度胺灾难中所发生的那样。1化学家的日常工作依赖于在适合特定任务的任何一种表示形式中正确解读这些信号。

在这些表示形式之间进行转换(从一张图中追溯某个结构、将仪器读数与拟议产物进行核对、以正确的记法查询数据库)既耗时,又无法在规模化的情况下跟上进度——CAS 是最大的化学物质登记库,收录了超过 2.9 亿种已公开披露的物质,并且每天新增约 15,000 种。

AI 完全有能力承担这一研究负担,但在化学领域,它目前仍在很大程度上停留在愿景层面。多年来,机器学习工具一直被定位为能对逆合成——即从目标分子反向推导至更简单前体,以规划如何构建该分子的过程——反应预测和性质估计带来变革,但这些工具所需的数据却一直难以获取——关于零结果的数据稀疏、格式不一致,并且被锁在订阅制期刊的付费墙之后(以及非结构化的支持信息中)。逆合成就是一个典型例子——有能力的 AI 工具已存在多年,但采用情况参差不齐,普通的学术化学家或小型实验室化学家仍然不使用它们。

即便如此,AI 的进步终于开始触及化学领域。如今的前沿模型是多模态的,并且具备显式推理能力。它们可以直接从期刊插图或手绘草图中读取化学结构,而不必依赖预先整理好的分子数据库。它们还能以实验方法部分或支持信息实际发表时的形式来读取其中的实验细节。它们还可以逐步展示自己的推理过程,这意味着化学家可以审查其输出。这一切都没有消除该领域多年来一直描述的数据问题,但它改变了哪些问题尽管存在这一障碍仍然可以被解决。

最终,我们的主张是谦逊的:Claude 正开始切实地帮助化学家完成日常的转化、回忆和整合工作,以补充他们的判断,而我们计划继续扩展它的助益。今天我们发布首份白皮书,以推动这项工作加速进行。它针对的是化学家最常见的分析输入:NMR 谱图。

Claude 与 ChemDraw 在 NMR 预测和结构解析上的对比


完整版本可在此处查看here

几乎每一个小分子——药物、农药、染料、香料、聚合物、DNA 或蛋白质亚基,以及功能性无机或固态材料——之所以存在,都是因为某位化学家确定了它的结构。鉴于这些分子无法用显微镜看到,化学家必须依赖光谱分析,用光、无线电波或磁场来探测分子。给定分子吸收、发射或偏折这些能量的方式,为化学家提供了一种图案,即光谱,借此他们可以阐明其结构。

NMR 光谱学——化学家在这方面所依赖的经典技术之一——是合成化学中最耗时的步骤之一;对于每一种化合物,化学家都必须手动将光谱中的每一个峰与所提出结构中的某个原子对应起来。在这份白皮书中,我们测试了 Claude 与化学家如今所依赖的专用 NMR 软件相比表现如何。我们让三个 Claude 模型(Opus 4.7、Opus 4.6、Sonnet 4.6)与 ChemDraw 和 MestReNova 在 20 种化合物上进行了对比,这些化合物取自模型训练截止日期之后发表的合成化学预印本,以避免选择偏差。ChemDraw 和 MestReNova 都做正向预测,即用绘制的结构来模拟将会产生怎样的 NMR 光谱。除了正向预测,我们还想看看 Claude 能否反过来——从实验光谱出发,提出其背后的结构。这是更难的任务,也是现有软件目前留给化学家去做的任务。

为了设置我们的评估,我们从模型训练截止日期之后发布的 ChemRxiv 预印本2中提取了 20 种化合物,取每篇论文中第一个被完整表征的新颖分子。这 20 种化合物横跨四个结构家族,每个家族五种化合物,每个家族之所以被选中,是因为它涉及不同类别的 NMR 挑战。每个工具都获得了以 SMILES 字符串编码的结构——这是化学家用来将分子输入软件的文本行记法——并被要求预测每个氢和碳峰在 1D NMR 谱(横轴以 ppm,即百万分之一为单位测量化学位移)上的位置。鉴于 NMR 样品溶解在液体中,且溶剂的选择(氯仿、DMSO 等)会使峰位置略有移动,每个工具都被要求按照化学家在已发表论文中所使用的溶剂来预测谱图。

A graph of the four scaffold classes
图 1. 正向预测评估所涵盖的四类骨架。每一类都探查不同类别的 NMR 挑战。P1 氯代哒嗪在 DMSO-d₆ 中具有氨基哒嗪上的慢交换 NH;P2 Boc-N-芳基马来酰亚胺和 N-Boc 炔酰胺考察 α-乙烯基-酰亚胺羰基以及罕见的炔酰胺 α/β-碳对;P3 螺酮是带有苯甲酰基或乙酰基侧链以及非对映异位 CH₂ 的螺双环酮;P4 α-硅基甲磺酰胺具有被屏蔽的硅-α 碳。每类五个化合物,总计 n = 20。

由于语言模型的输出在多次运行之间会有所变化,每个 Claude 模型对每个化合物查询三次并取平均值;ChemDraw 和 MestReNova 每次返回相同答案,因此只运行一次。随后我们将每个预测峰与其实验对应峰配对,并测量以 ppm 计的差距。这些差距落在化学家会认为正确的窗口内——氢为 ±0.20 ppm,碳为 ±1.0 ppm。

A graphic depicting the per-tool MAE/RMSE summary across 20 compounds
图 2. 在 20 种化合物上,正向预测的 ¹H(左)和 ¹³C(右)化学位移误差的逐工具 MAE(深色)和 RMSE(浅色),每个工具下方显示覆盖率。Claude 柱状图:三次重复实验的均值,附最小–最大范围和叠加的重复实验数据点。经典工具:单点预测(无范围)。

在氢谱上,Opus 4.7 最为准确,平均误差为 ±0.079 ppm——远低于容差窗口的一半——且落在窗口内的峰占比最高。在碳谱上,Opus 4.7 与 MestReNova 实际上不相上下,分别为 ±1.37 和 ±1.48 ppm;其余工具在两种元素上均保持相同的排名顺序。Opus 4.6 不出所料处于中游,Sonnet 4.6 则最弱。两者之间的差距在一个出了名难处理的氢上体现得最为明显——氯哒嗪类化合物中的一个 NH 质子,其真实位置落在 6.8 至 7.9 ppm 之间的一个狭窄区间内。Opus 4.7 将其预测得略偏低,但始终如一;Opus 4.6 的猜测分散在好几个 ppm 上;Sonnet 4.6 则将其放在 10–13 的范围内,远远偏离其实际出现的位置。

A chart depicting within-tolerance accuracy per compound
图 3. 上:落在 ±0.20 ppm(¹H,左)和 ±1.0 ppm(¹³C,右)范围内的实验原子百分比。下:逐化合物胜率(在 20 种化合物中,该工具逐化合物 MAE 最低的化合物数量)。Claude 柱状图:三次重复实验的均值,附最小–最大范围;经典工具:单点预测。

虽然 Opus 4.7 的表现与 ChemDraw 和 MestReNova 大致相当,但在预测氢 NMR 峰的形状以及峰与峰之间的间距方面,差距更大——这些特征同样包含化学家在读取化学位移之外还会参考的结构信息。Opus 4.7 比任何其他工具都更频繁地匹配实验报道的裂分模式,而且三个 Claude 模型在大约 80% 的情况下将亚峰间距预测到半赫兹以内——相比之下,ChemDraw 和 MestReNova 仅为 26% 到 35%。Opus 4.7 在三次重复运行中也最为一致:其平均误差在多次运行之间的波动,小于它与次优工具之间的差距。

在此基础上,我们评估了逆向预测(结构解析):我们能否从谱图中确定分子的结构?我们给 Opus 4.7 出了 15 道结构解析题,每道题要求它做三次,每次提出最多三个按排序排列的候选结构。每道题都提供了化合物的精确分子式(来自高分辨率质谱)以及其氢和碳 NMR 谱图。这十五道题按难度划分。八个较简单的目标——单环或双片段分子——仅给出分子式和谱图。七个较复杂的目标——稠环、螺环及类似结构——则额外附带一条提示:参与反应的原材料的结构。

Chart showing the structure elucidation
图 4. 15 道逆向任务题目的结构解析结果。每个面板展示了已发表的目标结构及其在 3 次尝试中的成功次数。边框颜色表示提示词条件:绿色表示仅提供谱图和 HRMS,不含原材料上下文;蓝色表示提供谱图、HRMS 和原材料的 SMILES,不含其他反应上下文。

Opus 4.7 在每一次尝试中都仅凭谱图和分子式就还原出了全部八个较简单的结构。在七个较难的目标上,给定起始原料的提示后,其中四个在三次运行中全部返回了正确结构,其余几个则在三次运行中有两次返回了正确结构。

最终我们发现,对于常规的数据预测,Opus 4.7——一个未经化学专用微调的通用模型——如今平均而言已与 ChemDraw 和 MestReNova 相当甚至更好。此外,Claude 还能反向求解问题,仅凭 NMR 数据提出结构。专用的结构解析软件已存在数十年,但通常需要 2D NMR(一种具有两个轴的谱图,输出的是等高线图而非一排峰)、专门培训以及授权工具。Claude 则只需化学家粘贴到聊天中的同一份高分辨率质谱和 1D 峰列表即可完成,无需任何设置。

局限性

这项评估向我们表明,通用模型可以与 NMR 软件竞争,甚至能让 1D 逆向解析变得可行。但仍有若干值得注意的局限性。

  • 首先,评估规模较小——正向任务为四个骨架共 20 种化合物,逆向任务为 15 种——且每个骨架只贡献单一类别的失败模式。因此,模型性能应被解读为指示性的,而非精确的。
  • 其次,在最密集的逆向目标上,如果没有起始原料作为额外输入,模型可能会在推理中循环而无法给出最终结构;这正是七个较难问题以起始原料结构而非仅凭谱图来设定的原因。
  • 第三,一些化学骨架未被测试。例如,慢交换的 NH 杂芳烃(其 N–H 与溶剂交换足够慢、从而留下尖锐 NMR 峰的芳环)仅通过氯代哒嗪进行了采样,遗漏了相关体系(羟基吡啶、氨基噻唑,以及其他在 DMSO-d₆ 中具有 NH 活性的骨架)。
  • 第四,2D 实验(COSY、HSQC、HMBC)和立体化学在设计上就不在范围内,因为仅凭 1D NMR 无法确定构型。因此,复杂的天然产物化合物未被评估。
  • 最后,我们的溶剂覆盖范围仅限于 DMSO-d₆、CDCl₃ 和 D₂O,因此甲醇-d₄、苯-d₆ 和丙酮-d₆ 未被评估。

理想情况下,我们希望看到这些数字在跨越 20–30 个骨架类别、数百种化合物上的表现,每个类别至少 15 种化合物,以便将类别内方差与工具间差异区分开来。我们还会评估氯代哒嗪之外的 NH 活性杂芳烃,评估未测试的溶剂,并开展两种任务的、基于 2D 实验的版本。

展望未来

在我们继续提升 Claude 在化学领域表现的过程中,我们特别关注几个最拖慢化学家效率的瓶颈。

  • 读取和渲染化学结构——将图、专利、幻灯片或草图上的绘图转换为机器可读形式,并在结构表示与化学文献中使用的系统命名之间来回转换。
  • 反应与合成推理——提出、评估和批判合成路线,预判结果,并深入思考选择性、条件以及可能的副产物。
  • 机理——用化学家实际使用的语言解释和检验反应机理,包括电子箭头、中间体和过渡态论证。
  • 化学文献理解——阅读已发表成果中呈现的化学内容,其中同一分子可能以结构式、名称、缩写或代号形式出现,并从方法部分、支持信息和专利中提取关键化学信息。

这些并非都处于同一条成熟度曲线上。在光谱分析已足够成熟、可以进行基准测试的领域之外,其他方向如逆合成规划,仍处于探索界定阶段。随着我们对这些瓶颈有了更深入的理解,我们将分享当前模型在哪些方面表现出色,以及在哪些方面仍有不足。我们的最终目标是确保一线化学家了解 Claude 能在哪些环节为他们节省时间,以及在哪些环节他们仍需依赖自身的专业知识。

与我们合作

我们正在扩展 AI for Science 项目,以更明确地支持化学研究。如果您是研究人员,正在研究 Claude 有可能提供帮助的问题,尤其是涉及我们所描述的那类多模态推理的问题,欢迎通过 scienceblog@anthropic.com 或 AI for Science 申请渠道与我们联系。


脚注

  1. 一起事件中,一种晨吐药物与全球超过 10,000 名儿童的严重出生缺陷相关联。
  2. 我们从中提取化合物的四篇预印本:https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002274/v1、https://chemrxiv.org/doi/full/10.26434/chemrxiv-2025-59lfh、https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002423/v1、https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002316/v1。

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com