Claude 如何加速蛋白质设计与分析化学研究
How Claude is accelerating protein design and analytical chemistry
Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。
把湿实验命中率与行业常规 10-15% 对比,Claude 从零设计蛋白结合体的效率已接近或超过专家,可压缩药物发现早期的计算与人工周期。
摘要: 在这篇文章中,我们分享两项成果,展示 Claude 如何帮助生命科学家加快研究步伐。在第一项成果中,我们测试了 Claude 从零开始设计蛋白质结合体的能力,这是药物设计流程早期阶段的一项关键任务,历来需要专家针对每个靶点花费数周甚至数月时间。Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计了蛋白质结合体,其中 14 个靶点取得成功。根据不同的设置,其单个设计中有 22% 到 35% 成功结合,而当今蛋白质设计工作中这一比例通常为 10-15%。它一些最强的设计,结合紧密度比此前已发表的最佳结果高出数倍。在第二个例子中,我们评估了 Claude 能否加速化学分析。Claude Opus 5 是一款已普遍可用的模型,我们向它提供了 NMR 和 LC-MS 数据(这些数据让化学家能够评估他们所处理化合物的身份和纯度)。仅提供一家合同实验室的原始文件和一句两句话的提示词,Claude 就在 23 分钟和 19 分钟内返回了完成的结果,在氢原子计数和纯度上与实验室自身的分析相符(96.4% 对 96.33%)。这些例子表明,Claude 能够减少目前在复杂科学任务上取得进展所需的时间和计算专业知识。
过去几个月里,AI 驱动的发现步伐加快了。这些发现大多集中在验证相对较快的领域。例如在数学领域,智能体已开始攻克未解问题:Erdős 问题中悬置数十年的难题正以每月数道的速度被攻克,我们最近还分享了 Claude 如何改进了黎曼 zeta 函数一个长期存在的下界。
AI 模型也开始在实验性领域加速进展,这些领域的结果验证更为复杂且昂贵,例如生命科学。在这篇文章中,我们分享了两项关于 Claude 科学能力的实验结果。首先,我们展示了对 Claude 在蛋白质设计任务中表现的研究发现,表明 Claude 能够针对多种靶点设计蛋白质结合体,其表现与顶尖人类专家相当(甚至更好)。其次,我们分享了 Claude Opus 5 在一项分析化学任务中的表现,展示了通用可访问模型如何支持研究中常规且耗时的环节。
下文描述的蛋白质设计与分析化学任务,代表了药物开发流程早期阶段部分工作的典型内容。加速这些阶段,是我们为端到端加速药物开发所做的更大努力中的一个组成部分,而这一努力的许多方面更多涉及政策与运营瓶颈,而非核心科学能力的提升。
我们今天分享的结果,是通过我们的 Mythos 和 Opus 模型组合获得的。尽管生命科学研究任务目前在我们最强大的模型上被禁用,但我们的最高优先事项之一是为科学家推出一个访问计划,我们预计很快会分享更多相关信息。在此期间,Opus 5 仍然是我们最强大的通用可用模型。
Claude 设计蛋白质
当我们发布 Claude Mythos 5时,我们曾分享过,我们正在对该模型进行实验,以加速药物设计流程中的部分环节。作为这项工作的持续组成部分,我们一直在研究 Claude 为多个蛋白质靶点设计 minibinder 的能力。minibinder 是一种小型蛋白质,被设计用于紧紧锁附到目标蛋白质上。结合是现代药物中很大一部分发挥作用的方式:它们附着到靶点上,并对其产生抑制、激活或递送某种物质的作用。设计一种新的结合物(即所谓的从头设计)历来需要蛋白质工程师针对每个靶点花费数月的计算、优化和筛选。
近年来,能够设计蛋白质并对哪些最可能发生结合进行排序的机器学习模型,极大地加快了蛋白质设计流程。但这些模型通常仍需要计算专家进行数天(往往数周)的繁复编排。而且,尽管像 Claude 这样的通用推理模型可以帮助专家和非专家更高效地在计算层面设计蛋白质,但在湿实验室(科学家在其中实际测试化学品、药物和其他生物物质)中验证这些数据仍然需要数周。
我们现在已经收到了其中首批实验的湿实验室数据,这是一项针对 15 个靶点的多臂蛋白质设计项目,使用的是 Claude Opus 4.8 和 Mythos Preview。我们的外部评估方 Adaptyv Bio 和 Twist Bioscience 独立地在实验室中生产并测试了 Claude 的设计,结果发现,在我们针对设计的 15 个靶点中,Claude 成功设计出了针对其中 14 个靶点的结合体。这些包括针对至少六个靶点的高亲和力结合体1,以及针对至少四个靶点达到或超过已报道最佳亲和力的结合体。亲和力是衡量蛋白质与其靶点结合强度的指标;通常需要高亲和力结合体才能实现治疗效果,因为它们能让药物在更低剂量下起效,从而降低副作用风险和制造成本。
在 48 小时的单次会话中同时针对所有靶点进行设计时,Mythos Preview 和 Opus 4.8 分别实现了 26.7% 和 22.6% 的总体命中率——即有多少设计实际上是结合体。而如今蛋白质设计项目的典型水平是 10% 到 15%。2
在评估了 Claude 针对多个靶点进行设计的能力之后,我们想了解让它一次只专注于一个靶点是否会提升其表现,尤其是考虑到这更能代表蛋白质工程师通常采用的方法。果然,我们发现 Mythos Preview 在使用多个 24 小时会话分别针对每个靶点进行设计时,实现了 35.1% 的总体命中率。

这项活动是在极少人工参与3的情况下完成的,除了我们在初始提示词中向 Claude 提供的信息(链接)之外。我们预计,在专业蛋白质设计人员手中,这种方法会取得更出色的成果,尤其是如果他们对 Claude 的中间结果给予积极引导和反馈的话。
这项活动
我们通过选择多个靶标4来启动我们的蛋白质设计活动,这些靶标常用于蛋白质设计基准测试,包括 Adaptyv Bio 的全部 BenchBB。由于这些靶标已被广泛研究,我们可以将我们的结果与已发表的命中率和亲和力进行比较。我们还从 Adaptyv Bio 最近的竞赛中选择了两个新靶标——15-PGDH 和 GDF-8——以确保 Claude 能够针对这些靶标进行设计,而不依赖其训练数据中预先记录的成功案例或在线搜索(对于所有靶标,我们要求 Claude 检查并确保其设计是原创的)。
随后,我们提示 Claude 在 Claude Science 中针对这些靶点设计蛋白质结合体。为此,我们采用了两种方法。第一种是多靶点模式,即 Claude 在单个 Claude Science 会话中同时针对所有靶点进行设计。第二种是单靶点模式,即每个会话只处理一个靶点,所有靶点的会话并行运行。
我们以多靶点模式运行了 Opus 4.8 和 Mythos Preview,墙钟时间为 48 小时,用于运行专用蛋白质设计与折叠模型的计算资源最多达 12,500 NVIDIA H100 小时。我们还以单靶点模式运行了 Mythos Preview,每个靶点的墙钟时间为 24 小时,计算资源最多达 2,500 NVIDIA H100 小时。5
为了模拟典型蛋白质设计项目期间可用的资源,我们为 Claude 提供了以下内容:
- 一份详尽的蛋白质设计提示词6,该提示词同时也被包含在智能体上下文中;
- 对互联网以及蛋白质设计相关资源语料库(如论文)的访问权限;
- Google Drive、Slack、Gmail 和 BioRxiv 的连接器;
- 用于运行专用蛋白质设计与折叠模型的 GPU 访问权限;
- 在分配时间内对 token 和子智能体预算不设限制,并启用快速模式。
在给 Claude 提供提示词后,我们让模型自主执行。在启动这些任务之后,我们没有再提供任何额外的科学、技术或操作指导。
我们唯一的参与是批准访问权限(例如网络访问请求)以及监控基础设施以确保会话正常运行。Claude 完成了设计结合蛋白所涉及的全部工作,而这些工作对人类操作者来说可能需要数周时间。它自行选择针对每个蛋白质靶标的设计位点;通过编排多个结构设计、序列设计和共折叠模型(即在单次前向传播中预测蛋白质及其所结合对象结构的模型)来生成候选结构和序列;对设计进行多轮 in silico 优化;并通过计算筛选出新颖、多样、能够表达、保持可溶性且能结合的候选分子。
对于这 15 个靶标中的每一个,我们要求 Claude 设计 30 个蛋白质结合蛋白。Claude 通过操作该领域已在使用的公开可用的专业蛋白质设计和共折叠模型来完成这一任务。随后,Claude 的设计被送往 Adaptyv Bio 和 Twist Bioscience 进行验证。

Claude 在各靶标上的表现
在这项工作结束时,我们针对 15 个靶点中的 14 个,使用总共 1,320 个设计,产出了 354 个结合体。这对公开可用的 de novo 蛋白质设计总库是一个重要贡献;例如,两个最大的集合——proteinbase.com 以及由 Overath 等人整理的集合——针对 40 个靶点,在 5,700 个设计中包含约 770 个结合体。下面,我们分享三个展示 Claude 能力的例子,以及一个展示其局限性的例子。你可以在我们的技术报告(链接)中找到更多细节。
Claude 的设计与 Adaptyv Bio 蛋白质设计竞赛中的参赛作品相比具有竞争力
我们发现,对于 Adaptyv Bio 已举办过竞赛的靶点,Claude 在命中率和亲和力两方面都达到或超越了顶尖参与者的水平。针对 RBX1(一种驱动特定调控蛋白靶向降解的小型蛋白质),Mythos Preview 在单靶点模式下实现了 40% 的命中率,而参与者的命中率为 3.7%。其排名最高的设计是一个高亲和力结合体,表现优于获胜设计,而后者是在 245 个参赛设计中脱颖而出的。

Claude 设计出针对 TNFα 的物种交叉反应性结合体,这是一个具有挑战性且与治疗相关的靶点
有趣的是,在 TNFα 这个靶点上取得成功的是 Opus 4.8,而非 Mythos Preview,而这一靶点曾让多个专家团队束手无策。TNFα 是一种由免疫系统释放、用于触发炎症的信号蛋白,阻断它是包括 Humira 在内的史上一些最具影响力药物的治疗基础。这是一个难以设计靶向的靶点,因为其多聚体结构要求靶向由两个蛋白形成的凹槽中的结合位点。尽管 Mythos Preview 未能成功,Opus 4.8 却设计出了多种结合物,其中一些还能跨物种起效,可结合人类、食蟹猴和小鼠的 TNFα,这对于开展动物研究至关重要。我们尚不确定为何 Opus 4.8 在这一靶点上成功而 Mythos Preview 未能成功。在评估模型能力时,我们采取的是整体性视角。鉴于蛋白质设计固有的复杂性,某些具体领域中出现整体能力较弱的模型反而胜过整体能力更强的模型,并不令人意外。

Claude 设计出具有 β-折叠的折叠多样性结合物
大多数计算设计的结合物是 α-螺旋束,这是一种由螺旋盘绕而成的蛋白质二级结构。β-折叠则要求延伸的氨基酸链并排排列,设计难度更大,也更容易发生错误折叠和聚集(即蛋白质分子相互黏附,而非保持分离并正确折叠)。Claude 针对六个靶点设计出了 15 种经确认的结合物,其中至少含有 20% 的 β-链,展现了其推理蛋白质结构的能力。

Claude 在某些靶标上表现吃力
某些靶标对 Claude 而言始终是挑战,包括 BBF-14 和麦芽糖结合蛋白(MBP)。BBF-14 是一种自然界不存在的 β-桶状蛋白:它本身就是通过 de novo 设计 得到的,而正因其新颖性,它如今被用作结合体设计的基准。MBP 的结构也格外困难。MBP 是一种大型、柔性的细菌蛋白,表面光滑且亲水,这使它成为良好的实验室试剂。这留给结合体可供抓取的地方非常少。Claude 仍然设法产生了三个独立的 BBF-14 结合体——每个设计分支各一个,且各自建立在不同的骨架上——具有中等(亚微摩尔至微摩尔)的亲和力。然而针对 MBP,90 个设计中没有一个被确认与靶标结合,尽管有一个表现出微弱但可重复的结合信号。

为了更好地理解 Claude 在这些设计项目中的表现如何,我们打算在实验之后进行更广泛的表征,以确认我们的命中率和亲和力测量结果。与此同时,我们分享用于这些项目的提示词,以及我们生成的所有 in vitro 和 in silico 数据。7
智能体式生物学发现具有双重用途
AI 模型日益自主的研究能力所带来的能力提升,无疑将加速人类疗法和基础科学发现的进程。然而,这类能力同样具有双重用途:若缺乏稳健的安全措施,它们可能让恶意行为者得以开展危险研究,例如开发生物武器。在我们通过可信访问计划努力安全地交付这些能力的同时,蛋白质设计及其他具有双重用途的研究生物学能力仍不可用,无法在 Claude Fable 5 中供普遍访问。不过,正如你将在下文看到的,我们的 Opus 级模型能够完成非凡的科学工作。
Claude 运行分析化学工作流
蛋白质结合剂实验测试的是 Claude 设计新分子的能力,而第二个实验测试的则是它解读已合成分子测量数据的能力。表征化合物是一项繁琐的工作;与蛋白质设计非常相似,它需要化学家进行多轮测量、分析和迭代。例如,化学家每合成一个分子,都必须确认它是否就是自己想要得到的产物,以及它的纯度如何。这通常通过核磁共振(NMR)波谱来完成。NMR 谱图是一系列峰,每个峰对应分子中某个位置的氢原子或一组等价氢原子。峰的位置告诉化学家每个氢原子连接着什么,峰的大小则表明它代表多少个氢。确认结构是合成化学中最耗时的步骤之一;对于每个化合物,化学家都必须手动将谱图中的每个峰与所提出结构中的原子一一对应。
另一种技术主要用于评估纯度,即液相色谱-质谱联用(LC-MS),它首先在样品流经色谱柱时将其分离为各个单独组分,然后根据各组分的紫外吸收记录其含量,再测量每个组分的分子质量。对于这两种技术,仪器运行本身只需几分钟(常规质子 NMR 谱图约两到三分钟;LC-MS 运行约 10 分钟)。繁琐的部分在于分析输出结果。NMR 和 LC-MS 运行完成后,每台仪器都会生成一个采用制造商自有格式的原始文件,该文件需要在制造商的(或其他专业)软件中打开。8
考虑到处理并解读这些文件有多么费时费力,我们想看看像 Claude Opus 5 这样一款普遍可用的模型在这项任务上表现如何。9仅提供某合同实验室一份常规质量控制样品的原始文件,以及一段简短的通俗语言提示词,10没有厂商软件,也没有操作员,Claude 在 Claude Science 中运行,分别在 23 分钟和 19 分钟内返回了处理后的 NMR 和 LC-MS 结果,且是并行完成的。其结果与实验室自身的处理结果相符——每个峰的氢计数与实验室结果相差在 0.08 ¹H 以内,其测得的纯度为 96.4%,而实验室为 96.33%。

对于 NMR 数据,Claude 将仪器的原始数据转换为校准后的谱图和一张包含 18 个峰的表格,并给出每个峰的氢计数。接下来,如同化学家会做的那样,它将四个宽峰标记为可能连接在氮或氧上的氢。随后它提出了标准检查方法:向 NMR 样品中加入重水,这会将这些氢交换掉,使其峰缩小或消失。(实验室独立地在首次测量三天后进行了同样的检查。)拿到重水实验的原始文件后,Claude 量化了数据中的变化,发现并纠正了其首次判读中的一处夸大表述(其第一遍报告称四个被标记的峰全部消失,但其自检显示只有两个消失),并得出了与实验室操作员相同的结论。

LC-MS 仪器文件使用一种未公开的厂商格式。Claude 弄清了数据的编码方式,然后通过复现仪器自身记录的全部 2,664 次扫描的总计数据,确认自己正确读取了文件,之后才开始任何分析。随后它交付了化学家所期望的全部输出:分离谱图、质谱和 UV 光谱、纯度表、化合物的分子量,以及用于读取此类文件的可复用代码,同时还附上了它自己对结果可信度的注意事项清单(例如,它指出这类仪器给出的质量仅精确到最接近的整数单位)。
通常,化学家要手工完成所有这些分析。对于一个具有治疗相关性的小分子,每个样品通常需要半小时到一小时(该实验室自己的记录显示,每张 NMR 谱图约需两分钟的人工处理时间,而 LC-MS 报告则在样品装载到仪器上约两小时后才出来)。Claude Science 在这 25 分钟内并行处理并解读了两个文件。Claude 还在这段时间内生成了一份书面报告,而该实验室针对这个样品的最终报告是在第一张谱图采集四天后才送达的——考虑到他们一次只分析一个分子,且期间可能还有其他工作插入,这算是相当标准的滞后时间。
除了效率提升之外,Claude 的这次运行还展现出了一定程度的科学判断力,例如它提出了与合同实验室独立进行的完全相同的后续实验。随着这些模型持续改进,我们预计 Claude 的科学判断力将变得更加敏锐。
如果你想在 Claude Science 中亲自尝试,可以给 Claude 一份原始的 NMR 或 LC-MS 文件,让模型确认该化合物的身份和纯度。
结论
上述两个示例都展示了 AI 模型如何通过降低科学发现所需的专业知识、成本和时间,加速生命科学领域的研究。在化学领域,Claude 正在自动化化学家历来手工完成的分析工作。在蛋白质设计领域,Claude 能够以极少的输入端到端执行结合体设计活动,产出的结合体可媲美甚至超越此前已发表的最佳设计。
蛋白质微型结合体并非标准的药物治疗模态,即便对于单克隆抗体和小分子等常见药物模态而言,设计高亲和力结合体也只是生成类药分子过程中的第一步。不过,我们将这项工作视为基础性工作,并正在对其加以扩展,使 Claude 能够跨所有药物模态端到端地运行整个开发流程。
延伸阅读
以下文档列表提供了关于上述结果的更多技术深度和更详细的信息:
脚注
- 我们认为,若结合剂的平衡解离常数至多为个位数纳摩尔(KD < 10 nM),则属于高亲和力结合剂。
- 通过计算总体从头设计蛋白质结合剂的命中率,基于https://proteinbase.com/.
- 这包括批准 Claude 提出的某些请求(例如网络访问请求、代码执行请求),解决蛋白质设计会话之外的基础设施问题,以及订购生成的设计以进行实验验证。
- 我们总共选择了 16 个靶点(在相关情况下,默认物种为人类)。按字母顺序排列,它们分别是:15-PGDH、BBF-14、BHRF1、Cas9、EGFR、GDF-8(潜伏型)、GDF-8(成熟型)、IL-7Rα、麦芽糖结合蛋白(MBP)、尼帕病毒糖蛋白 G、PD-L1、RBX1、TNFα、TREM2、TrkA 和 VEGF-A。我们展示了 16 个靶点中 15 个的结果,因为其中一个靶点 GDF-8(成熟型)的实验数据因靶点聚集和非特异性黏附而无法得出结论。
- 15-PGDH 和 latent GDF-8 未在多靶点模式下使用。Opus 4.8 以单靶点模式针对三个靶点运行:TNFα、latent GDF-8 和 mature GDF-8。
- 约 30,000 个 token,共享于此处。
- 提示词、所设计蛋白质复合物的计算模型以及实验数据均可在此处找到。
- 对于 NMR,是波谱仪写出的原始信号(“自由感应衰减”);对于 LC-MS,是仪器的二进制运行文件。两者都是原始的专有仪器文件。
- 我们此前已分享过关于 Claude 对照标准软件分析 NMR 数据表现的工作。
- NMR 提示词全文如下:“i have a raw 1H FID: process it: FT, phase, baseline-correct. show me the spectrum. then pick peaks and integrate: give me a table with δ (ppm), multiplicity, J (Hz), and integral.” LC-MS 提示词为:“Process the raw LCMS file: extract chromatograms and mass spectra, and summarize with figures.”
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com