跳到正文
北京时间
原文
Anthropic:Research·· 1 天前精选AI 评分69

物理学者 Matthew Schwartz 分享用 Claude 与 BootLoops 做跨学科计算的经验

Claude-shaped science

AI 导读

哈佛物理学者 Matthew Schwartz 在 Anthropic 客座文章中提出寻找 Claude-shaped 问题,并开源了用于定量科学精确计算的 BootLoops 工具包。

推荐理由

作者结合自身跨学科项目,说明如何让 Claude 承接适合其能力的问题,并总结了与专家协作及规避模型失败模式的经验。

正文 · AI 翻译

摘要:在这篇客座文章中,Matthew Schwartz 教授再次撰文,介绍一种 AI 加速科学的新方法。在 Vibe Physics 中,Schwartz 讨论了 Claude 与物理学研究生在能力上的相似之处。在这里,他描述了当他不再与 Claude 对抗,而是让 Claude 去寻找“Claude 形状”的问题——即最适合当前一代 LLM 工具能力的问题——时所发生的事。这促使他构建了 BootLoops,一个用于定量科学中精确计算的工具包。由于类似的计算常常出现在差异极大的科学领域中,Claude 发现了与生态学、群体遗传学以及其他十几个领域的联系。这些联系在技术上往往正确,但起初在科学上并不引人注目,因此 Schwartz 与领域专家合作,引导 BootLoops 去解决那些领域真正关心的问题。下面,我们将分享更多关于这些项目以及 BootLoops 如何诞生的内容。

智能体 AI 正在迅速进步。每个人都注意到这些模型似乎更聪明了:它们知道得更多,犯的错误更少,想法也更好。如果你顺着趋势线看,很容易自信地谈论 AI 彻底变革科学的潜力。然而,试图在自己工作中使用这些模型的学术科学家,常常感到一种脱节。这些模型或许正在解决具有挑战性的、长期存在的问题,但到目前为止,这些大多只是对现有技术范围明确的应用。许多头条新闻似乎都出现在数学领域,而数学是科学中唯一一个问题可以被完整表述、答案可以被绝对检验的部分。但大多数科学并非如此。而且对我们许多研究人员和学生来说,那些头条新闻与我们在使用这些模型时实际发生的情况之间的差距,会让我们感到沮丧和焦虑。

在我看来,核心冲突在于:尽管这些模型很聪明,但像人类科学家那样工作并不是当前 LLM 最擅长的事。Claude 和 GPT 擅长科学,但它们不是科学家:没错,它们很聪明,但要让它们产出任何有科学价值的东西,可能需要大量手把手引导。物理学家会称这是一种“阻抗失配”:两个系统各自运行良好,但彼此匹配很差,因此一方输入的大部分内容永远无法传递到另一方。在这里,失配存在于科学家想要的东西和 AI 擅长的事情之间。

那么,我们该如何解决这个问题?

我开始寻找那些阻抗失配不那么严重的例子。我首先让 Claude 构建一套易于使用的数学物理工具。不久之后,这些工具就在其他问题上找到了用途。这个迭代过程产生了一套软件和科学协议,我称之为 BootLoops。BootLoops 的作用有点像 LLM 的挽具,就像 Claude Code 或 Claude Science 是 Claude 的挽具,或者 Codex 是 GPT 的挽具一样。我发现 BootLoops 特别适合科学中的一类定量问题。它也是开源的,因此可以与你喜欢的任何模型一起使用。

A visualization of the overlap between what AI can do, and what scientists want to do. Only some of the areas touch.
当前这一代 AI 工具无法解决科学中的大多数问题。然而,它们在某些“智能体 AI 形状”的问题上却好得惊人。

当 Claude 有了 BootLoops 后,它不断注意到同一个模式:许多领域存在的问题,只要有人知道数学、物理学或计算机科学中的某项技术,就能直接解决。我开始把这些称为“Claude 形状”的问题,并跟随它们走出高能理论物理——我的主场——进入地质学、生物学、经济学和语言学。在这些其他领域,我无法依靠自己的专业知识来判断 Claude 发现的东西是否有趣。于是我找了一些专家来询问。在他们的指导下,BootLoops 得以在许多研究领域取得实质性进展。

下面,我分享 BootLoops 是如何诞生的,描述在我一直应用它的领域中取得的一些早期发现,并分享我关于如何解决当今人类与 AI 科学家之间阻抗失配的一些思考。

Claude,你来掌舵!

去年 12 月,我尝试把 Claude 用作研究助手,发现 Claude Opus 4.5 的表现就像一个出色的研究生,速度却是其 20 倍。尽管 Claude 在实验结束时产出了一篇高质量论文,但到达那一步的过程十分艰难。我不得不纠正它写的每一句话,把它从无关的思路上引开,并把它从死胡同里拉回来。

今年夏天,我尝试了不同的做法:不再把 Claude 当作我希望它成为的合作者,而是开始把它当作它实际上的合作者。这需要寻找适合其优势的问题。目前,Claude 还无法在深层概念性问题上帮助我——但它确实拥有横跨所有领域几乎无限的知识广度、令人惊叹的编程技能、数学与统计学的前沿知识,以及以机器速度解析论文、附录和数据的能力。

寻找“Claude 形状”问题的自然起点是那些编程能帮上忙的领域。当 Anthropic 在 2026 年夏季发布 Claude Fable 5 时,我想看看它的网络能力是否能转化为科学计算能力。于是,我试图通过让它移植、编写并改进我几篇论文以及散射振幅相关文献中的各种方法来测试它。

散射振幅是我们解读大型强子对撞机数据的方式:以 13 万亿电子伏特对撞两个质子,振幅就是碎片与碰撞产生的任何新粒子(希格斯玻色子或未知粒子)之间的理论桥梁。其核心是费曼图,即一种特定形式的多维积分。我们目前正在艰难处理的那些图,每一个都可能是一篇博士论文,或让一个团队耗费数年。

在过去20年里,一种替代方法发展了起来:S矩阵自举法。在自举方法中,你不再费力地计算积分,而是施加物理约束,直到只剩下一个可能的答案。知道振幅在何处无穷大(即其“奇点”)可能将其缩小到20,000种可能;一个对称性将其削减到500种;如此继续,直到只剩一个。传统的自举法是纯解析的,并且在对称性最高的理论中走得最远,那里的约束一直延伸到唯一选项(N=4超杨-米尔斯理论中的九圈振幅就是一个例子)。更接近现实世界时,你往往在到达终点之前就用尽了约束。一个更新的转向——半数值自举法——在你还能以荒谬的精度(有时是1,000位数字)计算少数几个点上的振幅时,就填补了这一空白:如果剩下的可能选项足够少,这些数字就能精确地确定剩余的系数。

半数值自举法似乎非常适合代理式AI。它涉及数学、物理学和计算机科学,而这些知识没有任何一个人完全掌握;它需要大量的编码和算法开发;而且它是可检验的,因为同样的数值方法让任何人,无论是不是专家,都能通过运行两个脚本,将最终答案与积分进行任意位数的验证。这个社区的专业知识分布也不均衡:好的想法存在于Wolfram语言、C++、Python或Julia中,还有更多想法存在于完全没有代码的论文里。因此,我给Fable 5的第一个任务就是将所有内容移植到一个通用框架中,并编写论文从未提供的代码。

Claude毫不费力地做到了这一点。当它在大约20分钟内复现了我论文中的结果时,我感到惊讶,而我为此编写的代码花了我数周时间。然而,当它告诉我,我在做一件效率极低的事情,并且有一种我不知道的更好算法时,我并不感到惊讶。 

然后,我让Claude搜索它可以计算但尚未解决的振幅。事实证明,对于S矩阵自举法来说足够简单的问题,对人类来说也足够简单——而且,事实上,大多数都已经完成了。尽管如此,它还是找到了一些未解决的问题。在与模型进行了一些讨论之后,很明显Claude将自己限制在具有最简单函数族的振幅上:对数。所以我问,它能否对下一个最简单的函数族——椭圆函数——做同样的事情?

椭圆积分真的很难,即使对于像我这样花费大量时间计算积分的人来说也是如此。据我所知,或者据Claude所知,只有少数椭圆费曼积分曾被计算出来,而且没有一个完全是通过自举法完成的。问题不在于方法行不通,而在于没有人尝试过,因为所需专业知识分散在许多人手中。相比之下,Claude轻松地将其为对数情况移植和构建的所有机制推广到了这些其他积分类别。这一次,它自己编写了大部分软件,或者从数学而非物理学中借用。随着工具包的增长,它开始一个接一个地攻克积分。很快,我们就有了30个从头到尾通过BootLoop处理的积分,其中包括用这种新方法复现的15个已知结果,以及15个此前从未被计算过的结果。

这一切都仅仅在几周后。起初,我以为只要就此写一篇报告就会满足,但我太想看看我们(也就是我和使用 BootLoops 的 Claude)还能做些什么。

“我知道功夫”

科学的一个偶然特性是,同样的方程常常在不同情境中反复出现。例如在物理学中,扩散方程、福克-普朗克方程和薛定谔方程都具有相同的数学形式,因此如果你开发出一种方法解决一个问题,往往可以将其应用于许多其他问题。我知道 BootLoops 擅长的计算在其他领域也相关:例如宇宙学和弦理论。我不知道但 Claude 乐于告诉我的是,这些积分也可以映射到群体遗传学中的贝叶斯证据积分,或者用于费曼积分约化的有限域方法也可以应用于进化生物学中的问题。

这开启了一段特别多产的时期,寻找并解决 Claude 形状(更狭义地说,BootLoops 形状)的问题。有些想法立刻显现为绝佳的应用。例如,系统发育学研究如何利用 DNA 将物种组织成家谱树;相关的计算是贝叶斯证据积分,其输出是一个单一数字,表明候选树对观测到的 DNA 的解释程度,这正是 BootLoops 最初构建时所要做的同一种积分。随着想法的涌现,我坚持要求 Claude 既使用旧工具又构建新工具,以便工具集能够成长。每个工具,即使来自失败的项目,也打开了新的大门。Claude 变得越来越有能力。就像《黑客帝国》中尼奥从功夫下载中醒来之后一样。

然而,随着项目偏离我的专业舒适区,我开始担心。当 Claude 声称它在我领域内做的某件事很棒时,我能判断那是否属实(通常并非如此)。但当它声称在另一个领域做的某件事很棒时,我发现自己会赞同。我的怀疑加剧,我知道我需要引入一些专家来确认。果然,我发现几乎在所有情况下,Claude 在技术上是正确的,但结果并不那么有趣,直到专家帮助我们调整方向。

其中一个项目是关于生态学中的中性生物多样性理论。在任何生态系统中,有些物种繁盛,而另一些则消亡。中性理论追问这种生活史中有多少是出于随机偶然。在早期工作的基础上,2001年,生态学家斯蒂芬·哈贝尔提出了一个挑衅性的观点:也许这一切都是随机的。2005年,生态学家兰帕尔·艾蒂安为哈贝尔的理论提出了一个方程,使其(至少在原则上)能够以精确的方式被检验。不幸的是,20年来没有人能够大规模求解这个方程。Claude 认出艾蒂安的方程是 BootLoops 形状的,并解决了它。将计算应用于数据,我们确定在地球上研究最多的森林——巴拿马运河的巴罗科罗拉多岛——中,树种混合的变化速度比中性理论所允许的快4.5倍。

我对这一结果感到兴奋,便把它拿给植物生物学教授、中性理论专家James O’Dwyer看。James对我很有耐心。尽管他对这一技术壮举印象深刻,但他说这些结果很可能会“被许多生态学家不以为意地耸耸肩”。生态学家此前已经以更定性的方式观察到,中性理论跟不上真实森林的情况。但James有一个更好的主意:减去中性预测,研究剩余部分。这会让我们更好地理解哪些变化可归因于自然选择、竞争以及物种之间的差异。

James和我随后与Claude紧密合作,打造一个后继模型。James有物理学背景,因此学科语言障碍更容易克服,但和许多科学家一样,他尚未真正体会到智能体式AI的力量。随着合作推进,我成了某种Claude处理者,把Claude式表达翻译给James,并让模型保持在正轨上,而James则推动模型产出生态学家可能重视的东西。最终成果是我们三人都引以为豪的东西:一个与数据高度吻合的极简生活史预测模型。我们目前正在把该模型从巴拿马扩展到全球其他森林样地,使用的是Claude帮助整理的数据集。

Graph of every forest inventory in the US color-coded by life history strategy
美国每一处森林调查样地,按其植物区系的生活史策略加以刻画:耐久的(长寿)、旺盛的(快速生长)或多产的(繁殖力强)。该分类来自一个由Schwartz和O’Dwyer使用Claude构建的人口统计模型;该模型在减去由随机机会造成的波动(中性生物多样性理论)后,依据寿命、生长和补充来刻画每个物种,从而揭示物种依赖性的生物学特征。

另一个项目涉及研究群体遗传学中的精确计算,这一领域研究基因在群体内如何变异以及为何变异。Claude首先使用从数学物理引入的方法,求解了一个已有30年历史的积分表达式,该表达式描述自然选择如何塑造稀有突变。我们将其应用于gnomAD,这是最大的公开人类遗传变异目录。Claude对这一结果非常兴奋,但我并不那么确定。我不得不写信给三位不同的生物学家以求验证,才有一位回复,但最终我得以招募到我的同事Michael Desai,他从事这一领域的工作,尽管不是研究这个确切问题。和James一样,Michael对这一技术结果印象深刻,但并不被其科学意义所说服。

不过Michael指出,更有影响力的结果可能来自研究单条染色体上突变对之间的相关性,使用相同或类似的方法。在这一范围内,Claude发现并构建了新工具,比如用于数学中计算机辅助证明的不等式证书,并将它们加入BootLoops工具包。随后,我们分析了来自1000 Genomes Project的基因组中57亿对邻近突变,并发现了名为基因转换的机制的证据。这是一个重要发现,因为几乎所有使用连锁遗传变异的分析,从群体历史到疾病定位,都忽略了基因转换。更大的教训是,AI可以帮助发现隐藏在庞大基因组数据集中的生物学信息,而公共档案中还有成千上万个这样的数据集。

其他项目也有类似的轨迹:Claude 提出一个我觉得很有说服力的初步发现。我把它带给一位专家,专家不为所动,但看到了其中的潜力,于是我们一起把它打磨成有意义的科学。有趣的是,其中一些项目从 BootLoops 式的定量计算,逐渐转向更广义的 Claude 式工作。例如:

  • 经济学。经济学期刊现在要求作者提供复现包,而编辑往往要负责检查它。这是一项细致的手工工作。我们与两位经济学家合作,构建了一个 AI 数据编辑器:它将五家顶级期刊中 4,452 篇论文的复现包从 MATLAB、Stata 和其他商业工具移植到开源代码(约 30,000 个例程),并对照已发表的表格检查了几乎每一个可验证的数字。结果发表在 NBER 工作论文中。
  • 语言学。词重音目录通常是手工汇编的,涉及几百种语言、选择效应和人为偏好。Claude 搜遍了所有可公开访问的来源,我们与三位语言学家合作,制作了 AccStack:一个覆盖 6,072 种语言的词重音数据库,几乎每个条目都引用了决定性段落,外加一份包含 160,000 部音系学著作的参考文献目录。

还有一些额外亮点,每一项都是与专家合作完成的,且每一项都在进行进一步的探索和验证,包括:

  • 系统发育学。我们让进化树的贝叶斯证据计算变得快速且可精确检验,并发现单个基因在竞争树之间的支持度差异,往往小于标准采样程序的误差。
  • 地球科学。我们结合大气科学、地球化学和气候建模的方程与数据,构建了一个定量、可预测的模型,描述大氧化事件如何历经四次冰期展开。
  • 基因组学。我们大规模研究了单细胞 RNA 计数的统计特性,以刻画爆发速率以及基因表达对教科书式电报模型的偏离。
  • 太阳黑子。我们运用人类人口统计学的方法推断太阳黑子的生命周期,随后将该方法扩展到刻画恒星黑子——这是许多系外行星搜寻中的一个混杂因素。
  • 数学物理。我们解决了 Watson 的“最终问题”:具有三个不等跳跃率的 3D 随机游走的精确返回概率,这是 George Watson 自 1939 年开始研究的最后一个晶格积分。
  • 宇宙学。我们构建了一套完整的理论工具包,用于将宇宙学参数拟合到宇宙大尺度结构数据,包括完整的双圈功率谱和单圈三谱。
  • 统计学。混合模型以行为不良而著称;我们推导出了其贝叶斯证据的精确近似,使模型选择变得实用,应用范围从生物统计学到文本分析。

总体而言,这种迭代改进 BootLoops、寻找 Claude 式应用、并与专家一起推进到科学前沿的方法,成果惊人地丰硕。关于这些项目及其他项目的更多信息,可在 bootloops.ai 上找到。

技术细节

同时运行多个项目(三个月内在18个领域完成36篇手稿,涉及19位合著者,从约400个候选问题中筛选而出)需要大量协调工作,无论对我还是对Claude而言都是如此。让这一切变得可管理的设置其实相当简单。Claude Code会话全部运行在Google Cloud虚拟机上的终端中,根据合作者的偏好链接到各种GitHub和Overleaf仓库。我为每个项目设置了独立的会话,另外还有一个主会话负责协调其他会话、分配算力并验证结果。每个会话都包含在后台运行计算的智能体,中间结果存储在各文件夹中的markdown文件里。这些子智能体很有用,因为我经常遇到Fable 5的分类器;与其让这些阻塞破坏我的整个会话,它们只会关闭单个智能体。我还有一些独立会话用于撰写结果、创建GitHub仓库、工具手册和BootLoops网站、编写并验证所有独立的工具代码,以及作为对抗性裁判反复核查结果。

不过,这些会话仍然需要大量引导。例如,Claude没有时间概念,而且喜欢夸张。在一个项目结束时,它告诉我“Matt——公式解出来了。两年的攻关,四次深度推进,……”。而它其实只工作了三天。当我询问预计完成时间时,估计值总是要么太长要么太短。我试过告诉Claude在运行测试确认之前不要给出估计,但效果也不好。随着时间推移,由于无法依赖Claude告诉我,我开始自己摸索出事情大概需要多长时间。

更大的问题在于,Claude的默认做法似乎是硬啃一个长达数天的漫长计算,而不是构建一个新工具让同样的计算只需几分钟。我一次又一次不得不告诉它要更聪明地思考,而不是更费力地思考。在这些长期项目中,上下文压缩经常会触发,导致Claude丢失重要上下文。为防止这一点,我让Claude定期整理并合并其文件,这样它始终能访问最新版本的计划。我已经在BootLoops框架中写入了协议技能和其他工具来解决这个问题。其中一些问题在优秀的商业框架中也已经得到解决,比如Claude Science。但许多问题只是当前这一代智能体AI固有的恼人之处,我预计模型最终会克服它们。

以下是我遇到的另外几种失败模式,以及应对建议:

  • Claude喜欢宣布胜利。“完成了,只有一个星号”往往意味着“根本没完成”。“完全就是这样,只有一处小改进”通常意味着“不对”。给Claude设定清晰而严格的成功标准有助于解决这个问题。在一个项目中,它对自己的证明很自豪,直到“一个未证明的引理”。那个引理就是整个证明!我说不允许有未证明的引理。然后它又说“完成了”,但这次多了一条新公理。
  • 一切都要自己看。我总是要求查看图表。即使设置了我所有的监控,我发现自动检查仍然不可信。要警惕“吻合良好”这类定性说法。
  • 质疑结论。Claude擅长执行计算,但它得出的结论可能是错的。让它解释它发现了什么,直到你相信为止。
  • 提供品味。 Claude 能找到 Claude 形状的问题,但这样的问题有成千上万,甚至数百万个。Claude 似乎偏爱那些陈旧、被高度引用却早已被遗忘的争论。让它专注于新近可能的事情,而非仅仅更快或涉及更多数字的事情,会有所帮助,但你仍然无法信任它对某件事是否有趣的判断。
  • 追问。 一旦 Claude 取得了出色的结果,就要求它给出更出色的结果。它总能想出点什么,偶尔还会非常精彩。
  • 当心无休止的消耗。 说实话,我从未成功让 Claude 准确估算时间。相反,我培养出了一种感觉,知道一件有趣的事情应该花多长时间,并学会了判断 Claude 是否在我认为合理的时间尺度上取得了进展。如果你放任不管,这个模型会永远消耗下去。

还值得一提的是,这些项目对算力和 token 的消耗都很大。对我来说,部分开销来自尝试构建能在任何单个项目之外发挥作用的工具:连接不同领域,并组装出一个其他人可以接手的软件包。我希望 BootLoops 工具链能被广泛用于定量科学,而不必让每个用户都从头重建一切。智能体 AI 让连接想法和共享代码库变得更容易,如果我们学会利用这一优势,整个社区就能比任何个人单独行动走得更快。

展望

无论模型变得多么聪明,大多数科学进步都来自必须获取、理解和核验的真实世界数据,每一轮都会为下一个问题提供信息。AI 可以置身于这个循环之中,这确实很有价值,但它并不会把循环压缩成一个点。理解是一点一点建立起来的,每一步都建立在前一步之上;癌症的解药或聚变反应堆也将以这种方式到来,而不是来自单次提示。

对千禧年大奖难题和“大科学”的关注,也许正如 Claude 喜欢说的那样,是一把“自伤枪”:一种让你容易搬起石头砸自己脚的特性。这里的风险在于,不切实际的期望可能会打击那些已经可能实现的高效用途。真正的进步很可能会以它一贯的方式到来:加强科学研究的基础,并在其上构建日益复杂的应用。正如我所描述的工作所表明的那样,这一进程会大幅加速,但我看不到任何证据或必要去重新审视科学方法。

我喜欢用凸包这个术语来讨论 AI 科学,它有时也被这样使用。取一个形状,用直线连接它的每一对点;得到的新形状就是包含原形状的最小凸形状:它的凸包。如今科学非常割裂:到处都是参差不齐的前沿。生物学朝一个方向突出,数学朝另一个方向。一个实验室可能花 20 年时间,用他们掌握的一种方法彻底研究一组基因,而邻近的基因和替代方法却无人问津。像 BootLoops 这样的工具链可以连接这些点,填补凸包。

Image of a convex hull with human knowledge at the center and gaps that are not filled in
今天的人类知识是参差不齐的——特定的科学家和子领域在某些方向上比在其他方向上推进得更多。中间区域,即人类能够触及但没有特定人类触及的地方,正是 AI 的理想用武之地。BootLoops 包中的 ACTUARY 或 NUMKIN 等特定软件包有助于填补这些空白。

事情变化得很快,几乎不可能提前规划。为什么要申请三年的经费去计算一个AI模型可能一夜之间就能解决的问题呢?我仍然不知道该如何培养研究生。自从我发表了那篇关于氛围物理学的文章以来,这种感觉只会变得更加强烈。在某些领域,比如计算机科学,这种颠覆简直令人恐惧。两年前,我会推荐“工程师Python”课程作为必修课。如今,它已经没有必要了。我花了大量时间在机器学习上,构建模型来研究各种物理现象。现在,所有这些模型都可以由AI构建,所以即使是学习神经网络的来龙去脉,用处也有限。只要告诉Claude找到最先进的机器学习方法,它就会为你完成。

我认为BootLoops表明,如果你找到了正确的问题,解决它的许多技术工作现在都可以自动化。从某种意义上说,这是一种解放。但概念性的部分仍然需要人类。正因为如此,我希望我们能找到一种方法,让人类即使对于Claude形态的科学也能得到应有的认可。奇怪的是,AI有可能颠覆通常的商业模式,即处于顶层的人获得荣誉,而亲自动手解决问题的人却一无所获。我不知道这会如何解决,但假装人类的贡献只是打字,是解决不了的。

那么,这让普通科学家Joe Scientist处于什么境地呢?如果你问我,实际上是一个很好的境地。我们现在触手可及的工具能够以闪电般的速度在看似棘手的问题上取得进展。我可以预见,在系统生物学等数据丰富但理论匮乏的领域,将会出现巨大的增长。我也很容易想象,人类思维将从繁琐的计算和分析中解放出来,去从事方向和指导等更深层次的智力工作。最重要的是,我期待科学家们走出自己的领域,去寻找协同与合作,就像我与BootLoops所做的那样。专注于Claude形态的科学最令人耳目一新的结果是,它帮助我们认识到人类形态的科学是什么样子。

BootLoops工具及其所支持的科学研究的详细信息可以在www.bootloops.ai找到。BootLoops工具已在GitHub上发布,供任何人使用和贡献。

致谢

如果没有我的人类同伴们的指导和合作,我与Claude和BootLoops产出的科学成果绝不会如此有趣:Isaiah Andrews、Nima Arkani-Hamed、Michael Desai、Scott Edwards、Noam Elkies、Cecilia Garraffo、Matthew Gordon、Thomas Grimm、Martin Hemberg、Mikhail Ivanov、David Johnston、Gary King、Paul Lewis、Brendan Meade、Amara McCune、Joe Pater、Subhabrata Sen、Siddharth Mishra-Sharma、James O’Dwyer、Kevin Ryan、Jesse Shapiro和Xiaoyuan Zhang。

披露

在这个项目期间,Schwartz一直在Anthropic担任访问研究员。BootLoops不是Anthropic的项目;它由Matthew Schwartz拥有和维护。

相关内容

机器人能做什么工作?

我们建立了一个指数,衡量当今机器人执行美国工作任务的能力。机器人已经可以完成四分之三的体力任务,大多是在有限的环境中,但仅在0.3%的任务上具有成本竞争力。

阅读更多

你想从AI那里得到什么?

我们正在使用 Anthropic Interviewer 启动一项新研究,旨在了解你与 AI 相处的经历,诚邀你参与。

阅读更多

GLM-5.3 与高级网络能力的扩散

与 Claude Mythos Preview 一样,GLM-5.3 具备自主构建端到端网络攻击漏洞利用程序的强大能力。但 GLM-5.3 与其他前沿模型不同之处在于,它发布时没有设置任何有意义的防护措施来限制滥用。

阅读更多

来源:Anthropic:Research · anthropic.com