跳到正文
北京时间
原文
Gary Marcus:The Road to AI We Can Trust(RSS)· Gary Marcus·· 2026-08-03精选AI 评分66

OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

OpenAI’s amazing — but vastly oversold — new model Astra

AI 导读

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。

推荐理由

从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

正文 · AI 翻译

Astra,这是 OpenAI 正在内部测试的一款新模型,令人惊叹。这一点无可否认:

第一部分:最大的谬误

但与此同时,一大群人——其中一些还相当有名——正四处奔走,就其影响提出一个存在严重缺陷的论点。

看看你能否发现这个谬误。以下是众多例子中的三个。

另一条推文甚至声称“该物种刚刚跨过了一道单向门槛”;Elon Musk 将其视为我们已经抵达奇点的证据。

它们本质上都在犯同一个错误。

这个谬误有个名字,叫做合成谬误。

关于它的维基百科条目里满是绝佳的例子;这里只举最前面的几个。

在当前这个案例中,这一谬误是如何体现的?就是认为一个擅长某类数学问题的系统,就擅长所有数学,擅长科学,甚至很可能擅长一切。“AGI 即将到来”的圈子一次又一次地犯下同一个逻辑谬误。每一次出现进展,我看到的都是同一个错误。

这个谬误是这样运作的。

1. 有人假装所有认知都是同等创造的。(完全不对。)

2. 每当 AI 在某种(高级的)认知形式上取得成功,他们就想让你相信,AI 在所有形式上的成功都近在眼前。

你不需要成为一名认知心理学家就能意识到,这个推论根本站不住脚。比如,我们都知道,数学方面的专长并不能保证在所有领域都是天才。一个擅长数学、物理或编程的人,可能在写作或理解人际关系方面举步维艰(反过来,一位伟大的作家也可能数学很差,等等)。在一个领域的专长,完全不能保证在所有领域、甚至大多数领域都具备专长。

这正是 Howard Gardner 和 Robert Sternberg 等人提出多元智能理论的原因,也正是 SAT 将数学与语言分开测试的原因,等等。

Astra 似乎——我们仍未看到其方法论——擅长数学,或者至少擅长某些形式的数学,但这并不意味着它能避免模型幻觉,也不意味着它能解决其他 GenAI 系统所存在的可靠性问题。它甚至不意味着它能可靠地读取 PDF。它也不意味着它将成为第一个能够遵守硬性规则的生成式 AI。(这一点应该让你感到恐惧。)

尤其是,Astra 显然在某些问题上表现出色;但这并不意味着它在难以形式化的问题上也会出色,甚至未必能胜任。这并不意味着它会拥有魔力。这并不意味着它是 AGI 或 ASI 或诸如此类的东西。

这*非常*令人印象深刻。但我完全看不出有任何理由认为 Astra 是 AGI,更不用说 ASI 了。如果它能在我与 Miles Brundage 的 2024 年赌约中拿到哪怕 5/10 的分数,我都会感到惊讶。

第二部分。有一个重要的、有原则性的理由让人认为,数学上的成功是一个特例,其泛化程度不会像人们期望的那么高。

如果(a)这个谬误不是如此普遍,并且(b)我不认为有充分理由相信这个谬误在此处适用,我就不会花这么长的篇幅来讨论它。

这些模型在数学领域大放异彩并非偶然。数学适合两件事:验证(使用符号工具),以及大量廉价生成的合成数据——在这些数据中可以保证答案是正确。编码同样如此——但这一点在一般情况下并不成立。你可以生成任意多的数学事实;你无法模拟开放式的世界。你可以验证数学;你无法以同样的方式验证一项军事战略。

这不是什么新闻。至少从 2025 年 1 月起我就一直在指出这一点[第一行本应说的是编码和数学],呼应了 Ernie Davis 和我在 2019 年关于围棋所说的话(以及为什么 AlphaGo 不会成为万能灵药):

OpenAI 能在数学上做到 Astra 所做的事,是因为数学允许外部工具进行验证并创建合成数据。

这并不会让 Astra 显得不那么令人印象深刻,但正如我们十年前从 IBM 那次混乱且最终失败的尝试中所学到的——它试图把曾在《Jeopardy!》中获胜的 Watson 变成一台抗癌机器——在一个领域取得成功,并不能保证在所有领域都能成功。

OpenAI 在这里所处理的那类数学,与许多(也许是大多数)现实世界问题有着根本性的不同——在那些现实世界问题中,验证既不能保证得到解,也无法让人有效地免费生成无限训练数据。

指望它成为一种万能溶剂,只能说明你不理解这个基本事实。

第三部分:关于 Astra 还需要知道的另外七件事

  1. 昨天的推文和博客是营销,不是科学。无论是这两者,还是随它们一同发布的 249 页数学文章,都没有提供任何关于这是如何实现的信息:

    在一封评论本文初稿的电子邮件中,Ernie Davis 十分恰当地补充道:

    要恰当评估这些发现的意义,我们需要一些
    关键信息。

    第一:尝试了多少个猜想?如果 OpenAI 团队是从所有尚未解决的重大数学猜想中随机挑选了这 10 个猜想,而 Astra 全部解出了这 10 个,那将非常了不起;但这似乎完全不太可能。如果他们精心挑选了 50 个他们认为 Astra 能成功解出的猜想,而它解出了其中 10 个,那仍然很了不起,但程度要低得多。如果他们让 Astra 跑遍了所有约 1000 个未解决的 Erdos 猜想以及另外 10,000 个未解决的猜想,那么它未能解出那些猜想,就是关于其作为数学推理器之局限的重要信息。

    第二:OpenAI 大声吹嘘这件事的总计算成本仅为 $2000。可以稳妥地推测,这只包括 Astra 成功解出的那些猜想,而不包括它失败的那些。但那些参与这个项目的高薪数学家和计算机科学家的工资成本又是多少?如果低于 $20,000,我会感到震惊;如果高达 $200,000 以上,我也不会感到意外。

    我们不知道这一点,而且照目前的发展态势,我们可能永远不会知道。对于在 2025 年国际数学奥林匹克竞赛中取得金牌表现的 OpenAI 系统,我们仍然一无所知;对于 Google 的系统,我们也知之甚少。

  2. Astra 擅长某些数学,但数学是否已被“解决”非常值得怀疑(正如 X 上很多人似乎相信的那样)。它似乎擅长某些类型的数学

    但很可能并非全部。以下是 Eric Weinstein 在 X 上给出的一些例子,涉及某些它可能不太擅长的数学领域

    Ernie Davis 还补充道:“自动形式化的问题——即把人类数学家书写的数学转化为严格逻辑形式——似乎还远未解决,尽管确实已经取得了进展。例如:过去两年里,数学家 Kevin Buzzard 一直在领导一个项目,用 Lean 形式化 Andrew Wiles 对费马大定理的证明。可以肯定地说,没有任何 AI 系统有能力完成这项艰巨的任务。想必如果它们能在无人协助的情况下做到,它们就会抢在他前面完成;而如果它们能把他的工作从数年缩短到数周,他早就会用上它们了。”

  3. 这与我的总体预测一致:数学能力并不能保证通用性,看来 Astra 的证明写作水平与证明本身并不匹配(这与 Ernie Davis 和我一年前在这里观察到的情况如出一辙)” [点击查看完整推文]

  4. 我严重怀疑 Astra 会奇迹般地解决当前模型中所有无法可靠运行的问题。它能可靠地从任意 PDF 中提取数字吗?我怀疑不能。它能满足 Sabine Hossenfelder 希望 AI 为她的 YouTube 系列撰写脚本[点击推文了解更多详情]的愿望吗?我怀疑不能。

  5. Astra 并不是(如 Musk 所暗示的)奇点。无需多言。(但请看我最近关于此话题的文章;情况并没有真正改变)。

  6. 声称 Astra 的首次亮相“很可能是数学史上最重要的一天”是荒谬的,正如一群人四处宣扬的那样,而他们的依据不过是 Fable 某一次运行中的一句引述(如果问它两次,它可能会给出不同的答案)。这里没有新理论,没有新技术,而且尽管它令人印象深刻,却根本无法与微积分、代数、对数、概率论、十进制、信息论、零的概念的发展相提并论。Davis 说:“从 Fable 引述的那句话——‘其中几项单独拿出来都足以成为这十年的成果’——是荒谬的……作为现实检验,自 1900 年以来,David Hilbert 的 23 个问题中已有 14 个被解决——也就是每九年一个——而这些成果根本不在那个级别上。你完全可以轻松列出一份自 1926 年以来被证明的 100 项重要得多的成果清单。”

  7. 我怀疑它不会直接带来癌症的治愈方法,也不会在“材料研究、能源生产、药物发现,一切领域”带来巨大进步,就像一些兴奋的 AI“网红”所设想的那样。这也不意味着我们刚刚进入了“自动化科学发现的时代”。面对这些过度夸张的说法……

……这个刚刚发布,呼应了我几天前链接的、由以及其他人撰写的新文章。

第四部分:总结

尽管昨天在 X 上遭到了巨大的反对(其中大部分是人身攻击,有些甚至涉及捏造,还有很多涉及彻头彻尾的谎言),我对 Astra 的总体热评仍然和我最初发布的一样:

令人遗憾的是,Ernie Davis 和我在一年前就提出了许多相同的观点,关于如何才能正确地审视新系统:

我理解人们对 Astra 感到兴奋,但任何期待奇迹的人很可能会失望。

来源:Gary Marcus:The Road to AI We Can Trust(RSS) · garymarcus.substack.com

相关事件