Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高
Working at the frontier: How Cursor knew Claude Fable 5 was ready for the hardest 1% of problems
Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。
Cursor 工程师用自家基准和太空模拟器实打实测试了 Claude Fable 5,从全局推理到自主规划路径的能力跃迁很具体,做编码 agent 的可以看看这个‘p99 问题’解法。
Nate Schmidt 在 Cursor 的工作,是评估前沿模型应对长期、真实世界工程问题的能力。以下是 Claude Fable 5 为何——以及如何——改变了人们对编程智能体能力上限的判断。
Cursor 是一款用于构建专业软件的 AI 编程智能体。它同时支持所有主流前沿模型以及 Cursor 自研模型,这让该公司成为评判各模型实际表现的格外中立的裁判。
Nate Schmidt 就是维护这份评分表的工程师。他在 Cursor 负责评估与模型行为研究:研究模型如何成功、如何失败,以及是什么让开发者在任务进行到一半时悄悄换用别的模型。当同事和客户想了解某个新发布版本的表现时,都会来找他。
随着时间推移,Schmidt 的团队注意到,公开基准测试的分数与开发者对这些模型的真实反馈已经不再吻合,于是他们打造了自己的评测:CursorBench。
CursorBench 的构建初衷,是捕捉工程师在现实中给模型写提示词时那种杂乱、信息不完整的方式。其中一项评测任务只是粘贴一段堆栈跟踪,外加一个词“fix”,模型必须自行推断意图、找到根本原因并验证改动。另一项任务则告诉模型错误的模块出了问题,以此观察它是会质疑用户的假设,还是会顺着假设一路走进死胡同。
当 Claude Fable 5 运行这项评测时,该模型在 Max effort 下取得了 72.9%,创下新高,也展现了智能体编程工具在搭配合适模型时所能达到的能力。

Claude Fable 5 在 Max effort 下达到了 72.9%,创下新高。
但当 Schmidt 将模型用于自己的工程工作流和个人测试时,他不再需要反复重申自己的目标。那种持续的看护——提醒模型上下文、把解决方案一步步讲清楚、审查结果——已经不再必要了。他可以把一个问题直接交出去,从他一直拖延的棘手重构,到对微妙边界情况的推理,Claude Fable 5 都能解决。
“我不再觉得自己必须引导 Claude Fable 5 去理解我所处的世界以及我试图解决的问题,”Schmidt 说。“这个模型开箱即用,就能对它有所感知。”
对整个任务进行推理
当 Schmidt 的团队让一个新模型跑 CursorBench 时,得出正确答案只是基本门槛。他们真正评分的是,模型是否理解了它被要求做什么。
“很多评测看起来是这样的:这里有一个定义明确的问题,这些是约束条件,去把它修好。但我们从真实用户那里收到的提示词,其实并不长这样,”Schmidt 说。“模型必须推断出用户遇到了一个问题、他们想表达什么,找出根本原因,修复它,验证修复,然后汇报结果。”
Claude Fable 5 在这些模糊任务上得分太高了,以至于 Cursor 团队开始感到怀疑。
“正在发生两种情况之一:要么模型非常聪明,要么模型在作弊,”他说。于是团队深入研究了推理轨迹,阅读模型在最困难任务上的实际推理过程——那些提示词看起来很简单、但要破解却需要理解整个系统的任务。
“我们不断看到这个模型拿下此前没有任何其他模型能做到的胜利,”他说。而且它用更少的运算量就达到了目标:相对于它所完成的工作而言,token 效率很高。
接着,Schmidt 把 Claude Fable 5 放到了他最喜欢的个人测试之一上:登月。
几周前,他把 Claude Opus 接入一个可编程太空飞行模拟器,只给了一句提示词——造一枚火箭,把它降落在月球上——然后让它在第二台显示器上跑了十二到十六个小时。模型会发射升空,在轨道上耗尽燃料,于是加了很多燃料,结果又因为火箭太重而无法飞出大气层。
他用同样空白的提示词重新跑了这个实验,这次用的是 Claude Fable 5。几分钟后,火箭升空,停泊在低轨道,然后返回地面。和之前一样的失败。接着 Schmidt 读了对话记录。
“Fable 决定第一次尝试不去月球。它想先执行一次初始任务,只进入轨道并收集遥测数据,然后用这些数据来指导下一次飞行。”几次尝试之后,他第二台显示器上的引擎噪声停了。月球上出现了一台着陆器。整个运行只花了几个小时,而 Opus 跑了十二个多小时却毫无结果。
“用 Opus 时,它做的是局部推理——思考刚刚发生了什么、接下来马上要发生什么,”Schmidt 说。“而用 Fable,它做的是全局推理。它会思考整个任务。”

Cursor 让所有模型都跑一遍 CursorBench,这是他们内部的基准测试,用于在模拟真实开发者工作的任务上评估模型。
何时该追求全局最优
对于何时该用 Claude Fable 5 而非更便宜、智能程度更低的模型,Schmidt 已经定下了一条简单的规则。
“如果你对从 A 到 B 的路径长什么样心里有数,你可能不需要 Fable。如果你身处 A,却完全不知道 B 在哪里,Fable 是绝佳选择,”他说。“当我想以正确的方式构建某样东西时,Fable 是我第一个想到的模型。”
Claude Fable 5 还让他的团队得以专注于此前被搁置的项目——那些大家都认同重写会更好、却没人能证明值得花上数周时间的重写——因为这个模型能承担起足够多的骨架工作。“它降低了处理这类任务的活化能,”Schmidt 说。“它让我们能够去追寻全局最优,而非局部最优。”
这也改变了团队的协作方式。Cursor 保持精简,强调强烈的个人负责制,站会很少。如今,在改动共享代码之前,Schmidt 会让一个智能体读取队友近期的提交并标记冲突,这样两人都不必停下手中的工作去同步。
为了平衡成本与性能,他的团队将 Claude Fable 5 与更快、更轻量的模型搭配使用,用于处理日常任务,而在能力成为瓶颈的问题上则引入 Claude Fable 5。他说,在这种配置下,这一组合是他们运行过的最有效的方案。
“如果我遇到一个非常棘手的问题——问题中的 p99——我想要优化的目标是解决时间,”他说。“而且我认为 Fable 是解决我们最困难问题的最佳模型。”

Nate Schmidt 在各种评估中测试新模型,包括将其放入太空飞行模拟器中接受考验。
下一步是什么
尽管在 CursorBench 上对模型进行了充分测试,甚至把它送上了月球,Schmidt 仍在寻找 Claude Fable 5 的极限。接下来,他想看看这个模型能在无人值守的情况下管理后端系统多长时间;持续数天到数周的运行是他的下一个实验。在 Cursor 内部,团队正在使用该模型主动寻找性能瓶颈和用户痛点,而不是等待报告,并构建更复杂、更接近现实的评估环境,用以衡量未来出现的一切。
“有一类问题人们甚至都没有考虑过,因为看起来无从下手,”他说。“有了 Fable,我很兴奋能去攻克它。”
开始使用Claude Fable。
来源:Claude:Blog(网页) · claude.com