仅有三个AI模型在500天创业测试中盈利超过起始资本
Only three AI models finished above starting capital in a 500-day startup survival test
普林斯顿大学推出CEO-Bench基准测试,让AI智能体在模拟环境中运营订阅软件公司NovaMind 500天,起始资金100万美元。14个测试模型中,仅Claude Fable 5(最佳轮次盈利4715万美元)、Claude Opus 4.8(2780万美元)和GPT-5.5(2130万美元)在最佳运行中超过起始资本。一个不调用语言模型的简单规则启发式方法通过固定定价、配额和针对性开发达到1576万美元,超越除上述三款外的所有模型。多数模型无法保持连贯策略,在模拟结束前破产。该测试旨在衡量AI的长期战略决策能力。
普林斯顿的 CEO-Bench 测试了一个反直觉结果,一个不用 AI 的简单规则系统击败了绝大多数模型——在当前 agent 都在比窄任务时,这个测试直指长期战略决策的致命短板,做 agent 的必须看。

普林斯顿大学的研究人员构建了 CEO-Bench,这是一项让 AI 智能体在 500 个模拟日内运营一家虚构软件公司的测试。当前大多数模型都会破产,而一个不含 AI 的简单基于规则的启发式方法几乎击败了所有模型。
AI 智能体在狭窄任务上正变得越来越擅长:修复一个 bug、在对话中遵循某项服务政策,或完成一个基于网页的工作流。根据这项普林斯顿研究,这些任务都有一个简单的结构:智能体获得一个明确的目标,短暂行动,然后收到快速反馈。许多重要的现实世界任务与此截然不同。它们涉及不确定性下的长链条决策,你必须设定优先级、分配有限资源、解读嘈杂信号,并适应不断变化的条件。
为了专门测试这些技能,研究人员开发了 CEO-Bench。该基准模拟了这类长时程任务的一个现实示例:运营一家初创公司 500 个模拟日。
研究人员指出了一个著名的例子:1997 年,苹果距离破产仅剩 90 天。史蒂夫·乔布斯画了一个简单的两乘二网格——消费级与专业级、台式与便携——并决定苹果只为这四个象限打造产品。iMac、iPod 和 iPhone 随之而来。
作者们认为,这种战略掌舵智能与当今 AI 智能体所做的有着根本不同。智能体在单项任务上正快速进步。但引导整个组织朝着长期目标前进?那完全是一个不同的问题。CEO-Bench 正是衡量这种“掌舵智能”的首次尝试。
一家虚构软件公司的 AI CEO
在 CEO-Bench 中,一个智能体经营着一家名为 NovaMind 的虚构订阅制软件公司。公司起步时零客户、银行账户里有 100 万美元。评估标准是最终剩余的现金。如果余额哪怕有一次跌破零,公司就破产,模拟随即结束。
该智能体通过一个带有 34 个工具的 Python API 和一个包含 19 张表的数据库来掌控公司。它不只是发出单条命令,而是自己编写代码、用 SQL 查询数据库,并根据查询结果构建自定义工作流。研究人员表示,这使它面临与人类 CEO 相同的挑战。

需要决策的事情很多:定价与套餐层级、各渠道的广告支出、产品质量与研发、基础设施容量与客户支持,还有与企业客户的多轮谈判。除此之外,还有一个模拟社交网络,智能体可以在上面阅读投诉、竞争对手新闻和经济趋势,并自己发帖。
延迟反馈与隐藏变量让测试变得困难
这项任务之所以困难,在于时间与不确定性。决策要在真实的商业时间线上逐步显现结果:收入只有在账单日才会到账,研发项目需要数天到数周,而错误往往要到后来才通过客户流失或声誉受损显现出来。成本却是立刻发生的。智能体必须花钱,而回报可能数周都不会出现。
公司的大部分状态始终是隐藏的。智能体无法直接看到客户满意度、支付意愿或最低质量预期。它必须从取消订单、支持工单或社交网络上的反应等嘈杂信号中拼凑出这些信息。该模拟对 26 个客户细分群体和个体客户进行建模,每个群体和个体都有自己的预算、价格敏感度和预期。
世界也在不断变化。竞争对手会定期抬高客户的质量预期,偏好随时间推移而改变,模拟的商业周期会影响需求和支付意愿,因此智能体必须不断调整。
研究人员刻意选择了固定、透明的规则,而非用大语言模型充当裁判。他们希望避免在 Vending-Bench 中看到的一个弱点,那是一个带有模拟自动售货机的测试:在那里,一个由 AI 模拟的供应商可能会因为智能体不切实际的口头承诺而给予其奖励。
大多数模型都会破产
在十四个受测模型中,大多数都未能完成这项任务。几乎所有这些模型都能生成有效的命令和数据库查询,但没有任何一个能在长时间内维持连贯的策略。许多模型在模拟结束前就已破产。
只有三个模型的最佳一轮跑完了之后高于一百万美元的起始资金:Claude Fable 5 达到 4715 万美元,Claude Opus 4.8 达到 2780 万美元,GPT-5.5 达到 2130 万美元。Claude Fable 5 是唯一一个在不止一轮中高于起始资金的模型。
不过有一个需要注意的地方。Fable 5 有一轮因为模型拒绝继续而中止,而在另外两轮中,部分请求回退到了 Opus 4.8。GPT-5.5 在其三轮中有两轮破产。

最有说服力的对比对象是一个简单的基于规则的启发式方法,它完全不调用任何大语言模型。它设定固定价格、配额和层级,将广告投放和定向开发集中在少数几个客户细分群体上,并根据近期使用情况调整产能。这个启发式方法达到 1576 万美元,击败了除 Fable 5、Opus 4.8 和 GPT-5.5 之外的每一个模型。
研究人员还粗略估计,可实现的最终现金上限约为 22 亿美元。即便是最好的智能体也远远达不到。作者表示,这项测试远未触及上限。
探索胜过谨慎
分析决策轨迹可以揭示出明显的行为差异。GPT-5.5 和 Claude Opus 4.8 会随着条件变化不断尝试新策略,无论是加大客户获取力度、调整定价层级,还是重新分配支持与研发预算。相比之下,Claude Opus 4.7 面对挫折时大多通过削减成本和保留现金来应对。这种被动的方式让该模型能够存活到最后,却无法实现盈利。
有趣的是,Opus 4.8 和 GPT-5.5 通过截然不同的路径达到了相似的最终结果:Opus 4.8 在早期获取了更多客户,但在模拟中途客户数降至零,而 GPT-5.5 则始终维持住了自己的客户群。两者都编写出了出人意料地精密的代码。Opus 4.8 构建了自己的内部模拟,对客户群体进行建模以预测未来现金流。GPT-5.5 则深入挖掘数据库中的谈判历史,以发现隐藏的客户偏好。
研究人员衡量了四项与成功相关的能
- 发现隐藏信息的能力,比如哪种广告渠道对特定客户群体最有效,
- 预测未来的能力,以四周现金流预测的误差来衡量,
- 快速适应变化的能力,以模型多快察觉到竞争对手的动向来衡量,
- 以及提前规划的能力,部分以 if-then 情景在智能体笔记中出现的频率来衡量。
在这四项上,Opus 4.8 和 GPT-5.5 的得分均高于其他模型的平均水平。
工具环境也很重要
另一项发现涉及智能体用来执行操作的软件环境。研究人员还测试了搭配 Claude Code 的 Claude Opus 4.7 以及搭配 Codex 的 GPT-5.5,这两款都是流行的编程助手。在两种情况下,智能体的行动频率都远低于预期,表现也更差。研究人员怀疑,原因是这些工具中为软件开发而调优的系统提示词。
缩短时间跨度也无法解决这个问题。当模拟被压缩到 50 天时,只有 GPT-5.5 能够实现盈利。研究人员得出结论,大多数模型即便面对短期目标,在协调决策方面依然薄弱。
作者承认他们的实验设置存在局限。产品仅用一个质量分数来表示,因为他们找不到可靠的方法来评估定性的产品变化。合规、安全和融资被排除在外,以保证每次运行在经济上可行。尽管如此,他们表示,CEO-Bench 揭示了当今模型的局部工具能力与将长时间跨度内的行动串联成连贯战略的能力之间的差距。
来源:The Decoder:AI News(RSS) · the-decoder.com