跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2026-07-17精选AI 评分64

OpenAI 提出 AI 时代记分卡:“有用智能每美元”衡量实际工作价值

A scorecard for the AI age

AI 导读

OpenAI 提出“Useful Intelligence per Dollar”(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。

推荐理由

OpenAI 自己下场给 AI 投入算账,提出「每个美元的有用智能」框架,对正在量化 AI 价值的 CFO 和产品负责人是一份及时的决策参考。但文章本质是理念输出,落地还需企业自己填数据和流程。

正文 · AI 翻译

我听到各地 CFO 提出的问题很简单:我们如何从 AI 支出中获得更多价值?

多年来,市场通过采用率来衡量软件的成功:购买的席位、活跃的用户、续订的许可证。而理解 AI 的价值,需要一种更强大的衡量标准:完成的工作。

CFO 和其他业务领导者面临的基本经济问题是,AI 完成工作的价值增长速度是否快于其生产成本。

要回答这个问题,需要比每 token 成本之类的指标看得更深。成本更低的模型可能 token 更便宜,但要获得出色的结果可能需要更多次尝试、更多时间或更多人工审核。能力更强的模型可能 token 更贵,但能一次完成同样的任务。真正重要的是产生一个成功结果的全部成本,并对照该结果所创造的价值来衡量。

AI 时代的终极记分卡可以看作是"每美元的有用智能"。这一指标回答了四个关键问题:

  1. AI 是否在完成重要的工作?
  2. 每个成功任务的成本是多少?
  3. 人们能否信赖结果?
  4. 随着使用量增长,每一美元 AI 支出是否产生更多价值?

1. 完成了多少有用的工作?

从工作本身开始。

AI 帮助解决了多少客户问题?帮助交付了多少代码变更?审查了多少份合同?为人们节省了多少时间?有多少决策因为正确的上下文在正确的时刻可用而得到改善?

Token 在转化为人们可以使用的工作成果时才会创造价值。随着模型能力不断增强,它们能够承担更长、更复杂的任务:维持上下文、进行多步推理、跨工具协作,并在过程中不断调整。

最好的起点是从一个工作流开始。定义什么算“完成”,并在工作实际发生的系统中衡量这一结果。

对于支持团队来说,“完成”可能意味着一个客户问题得到解决。对于工程团队来说,可能意味着一个通过测试的代码变更。对于法务团队来说,可能意味着一份合同被准确且按时地审查完毕。

设想一个财务团队正在准备预测评审。大量工作发生在最终决策做出之前:找到最新的预测、将数据导入 Excel 或 Sheets、识别变化、核对各个标签页、重建幻灯片,并检查所有数据是否完全对得上。

ChatGPT Work 可以承担其中大部分流程,让团队有更多时间专注于真正重要的问题:发生了什么变化?为什么?接下来该怎么做?

这才是实践中每一美元换来的有效智能。更多工作得以更快完成,而人们可以把更多时间用于运用判断力、创造力和专业能力。

2. 一项成功完成的任务实际成本是多少?

下一个问题是,要高质量完成这项工作需要多少成本。

AI 任务差异很大。一个快速回答可能只需很少算力。而编码、研究或财务工作流可能涉及更深层的推理、工具调用和大量操作。这些更复杂的任务可能需要更多算力,但它们能创造的价值也大得多。

在模型层面,每项成功任务的成本取决于价格、所用算力以及得到正确结果的概率。对企业而言,完整成本还包括员工时间、人工审核、重试和返工。

计算方式很直接:

  • 将完成这项工作的全部成本相加。
  • 统计达到所需质量标准的任务数量。
  • 用全部成本除以成功任务的数量。

这就是为什么每 token 价格最低并不总能带来每项成果成本最低。即使是常规请求,前沿模型也可能带来最佳性价比——如果它能一次就给出正确答案,就能减少重试、延迟、审核和总算力消耗。

分层级的模型家族让客户有更多方式来优化这一等式。我们上周发布的 GPT‑5.6 包含三个层级:Sol 是我们的旗舰;Terra 平衡性能与成本;Luna 是我们最快、最实惠的模型。

这些层级提供了有用的起点。完整任务的经济性最终应决定正确的模型选择。客户可能会用 Luna 处理快速、高并发的流程,用 Terra 处理需要更高深度的工作,或在更强的推理能以更少尝试带来最佳结果时使用 Sol。

我们训练 GPT‑5.6,是为了让每一个 token 产出更有用的工作。在 Artificial Analysis Coding Agent Index 上,采用最大推理强度的 GPT‑5.6 Sol 创下新的 state of the art,同时比另一款领先模型少用 54% 的输出 token。下图展示了这一对比。

DeepSWE v1.1:长时程工程任务;GPT‑5.6 Sol 达到 72.7% 的新高,高于 Claude Fable 5 的 69.9%,同时预估 API 成本低 36.2%。

在整个 GPT‑5.6 家族中,目标是一致的:每一美元带来更多成功完成的工作。更高的效率让现有任务更实惠。更强的能力让全新类型的工作成为可能。

每一代新模型都应改善这一等式的两端。客户应能完成更有价值的工作,同时完成每项任务的成本持续下降。

3. AI 做对工作的频率有多高?

第三项衡量指标是可靠性。

AI 的采用往往分阶段深化。首先,AI 帮助起草。然后,它跨工具和数据寻找上下文并进行推理。随着时间推移,它开始采取行动、处理异常并完成工作流,而人在需要时提供判断和控制。

每一步都创造更多价值,也对系统提出更高要求。

可靠性具有直接的经济价值。当结果准确、来源可靠、一致且能适当升级处理时,人们花在审查、纠正和重复工作上的时间就会减少。成功完成的任务成本更低,组织也更有信心将 AI 用于更重要的工作流。

团队可以通过跟踪三项结果来将其具体化:

  • 可直接使用:交付的结果达到了质量标准。
  • 需要纠正:结果需要再次尝试或人工编辑。
  • 需要升级处理:需要有人介入并完成工作。

这些衡量指标比单纯的模型准确率能讲述更丰富的故事。它们展示了 AI 是否真正减少了完成项目所涉及的工作量。

可靠性还需要明确的边界。在 AI 从起草转向采取行动之前,组织应界定:

  • 系统可以访问哪些数据。
  • 它可以使用或更改哪些系统。
  • 何时应由人工审查或批准某项操作。

安全、保障、隐私和控制为更深入的使用奠定了基础。人们需要了解系统的行为方式、其数据如何处理,以及其操作如何受到管控。

ChatGPT Work 建立在 ChatGPT Enterprise 的安全、隐私、合规和工作区管理基础之上。这使组织能够为 AI 提供更多上下文并接入更有价值的工作流,同时保持适当的监督。

能力赢得首次使用。可靠性让 AI 成为工作完成方式的一部分。

4. 随着使用量增长,每一美元 AI 投入是否能带来更多工作产出?

最后一个问题是,经济效益是否会随规模扩大而改善。

企业可以通过长期跟踪同一工作流来衡量这一点。追踪有多少任务达到了质量标准、完成这些任务的总成本,以及每个成功任务的成本。如果完成的工作量增长快于总成本,同时质量保持或提升,那么每一美元 AI 投入就在创造更多价值。

算力处于这一方程式的核心。

算力驱动着研究以及 AI 完成的每一项任务。它决定着产品质量、速度、可靠性、可用性和成本。训练算力构建未来能力。推理算力交付当下有用的工作。两者都应转化为对客户更好的结果。

更好的模型、更高效的推理、专用硬件、更高的利用率、更智能的路由以及更强的产品设计,都能提升算力的回报。每一代基础设施都有助于训练出能力更强的模型。而更好的算法、硬件和软件,则有助于更高效地服务这些模型。

客户以人的视角体验这些改进:更好的答案、更快的结果、更少的纠正、更可靠的产品,以及完成所需工作的更低成本。

这些收益会不断累积。更好的基础设施加速研究。研究产出能力更强、更高效的模型。更好的模型改进产品。更好的产品推动采用、学习和收入。这种增长支撑着对下一代研究、算力、部署和安全的持续投入。

OpenAI 通过一个共享的智能平台将这些环节汇聚在一起。人们通过 ChatGPT 和 ChatGPT Work 使用它。开发者通过 Codex 和 API 基于它进行构建。企业将它部署到工作发生的系统中。

当某一层得到改进时,每一款产品和每一位客户都能从中受益。

AI 时代的记分卡

综合来看,这四项指标告诉我们,每一美元所能换来的有用智能是否在提升。

有用工作量告诉我们 AI 产出了什么。每个成功任务的成本告诉我们达到结果需要付出什么。可靠性告诉我们人们能够放心使用其中多少工作成果。规模化价值则告诉我们,每一美元、每一单位算力是否随着时间推移能完成更多事情。

目标是让 AI 帮助人们做更有意义的工作、做出更好的决策,并把更多时间花在那些需要人类独有判断力和创造力的工作环节上。

我们的职责就是让这个等式在每一代都变得更好:能力更强的模型、更快更可靠的结果,以及为客户需要完成的工作降低的成本。

这正是 AI 随着时间推移对更多人和更多组织变得更有用的方式。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com