跳到正文
北京时间
原文
Microsoft AI:官方博客(网页)·· 2026-07-30精选AI 评分67

Microsoft 发布 MAI-Cyber-1-Flash 等多款 Flash 模型,以 token 效率优化成本曲线

Optimizing the frontier performance curve

AI 导读

Microsoft AI 发布 MAI-Cyber-1-Flash,与 MDASH 搭配在 CyberGym 上取得 96%(any crash score),成本仅为现有最佳方案的 50%,可部署在 H100 上,负责 90% 的常规任务以便为最难 10% 保留 GPT 5.4。

推荐理由

官方公布了多款针对具体产品调优的 MAI Flash 模型及其在各业务线节省 GPU 成本的实测数字,可了解按任务分层选模型的做法。

正文 · AI 翻译

过去几个月的主旋律一直是 Tokenmaxxing,但 token 效率将成为整个行业的下一个重点。我们如何才能在每投入一个 token 的情况下获得最佳性能,并在每投入一美元的情况下获得最佳的客户实际成果?

要打造一家前沿公司,你必须针对成本优化前沿性能。选择你想处在这条曲线上的哪个位置至关重要。通过协同优化你的模型、harness 和 RLE,你可以挑选出适合你公司的曲线上的某个点。

在大多数情况下,并非每项任务都需要前沿通用模型。通过针对特定产品调优模型,你可以保持甚至超越前沿性能,同时大幅降低 token 成本。

这正是我们过去一个季度将 MAI 爬山机器聚焦的方向,结果相当酷。本周我们发布了针对我们的 MDASH harness 优化的 MAI-Cyber-1-Flash。

两者结合,该系统在 CyberGym 上达到 96%(以该基准的 any crash 分数计;在 CyberGym 排行榜上超越 Mythos),成本仅为 50%,对比的是我们目前在 MDASH 中的最佳方案。而且值得注意的是,我们还能在 H100 上提供服务。

它被设计为高效处理多达 90% 的任务,这样 MDASH 就能把我们集群中最大、最昂贵的模型(在本例中是 GPT 5.4)保留给那 10% 真正需要它们的异常难题。

正如 Satya 今天在我们的第四季度财报电话会议上提到的,自上季度以来,我们已在图像、语音、转录、编码和安全领域发布了十几款新模型,它们已经在为微软许多最广泛使用的产品提供支持,在保持或提升质量的同时显著减少了 token 使用量,在许多情况下节省了 50-90% 的 GPU 成本:

  • 我们与 GitHub 的同事携手打造了 MAI-Code-1-Flash,自六月以来,已有数百万开发者在日常工作中使用它。在 VS Code 中,相比 GPT-5.4 Mini 和 Claude Haiku 4.5,代码接受率提高 10%,中位 token 使用量降低 10%,并且已经显示出留存率的提升。
  • 随后,我们在 Excel RL 环境中训练了同一个检查点,使其在最常见的任务上达到与 GPT-5.6 相当的性能,同时更具成本效益,而且小到可以在 A100 或 H100 上提供服务,而不仅仅是最新、最昂贵的加速器。
  • MAI-Image-2.5-Flash 现已成为 Bing Image Creator 的端到端默认模型,在 PowerPoint 中投入生产,相比 GPT-Image-2 将 GPU 成本降低多达 84%,并且是 OneDrive 关键编辑场景的默认模型,在这些场景中它将保存率提高了 26%,并带来高达 2.5 倍的 token 效率提升。
  • MAI-Voice-2-Flash 现为 Dynamics 365 Contact Center 提供支持,T-Mobile 和 EasyJet 等客户在此构建他们的呼叫中心智能体,将 GPU 成本降低多达 89%。
  • MAI-Transcribe-1.5 现为 Dragon Copilot 的多语言工作流提供服务,覆盖 58 种语言——该解决方案被 170,000 名医疗提供者使用,上季度处理了 2800 万次患者就诊,我们的测试显示,转录和语言识别错误率相对降低了 50%。

更重要的是,通过将我们的模型与我们自己的芯片协同设计,我们发现在 Maia 200 上运行 MAI 模型时,每瓦性能提升了 40%。

但好处不仅仅是成本。还有韧性。如今每家企业都必须假设它所依赖的任何一款模型都可能消失,原因可能是安全事件、业务或政策错位,或是地缘政治变化。

产品或智能体系统中的每个模型都应当是可替换的,而只有当你在构建 harness、上下文、记忆和动作空间时独立于单一模型家族,这才成为可能。这就是我们打造的那台爬山机器。

我们认为这是一条真正全新性能曲线的开端。它的形态代表的是一个系统,而非一个模型,沿着这条曲线前进将带来更优的质量、更低的成本和更多的选择。

这个夏天,团队付出了艰苦而精彩的努力。我们深知这一切还多么早期,也深知我们仍有太多需要学习。但方向是清晰的:我们正在爬山,以推动成本-成果曲线上的前沿,我们也会一路持续分享所学到的东西。未来还有更多值得期待。

来源:Microsoft AI:官方博客(网页) · microsoft.ai