Artificial Analysis 发布对 OpenAI 新模型 GPT-6.1 Sol 的评测,其 Intelligence Index 得分仅比 GPT-6 Astra 低 1 分,max effort 下每任务成本 $0.72,不到 GPT-6 Astra($3.26)的四分之一。
GPT-6.1 Sol 在仅仅 7 天后就取代了 GPT-6 Sol。它在 Intelligence Index 上比 GPT-6 Astra 低 1 分,而每任务成本不到其四分之一。
定价与 GPT-6 Sol 相同,为每百万输入/输出 token $2/$10,只是缓存读取折扣从 90% 提高到 95%。因此,GPT-6.1 Sol 在 agentic 工作负载上的整体混合价格略低于 GPT-6 Sol。这代表着继 GPT-6 Sol 最初从 GPT-5.6 Sol 降价 50% 之后的又一次降价。
关键要点:
➤ 达到接近 Astra 的智能水平:GPT-6.1 Sol 在 Intelligence Index 上相比 GPT-6 Sol 提升 4 分,相比 GPT-5.6 Sol 提升 5 分——仅比 GPT-6 Astra 低 1 分。它在 agentic 知识工作方面取得显著进步,在 AA-Briefcase v1.1 和 GDPval-AA v2.1 中分别提升 4 分和 5 分。其他显著提升包括 Terminal-Bench 4.0 跃升 12 分、Humanity’s Last Exam 跃升 5 分、GDP.pdf 跃升 6 分,以及 AA-Omniscience Accuracy 跃升 8 分,同时幻觉率从 60% 降至 54%。
➤ 推动成本效率前沿:在最大 effort 下,GPT-6.1 Sol 每个 Intelligence Index 任务的成本不到 GPT-6 Astra 的四分之一($0.72 对 $3.26)。它的每任务成本也比 GPT-6 Sol($1.05)低 31%,比 GPT-5.6 Sol($1.99)低 64%。GPT-6.1 Sol 的所有 effort 水平都推进了成本效率帕累托前沿:在给定智能水平下,没有更便宜的模型。
➤ 推动 token 效率前沿,但输出 token 使用量略高于 GPT-6 Sol:在各 effort 水平下,GPT-6.1 Sol 使用的输出 token 比 GPT-6 Sol 多约 10-30%。然而,由于 Intelligence Index 分数的提高,其低和中等 effort 水平在 token 效率方面是帕累托最优的。
➤ Coding Agent Index 提升:在 Artificial Analysis Coding Agent Index 中,GPT-6.1 Sol 在最大 effort 下相比 GPT-6 Sol 提升 3 分,并比 GPT-6 Astra 低 2 分。
祝贺 @OpenAI 和 @sama 发布!
来源:Artificial Analysis · x.com