| 01 | Claude Opus 5.5Anthropic上线 2026-09-17 · 持续积累缓存输入 ¥1.34输入 ¥26.84 · 输出 ¥134.21 | | 10 项评测持续积累 | ¥1.34 | ¥26.84 | ¥134.21 | 95.0 |
| 02 | GPT-6 AstraOpenAI上线 2026-09-03 · 较充分缓存输入 ¥6.71输入 ¥67.1 · 输出 ¥335.52 | | 20 项评测较充分名次浮动范围2—4 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥6.71 | ¥67.1 | ¥335.52 | 94.5 |
| 03 | Claude Fable 5.1Anthropic上线 2026-09-01 · 持续积累缓存输入 ¥1.68输入 ¥67.1 · 输出 ¥335.52 | | 17 项评测持续积累名次浮动范围2—3 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.68 | ¥67.1 | ¥335.52 | 94.5 |
| 04 | Claude Fable 5Anthropic上线 2026-06-09 · 持续积累缓存输入 ¥6.71输入 ¥67.1 · 输出 ¥335.52 | | 19 项评测持续积累名次浮动范围3—5 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥6.71 | ¥67.1 | ¥335.52 | 94.1 |
| 05 | Claude Opus 5Anthropic上线 2026-07-24 · 较充分缓存输入 ¥3.36输入 ¥33.55 · 输出 ¥167.76 | | 20 项评测较充分名次浮动范围4—5 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥33.55 | ¥167.76 | 94.0 |
| 06 | Muse Spark 1.3Meta上线 2026-09-02 · 较充分缓存输入 —输入 ¥8.39 · 输出 ¥28.52 | | 16 项评测较充分 | — | ¥8.39 | ¥28.52 | 91.8 |
| 07 | GPT-6 SolOpenAI上线 2026-09-22 · 证据敏感缓存输入 ¥1.34输入 ¥13.42 · 输出 ¥67.1 | | 11 项评测证据敏感名次浮动范围7—13 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.34 | ¥13.42 | ¥67.1 | 89.5 |
| 08 | GPT-5.6 SolOpenAI上线 2026-07-09 · 较充分缓存输入 ¥2.68输入 ¥26.84 · 输出 ¥134.21 | | 20 项评测较充分名次浮动范围8—9 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥2.68 | ¥26.84 | ¥134.21 | 88.4 |
| 09 | Grok 4.7xAI上线 2026-09-21 · 证据敏感缓存输入 ¥3.36输入 ¥13.42 · 输出 ¥40.26 | | 11 项评测证据敏感名次浮动范围9—29 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥13.42 | ¥40.26 | 86.2 |
| 10 | XMiMo V 2.6 ProXiaomi上线 2026-09-21 · 证据敏感缓存输入 —输入 — · 输出 — | | 6 项评测证据敏感名次浮动范围10—11 名在 70 个对照情景中重新检查资格后的名次。 7 个情景下参评证据不足。不是置信区间。 | 待核验 | 待核验 | 待核验 | 85.0 |
| 11 | Qwen3.8 MaxAlibaba上线 2026-07-19 · 较充分缓存输入 —输入 ¥12 · 输出 ¥36 | | 18 项评测较充分名次浮动范围10—12 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | — | ¥12 | ¥36 | 83.7 |
| 12 | GLM-5.3Z.ai上线 2026-08-18 · 证据敏感缓存输入 ¥1.74输入 ¥9.39 · 输出 ¥29.53 | | 19 项评测证据敏感名次浮动范围11—18 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.74 | ¥9.39 | ¥29.53 | 80.6 |
| 13 | Grok 4.6xAI上线 2026-08-12 · 证据敏感缓存输入 ¥3.36输入 ¥13.42 · 输出 ¥40.26 | | 18 项评测证据敏感名次浮动范围12—24 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥13.42 | ¥40.26 | 78.9 |
| 14 | Kimi K3Moonshot AI上线 2026-07-16 · 证据敏感缓存输入 ¥2输入 ¥20 · 输出 ¥100 | | 19 项评测证据敏感名次浮动范围10—15 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥2 | ¥20 | ¥100 | 78.0 |
| 15 | GPT-5.6 TerraOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥1.34输入 ¥13.42 · 输出 ¥80.53 | | 20 项评测证据敏感名次浮动范围14—27 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.34 | ¥13.42 | ¥80.53 | 75.7 |
| 16 | Claude Opus 4.8Anthropic上线 2026-05-28 · 证据敏感缓存输入 ¥3.36输入 ¥33.55 · 输出 ¥167.76 | | 20 项评测证据敏感名次浮动范围15—18 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥33.55 | ¥167.76 | 74.1 |
| 17 | Gemini 3.8 FlashGoogle上线 2026-09-02 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.16 | | 20 项评测证据敏感名次浮动范围8—18 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.16 | 73.5 |
| 18 | Qwen3.8 Max 0902Alibaba上线 2026-09-01 · 证据敏感缓存输入 —输入 ¥12 · 输出 ¥36 | | 7 项评测证据敏感名次浮动范围9—19 名在 70 个对照情景中重新检查资格后的名次。 5 个情景下参评证据不足。不是置信区间。 | — | ¥12 | ¥36 | 73.2 |
| 19 | GLM-5.3 FlashZ.ai上线 2026-08-26 · 证据敏感缓存输入 ¥0.23输入 ¥0.8 · 输出 ¥2.8 | | 17 项评测证据敏感名次浮动范围16—35 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.23 | ¥0.8 | ¥2.8 | 72.6 |
| 20 | Claude Opus 4.7Anthropic上线 2026-04-16 · 证据敏感缓存输入 ¥3.36输入 ¥33.55 · 输出 ¥167.76 | | 18 项评测证据敏感名次浮动范围14—21 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥33.55 | ¥167.76 | 71.6 |
| 21 | Qwen3.8 Flash NextAlibaba上线 2026-08-26 · 证据敏感缓存输入 —输入 ¥0.8 · 输出 ¥2.7 | | 5 项评测证据敏感名次浮动范围20—22 名在 70 个对照情景中重新检查资格后的名次。 7 个情景下参评证据不足。不是置信区间。 | — | ¥0.8 | ¥2.7 | 70.0 |
| 22 | Muse Spark 1.2Meta上线 2026-08-05 · 证据敏感缓存输入 —输入 ¥8.39 · 输出 ¥28.52 | | 14 项评测证据敏感名次浮动范围15—23 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | — | ¥8.39 | ¥28.52 | 68.6 |
| 23 | DeepSeek V4.1 FlashDeepSeek上线 2026-09-10 · 证据敏感缓存输入 ¥0.0403输入 ¥2.01 · 输出 ¥8.05 | | 12 项评测证据敏感名次浮动范围20—26 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.0403 | ¥2.01 | ¥8.05 | 65.9 |
| 24 | Gemini 3.7 FlashGoogle上线 2026-08-13 · 证据敏感缓存输入 ¥0.5输入 ¥5.03 · 输出 ¥25.16 | | 18 项评测证据敏感名次浮动范围7—24 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.5 | ¥5.03 | ¥25.16 | 65.5 |
| 25 | GPT-5.4OpenAI上线 2026-03-05 · 证据敏感缓存输入 ¥1.68输入 ¥16.78 · 输出 ¥100.66 | | 12 项评测证据敏感名次浮动范围22—26 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.68 | ¥16.78 | ¥100.66 | 62.1 |
| 26 | Grok 4.5xAI上线 2026-07-08 · 证据敏感缓存输入 ¥2.01输入 ¥13.42 · 输出 ¥40.26 | | 18 项评测证据敏感名次浮动范围23—30 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥2.01 | ¥13.42 | ¥40.26 | 59.9 |
| 27 | GPT-5.5OpenAI上线 2026-04-23 · 证据敏感缓存输入 ¥3.36输入 ¥33.55 · 输出 ¥201.31 | | 19 项评测证据敏感名次浮动范围11—27 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥3.36 | ¥33.55 | ¥201.31 | 59.7 |
| 28 | Claude Sonnet 5Anthropic上线 2026-06-30 · 证据敏感缓存输入 ¥1.34输入 ¥13.42 · 输出 ¥67.1 | | 20 项评测证据敏感名次浮动范围25—31 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥1.34 | ¥13.42 | ¥67.1 | 55.2 |
| 29 | GPT-5.6 LunaOpenAI上线 2026-07-09 · 证据敏感缓存输入 ¥0.13输入 ¥1.34 · 输出 ¥8.05 | | 20 项评测证据敏感名次浮动范围26—37 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.13 | ¥1.34 | ¥8.05 | 52.5 |
| 30 | GPT-6 LunaOpenAI上线 2026-09-22 · 证据敏感缓存输入 ¥0.0671输入 ¥0.67 · 输出 ¥3.36 | | 9 项评测证据敏感名次浮动范围27—47 名在 70 个对照情景中重新检查资格后的名次。不是置信区间。 | ¥0.0671 | ¥0.67 | ¥3.36 | 51.6 |