北京时间
评测来源官方评测
Artificial Analysis Intelligence Index
Artificial Analysis · 把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。
在 由来科技 中参与排名
证据预算30%
上游数据时间待核实
最近成功同步09/29 14:05
它测什么,怎么测
只取官方 Artificial Analysis Intelligence Index;接口中的性能与价格字段不计分。
如何使用这份证据
综合任务证据占 30%;已核对 v4.3 的 10 项底层评测,与现役专项没有重复计票。整项保留,不将聚合分冒充单项成绩。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 7 | gpt-6-astraOpenAI | 52.7 | Max 推理 |
| 13 | claude-opus-5Anthropic | 50.8 | Max 推理 · 自适应 |
| 18 | muse-spark-1-3Meta | 48.1 | Max 推理 |
| 20 | gpt-6-solOpenAI | 47.5 | Max 推理 |
| 21 | gpt-5-6-solOpenAI | 47 | Max 推理 |
| 24 | grok-4-7xAI | 46.4 | xHigh 推理 |
| 25 | mimo-v2-6-proXiaomi | 46.3 | 来源默认配置 |
| 28 | qwen3-8-maxAlibaba | 45.4 | 来源默认配置 |
| 30 | glm-5-3Z.ai | 44.8 | Max 推理 |
| 33 | grok-4-6-xhighxAI | 44.2 | xHigh 推理 |
| 36 | step-5StepFun | 43.7 | 来源默认配置 |
| 37 | kimi-k3Moonshot AI | 43.6 | Max 推理 |
| 42 | gpt-5-6-terraOpenAI | 42.1 | Max 推理 |
| 43 | glm-5-3-flashZ.ai | 41.8 | 来源默认配置 |
| 43 | claude-opus-4-8Anthropic | 41.8 | Max 推理 · 自适应 |
| 45 | gemini-3-8-flashGoogle | 40.9 | High 推理 |
| 46 | claude-opus-4-7Anthropic | 40.7 | Max 推理 · 自适应 |
| 49 | qwen3-8-2-4t-a95bAlibaba | 39.9 | 来源默认配置 |
| 50 | qwen3-8-flash-nextAlibaba | 39.8 | 来源默认配置 |
| 53 | muse-spark-1-2Meta | 39.6 | xHigh 推理 |
| 55 | deepseek-v4-1-flashDeepSeek | 39.5 | Max 推理 |
| 58 | gemini-3-7-flashGoogle | 39.1 | High 推理 |
| 59 | gpt-5-4OpenAI | 39 | xHigh 推理 |
| 60 | grok-4-5xAI | 38.8 | High 推理 |
| 61 | gpt-5-5OpenAI | 38.4 | xHigh 推理 |
| 62 | claude-sonnet-5Anthropic | 38.2 | Max 推理 · 自适应 |
| 64 | mimo-v2-6-flashXiaomi | 37.9 | 来源默认配置 |
| 65 | gpt-6-lunaOpenAI | 37.3 | Max 推理 |
| 65 | gpt-5-6-lunaOpenAI | 37.3 | Max 推理 |
| 69 | deepseek-v4-proDeepSeek | 36 | Max 推理 |
评测局限与数据署名
缺少 API key 时整张来源退出本轮,不补 50 分;严禁用网页抓取替代,展示时必须署名并保留指数版本。
数据许可:API 数据展示或分享须显著署名;再分发权与定制条款须另行取得并遵守 Terms of Use
成绩由 Artificial Analysis 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。