跳到正文
北京时间
返回模型榜

排名怎么算

综合多家公开评测,了解排名背后的证据与方法。

0—100

共同的证据,清楚的顺序。

综合多家公开评测,在完整排名中尽量减少与已知成绩的冲突。综合榜和四类榜单都最多展示前 30 名。

共识指数把支持原排名的证据差异换算为 0—100,方便比较,不是正确率或能力差距的百分比。支持接近时可以同分,名次仍由完整证据决定。

  1. 01

    先确认,是同一个模型

    统一各家榜单的名称和版本。同一模型的不同推理档位只选一个代表配置,选择规则预先确定,不挑最高分。匿名测试代号和混用其他模型完成任务的成绩排除;已正式公开的 Preview 版本可以参加。

  2. 02

    让真正测过的模型相互比较

    只比较同一评测中的真实成绩。双方都有公开误差时,误差范围内的微小差异更接近平局,不当成确定胜负。没有测到,就没有这一场比较。

  3. 03

    先定票权,再汇总共同意见

    每项评测使用预先确定的预算。综合榜至少要求三家评测机构、三个证据家族与三个专项覆盖;同一来源重复抓取或展示切片,不会凭空增加票权。

  4. 04

    寻找冲突最少的完整排名

    不同评测的意见可能冲突。我们选择违背共同证据净票权最少的一条顺序,再单独计算展示指数。缺测不补零分,也不猜测未公开的成绩。

A BALANCED VIEW

综合测试、真人盲选、专项评测,一起看。

综合评测占 30%,真人盲选占 10%,各项专项评测合计占 60%。新增评测先核对公开说明中的重叠关系,再从对应份额中分配;缺失份额不转给其他评测。

  • 综合评测30%AA Index
  • 真人盲选10%Arena Text · Arena 创作盲选
  • 编程与设计12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · 编程综合
  • 写作与表达9%LiveBench · 语言与指令 · Creative Writing v3 · Longform Writing
  • 数学与推理12%LiveBench · 推理与数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
  • 知识与事实6%SimpleQA Verified · GPQA Diamond
  • 视觉理解6%Arena Vision
  • 工具与办公6%APEX-Agents 1.1 · τ³-Banking
  • 中文与多语言6%AA 中文/多语言
  • 行业专业任务3%Vals Finance Agent

编程、推理、知识、专业办公分别寻找真实评测,分类分独立计算。视觉理解与多语言证据继续保留在综合榜;调整分类名称不会增加同一份成绩的投票权。综合分不等于分类分的算术平均。分类通常至少有两项有效评测、五个可比较型号才展示。知识目前由 Epoch 的两套评测支持,并明确说明同机构的局限。创作偏好、网页开发等证据继续用于综合榜,首版不单设审美和写作榜。

你可能还想知道

为什么有的模型证据较少,也能上榜?
评测数量与能力是两件事。综合榜至少需要三家机构与跨能力证据。多数分类要求两家机构,知识采用同一机构的两项评测并明确说明。缺测不记零分,但仍可能造成偏差。
“证据敏感”是什么意思?
删去一项评测或一家机构、将单项权重上下调整 20%、或改变误差处理后,名次范围达到三名或以上、某些情景失去参评资格,或有对照未完成,就会提示证据敏感。详情页的情景范围不是 95% 置信区间,不包含未知成绩。
前面的模型一定在两两比较中获胜吗?
不一定。A 可能胜 B,B 胜 C,C 又胜 A。完整榜单要权衡这些冲突;非相邻名次可能与单独比较不同。数学最优表示按当前规则的总冲突最少,不表示已证明所有真实工作中的能力顺序。
为什么排名可能和我的体验不同?
榜单汇集公开评测,反映这些证据支持的综合能力。实际体验还受产品版本、推理档位、工具环境和长任务稳定性影响。我们会用新评测检验旧排名;分数接近时,不应把一两名之差理解成明显强弱。
新模型什么时候会出现?
由来科技 每天检查四次上游结果。只有评测方实际发布了新模型的成绩,才能用于排名;网页刷新、价格更新或我们的抓取时间,都不算重新评测。
某家榜单暂时打不开,会怎样?
仍有效的来源快照可继续使用。相同评测版本内,临时漏行最多沿用最近七天已核验的记录;仍在公开榜中保留的有效成绩,不因数值长期不变被删除。官方撤回、更正、换版会相应失效或替换,不保留历史最高分。整轮计算失败时保留上一轮有效榜及原时间。
综合指数会和专项评测重复计分吗?
我们根据公开的题库与方法说明检查重叠,并限制相关来源的总份额;无法确认的相关性仍是局限。当前 AA 指数占 30%;Arena 整体文本与创作专项共享原有 10% 真人偏好份额,各占 5%。两项有重叠投票,因此仍算同一个证据家族,不假装是两家独立评测。
价格或速度会影响排名吗?
都不会。价格只供你了解 API 的使用成本,统一按每百万 Token 展示,并保留厂商官方来源。它不代表订阅费用。
查看计算细节与当前版本

方法版本:2026.09-public-consensus-v15。采用加权不完整 Kemeny 排序。每对共同参评模型汇总净支持 M;目标是最小化所有被排反的净支持之和。整数优化返回最优状态和目标上下界,只有完整通过验证的结果才用于正式发布。

双方有明确标准误时,净支持取 2Φ(分差 / 合成标准误) − 1,默认零协方差;其他比较只取原始领先方向。未知误差并非零误差,小分差按序数处理仍是局限。票权针对潜在模型对,覆盖型号多的来源会使用更多比较位置,不能把名义预算解读为最终名次的精确贡献率。

展示指数保留原排序:逐对反转相邻模型的先后,允许其余模型重排,计算最少增加的逆向净支持。沿原排名累加这些非负支持差,再相对固定参照组用 sigmoid 映射到 0—100。替代顺序同样最优时保留零间距,显示保留一位小数,不人为设置最低分差。指数不参与反向排序;入榜集合、参照型号与证据变化仍会影响指数,分差不等于真实能力距离。同代价求解固定型号 ID 次序;整数优化使用 HiGHS 求解器(highs 1.15.3),误差换算的正态分布函数与 SciPy norm.cdf 采用同一算法;来源、协议、参评资格和每轮计算输入均保存版本。未连接到共同证据网络时不发布跨分量的假精确顺序。

固定参照型号:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照组用于指数尺度,不指定任何厂商应排第几;不同分类的指数不直接比较。

查看每一份评测证据 →