跳到正文
北京时间
返回模型榜

评测来源

每个来源测什么、怎样更新、是否进入排名,都可以在这里找到。

20本轮参与排名69已审查来源与专项
排名怎么算

综合评测与体验

17

跨能力的综合测试与真人盲选。

编程

13

从写代码到改仓库,看模型能不能把软件做出来。

推理

11

数学、逻辑与陌生规则,看模型能不能想明白新问题。

知识

5

事实问答与研究生级科学知识,看知识掌握与回答准确性。

专业办公

19

金融分析、法律咨询与银行业务,看专业任务能否完成。

视觉理解

2

理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。

中文与多语言

2

语言基础的补充证据,不把英文写作表现当作中文能力。

“观察中”表示仍在核对数据、运行条件或使用边界,不参与综合榜和分类榜。同一评测的重复抓取和展示切片不会增加票权;不同评测之间的题库重叠仍需持续核对。