跳到正文
北京时间
评测来源

Arena Text Style-Controlled

LMArena · 真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。

官方评测
在 由来科技 中参与排名
证据预算5%
上游数据时间09/25 08:00
最近成功同步09/29 08:05

它测什么,怎么测

只取官方发布快照中的 Text Overall style-controlled 主榜,不抓取 arena.ai 实时页面。

如何使用这份证据

真人偏好预算 10% 分为整体 5% 和创作 5%;与 Arena 的编程和视觉评测仍共用证据家族。按官方成绩数据时间判断新旧。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5.5-highAnthropic1,508.6High 推理
2claude-opus-4-6-highAnthropic1,505.4High 推理
3claude-fable-5-highAnthropic1,503.8High 推理
4claude-opus-4-7-highAnthropic1,501.9High 推理
5claude-fable-5.1-maxAnthropic1,501.3Max 推理
7muse-spark-1.2 (xHigh)Meta1,496.2xHigh 推理
9muse-spark-1.3-maxMeta1,494.1Max 推理
10gemini-3.8-flash-highGoogle1,492.4High 推理
12muse-spark-1.1Meta1,490.8来源默认配置
13muse-sparkMeta1,489.1来源默认配置
14claude-opus-5-maxAnthropic1,488.2Max 推理
15gemini-3.7-flash-highGoogle1,488High 推理
16kimi-k3-maxMoonshot AI1,488来源默认配置
17gemini-3.1-pro-previewGoogle1,486.7来源默认配置
18gemini-3-proGoogle1,485.5来源默认配置
19gpt-5.6-sol-xhighOpenAI1,483.2xHigh 推理
20gemini-3.6-flash-highGoogle1,481.9High 推理
21gpt-5.5-highOpenAI1,481.4High 推理
22claude-opus-4-8-highAnthropic1,480.2High 推理
23mimo-v2.6-proXiaomi1,479.7来源默认配置
24glm-5.3-maxZ.ai1,479.6来源默认配置
25qwen3.8-maxAlibaba1,479.4来源默认配置
26gpt-6-astra-maxOpenAI1,477.7Max 推理
27gemini-3.5-flash-highGoogle1,477High 推理
29deepseek-v4.1-flash-maxDeepSeek1,476.5来源默认配置
30gpt-5.2-chat-latest-20260210OpenAI1,475.8来源默认配置
31glm-5.2-maxZ.ai1,475.6来源默认配置
32gpt-5.4-highOpenAI1,475.2High 推理
33qwen3.7-max-previewAlibaba1,475.1来源默认配置
34grok-4.20-beta1xAI1,474.8来源默认配置
评测局限与数据署名

人类偏好受风格、用户结构和提示分布影响。整体与创作分类存在重叠投票,共享原有真人偏好预算,不视为两家独立评测机构。

数据许可:CC BY 4.0

成绩由 LMArena 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。