跳到正文
北京时间
评测来源

Longform Writing

EQ-Bench · 长篇故事的连贯性与完整性

官方评测
在 由来科技 中参与排名
证据预算2.4%
上游数据时间09/24 15:57
最近成功同步09/29 08:05

它测什么,怎么测

采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。

如何使用这份证据

正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1claude-opus-5Anthropic86.3来源默认配置
2claude-fable-5-1Anthropic85.3来源默认配置
3claude-opus-5-5Anthropic84.6来源默认配置
4claude-fable-5Anthropic83来源默认配置
4grok-4.7xAI83来源默认配置
6gpt-6-astraOpenAI82.8来源默认配置
6muse-spark-1.3Meta82.8来源默认配置
6gpt-6-solOpenAI82.8来源默认配置
9aion-3.5aion-labs82.1来源默认配置
10claude-opus-4-7Anthropic81.8来源默认配置
10GLM-5.3Z.ai81.8来源默认配置
12gpt-5.6-solOpenAI81.7来源默认配置
13muse-spark-1.2Meta81.5来源默认配置
14claude-opus-4-8Anthropic80.8来源默认配置
15claude-sonnet-4-6Anthropic79.9来源默认配置
17kimi-k3Moonshot AI79.6来源默认配置
18moonshotai/Kimi-K2.6Moonshot AI78.5来源默认配置
19claude-sonnet-5Anthropic78.3来源默认配置
19gpt-5.4OpenAI78.3来源默认配置
21gpt-5.5OpenAI78.2来源默认配置
22gpt-5.6-terraOpenAI78来源默认配置
23zai-org/GLM-5.2Z.ai77.9来源默认配置
24claude-opus-4-6Anthropic77.7来源默认配置
25gemini-3.8-flashGoogle76.8来源默认配置
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6来源默认配置
27gpt-5.6-lunaOpenAI75.5来源默认配置
28moonshotai/Kimi-K2.5Moonshot AI74.9来源默认配置
29Altworld/Hemmingway-1—74.2来源默认配置
30deepseek-v4.1-flashDeepSeek74来源默认配置
31XiaomiMiMo/MiMo-V2.5-ProXiaomi73.7来源默认配置
评测局限与数据署名

以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。

数据许可:MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。