跳到正文
北京时间
评测来源

Creative Writing v3

EQ-Bench · 短篇创作与表达

官方评测
在 由来科技 中参与排名
证据预算3.6%
上游数据时间09/24 15:57
最近成功同步09/29 14:05

它测什么,怎么测

官方 CSV 内嵌于数据脚本,采用 Elo;Sonnet 4.6 判胜负,风格、重复率和 rubric 不重复计票。

如何使用这份证据

正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gpt-6-astraOpenAI2,173.3来源默认配置
2claude-fable-5-1Anthropic2,162来源默认配置
3claude-opus-5Anthropic2,132.6来源默认配置
4gpt-6-solOpenAI2,124.7来源默认配置
5kimi-k3Moonshot AI2,082.3来源默认配置
6GLM-5.3Z.ai2,075来源默认配置
7claude-opus-5-5Anthropic2,050.1来源默认配置
8grok-4.7xAI2,006.7来源默认配置
10gpt-5.6-solOpenAI1,971.6来源默认配置
11claude-fable-5Anthropic1,943.1来源默认配置
12aion-3.5aion-labs1,929.3来源默认配置
13muse-spark-1.1Meta1,927.1来源默认配置
14claude-opus-4-7Anthropic1,914.3来源默认配置
15Altworld/Hemmingway-1—1,906.4来源默认配置
16muse-spark-1.3Meta1,905.9来源默认配置
17gpt-5.6-terraOpenAI1,854.9来源默认配置
18gpt-5.5OpenAI1,843.9来源默认配置
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5来源默认配置
20muse-spark-1.2Meta1,840.4来源默认配置
21claude-opus-4-8Anthropic1,839.8来源默认配置
22gpt-5.4OpenAI1,839.7来源默认配置
23gpt-5.6-lunaOpenAI1,828.7来源默认配置
24claude-sonnet-4-6Anthropic1,810.4来源默认配置
25claude-opus-4-6Anthropic1,809.1来源默认配置
26meta-models/Muse-Glimmer-30BMeta1,798.3来源默认配置
27claude-sonnet-5Anthropic1,794来源默认配置
28space-bunny-alphastealth1,784.3来源默认配置
29zai-org/GLM-5.2Z.ai1,756.5来源默认配置
30gemini-3.8-flashGoogle1,747.9来源默认配置
31moonshotai/Kimi-K2.6Moonshot AI1,724.5来源默认配置
评测局限与数据署名

以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。

数据许可:MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 AIHOT 共识分使用不同尺度,不能直接相加。