跳到正文
北京时间
原文
xAI:News·· 2025-11-17精选AI 评分79

xAI 发布 Grok 4.1,全平台可用并登顶 LMArena Text Arena

Grok 4.1 Grok 4.1 is now available to all users on grok.com, 𝕏, and the iOS and Android apps. It is rolling out immediately in Auto mode and can be selected explicitly as “Grok 4.1” in the model picker. Nov 17, 2025

AI 导读

xAI 发布 Grok 4.1,现已向 grok.com、X 和 iOS、Android 应用的全部用户开放,在 Auto 模式立即推出,也可在模型选择器中显式选择。

推荐理由

原文给出了盲测 Elo、EQ-Bench3 和幻觉率等多维度评测结果,读者可以据此判断 Grok 4.1 相比前代的具体提升。

正文 · AI 翻译

Grok 4.1 现已在 grok.com、𝕏 以及 iOS 和 Android 应用上面向所有用户开放。它已在 Auto 模式下立即推出,并可在模型选择器中明确选择为“Grok 4.1”。

我们很高兴推出 Grok 4.1,它为 Grok 的实际可用性带来了显著提升。我们的 4.1 模型在创意、情感和协作互动方面表现出色。它对细微意图更加敏锐,交谈起来更具吸引力,人格更加连贯,同时完全保留了前代产品那锐利的智能和可靠性。为实现这一点,我们使用了驱动 Grok 4 的同一套大规模强化学习基础设施,并将其应用于优化模型的风格、人格、有用性和对齐。为了优化这些不可验证的奖励信号,我们开发了新方法,使我们能够使用前沿智能体推理模型作为奖励模型,以大规模自主评估和迭代响应。

静默推出,2025 年 11 月 1 日至 14 日

我们对初步的 Grok 4.1 构建版本进行了逐步静默推出,覆盖 grok.com、X 和移动应用上越来越多的生产流量。在为期两周的静默推出期间,我们对实时流量持续进行了盲测成对评估。

Grok 4.1

对比此前的 Grok

与流量中的此前生产模型相比,Grok 4.1 在 64.78% 的情况下更受偏好。

最先进的通用能力

Grok 4.1 在盲测人类偏好评估中树立了新标准。

在 LMArena 的 Text Arena 中,Grok 4.1 Thinking(代号:quasarflux)以 1483 Elo 位居总榜第 1 名——以 31 分的显著优势领先于非 xAI 模型中得分最高者。Grok 4.1 的非推理模式(代号:tensor)不使用思考 token 即可立即响应,以 1465 Elo 排名第 2。Grok 4.1 非思考模式在公开排行榜上超越了其他所有模型的完整推理配置。Grok 4.1 显著超越了总排名第 33 的 Grok 4。

情商

为了衡量我们模型在人格和人际能力方面的进展,我们在 EQ-Bench3 上评估了 Grok 4.1。EQ-Bench 是一项由 LLM 评判的测试,评估主动情商能力、理解力、洞察力、同理心和人际交往技能。测试集包含 45 个具有挑战性的角色扮演场景,其中大多数由跨越 3 轮的预写提示组成。该基准通过根据多项标准验证模型的响应来评估模型表现。此外,该基准还进行成对比较,以报告排行榜中每个模型的归一化 Elo 计算值。

我们通过运行官方基准仓库来报告评分标准得分和归一化 Elo 得分。这些分数使用默认采样参数、指定评判者(Claude Sonnet 3.7),并按照基准要求不使用系统提示计算得出。

以下是 Grok 4.1 如何回应情感提示的一个示例:

创意写作

我们还测量了 4.1 模型在 Creative Writing v3 基准上的表现。在该基准中,模型针对 32 个不同的写作提示生成响应,共进行 3 次迭代。与 EQ-Bench 类似,分数使用评分标准和模型对战归一化 Elo 计算。

方法论

对于 EQ-Bench3 和 Creative Writing v3,我们正在与作者合作,以将分数纳入排行榜。

以下是一些 Grok 4.1 如何回应创意写作提示的示例:

减少幻觉

配备搜索工具的快速(非推理)模型能迅速给出答案,但由于推理深度受限且工具调用预算有限,它们容易受到事实性错误的影响。

在 Grok 4.1 的后训练中,我们专注于减少信息查询类提示中的事实性幻觉。随后我们观察到,在抽样的生产环境信息查询提示中,幻觉率显著下降。

我们在来自生产流量的真实世界信息查询的分层样本上评估幻觉率。我们还评估了 FActScore,这是一个由 500 道关于个人传记问题组成的公开基准。

方法论

评估是通过使用网络搜索工具对非推理模型进行评估来完成的

幻觉率定义为模型响应中带有重大/轻微错误的原子声明百分比的宏平均

更多示例

我们在下面还收录了一些其他示例,展示 Grok 4.1 如何回应各种提示。

你可以在此阅读 Grok 4.1 模型卡。

来源:xAI:News · x.ai