xAI 发布 Grok 4.6,强化长时运行智能体能力
Introducing Grok 4.6
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。
Grok 4.6 以 Grok 4.5 为基础,特别聚焦于长时间运行的智能体,以及更具雄心的交互与视觉工作。
今天我们发布 Grok 4.6。Grok 4.6 以 Grok 4.5 为基础,特别聚焦于长时间运行的智能体,以及更具雄心的交互与视觉工作。它能在许多步骤中持续处理复杂任务,无论是研究一个主题、分析信息、在代码库中工作,还是把一个想法变成打磨完善的应用程序或工作产物。
Grok 4.6 在多项智能体编程与知识工作基准上达到了前沿智能水平。它在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,该指数是九项基准的综合得分。
AA Intelligence GDPVal-AA DeepSWE 1.1 CursorBench 3.2 FrontierCode 1.1
竞争对手的数据取自各自开发者发布的系统卡或基准排行榜
基准柱状图对比了 Grok 4.6 与其他领先模型在 AA Intelligence、GDPVal-AA、DeepSWE 1.1、CursorBench 3.2 和 FrontierCode 1.1 上的表现。竞争对手的数据取自各自开发者发布的系统卡或基准排行榜。
Grok 4.6 今日已在 Cursor 和 Grok Build 中上线。首周我们在 Grok Build 和 Cursor 内提供 2 倍包含用量,让你可以立即开始试用 4.6。
训练 Grok 4.6
Grok 4.6 经历了比 Grok 4.5 更长的补充训练运行,使用了经过筛选的模型生成数据,涵盖推理和高级技术概念、高质量工程数据,以及改进的优化器和训练配方。这为后续的 SFT 和 RL 阶段奠定了更强的基础。
随后,我们使用 Grok 4.5 重新生成了跨推理强度、智能体框架以及 STEM、软件工程和知识工作等领域的 SFT 轨迹,并通过基于模型的检查过滤掉了有问题的轨迹。由此得到的 SFT 检查点展现出强劲的性能和改善的行为表现。
Grok 4.6 在广泛的智能体 RL 任务上进行训练,包括知识工作、通用编程,以及针对内核优化、Web 开发、计算机辅助设计等的领域特定环境。
将雄心勃勃的想法转化为可运行的项目
我们在旨在拓展 Grok 4.6 能力范围和多步骤持续工作能力的项目上对其进行了测试。我们发现该模型尤其擅长将一个宽泛的产品想法转化为可运行的首个版本。它能够研究不熟悉的领域、构建应用结构、实现核心交互,并通过多轮反馈持续改进结果。
在更长的轨迹中,我们还开始看到更多的自测试和验证行为,模型在继续推进之前会检查自己的工作。
Grok 4.6 在视觉和交互类项目上生成的初稿比我们通常看到的 Grok 4.5 更强。给定一个具体的产品创意,它能够一次性为应用建立起结构和视觉语言。这使得它对于那些最快取得好结果的路径是先做出一个足够扎实的东西、然后在循环中迭代的项目尤为有用。
安全与能力
Grok 4.6 的防护措施已根据模型能力进行了改进和校准。
我们的安全栈旨在在合法用例中最大化实用性和安全性,使 Grok 4.6 在漏洞修补、加速工程设计周期以及增强 AI 研究等领域既实用又安全。
我们的防护评估工作反映了 Grok 4.6 扩展后的能力,我们开展了有史以来规模最大的部署前能力测试与防护校准套件,以及广泛的部署后测试和第三方测试。
评测
Grok 4.6 High
Grok 4.5 High
GPT-5.6 Sol Max
Fable 5 Max
AA Intelligence Index
GDPVal-AA v2
CursorBench v3.2
DeepSWE v1.1
FrontierCode v1.1(扩展版)
APEX-Agents
Terminal-Bench v3.0
APEX-SWE
AA-Briefcase
Harvey LAB(Vals)
每项评测的最高分以粗体显示。第三方模型的分数取自其自行报告或公开结果中的最佳值。
开始使用 Grok 4.6
Grok 4.6 今日起可在 Cursor 和 Grok Build 中使用。它也可通过 API 以及 OpenRouter、Vercel 和 Cloudflare 等合作伙伴使用。
定价为每百万 input tokens 2 美元起,每百万 output tokens 6 美元起。此外还有一个快速版本,价格为两倍。
首周我们在 Grok Build 和 Cursor 内提供 2 倍额度用量,让你可以立即开始试用 4.6。
创建 API Key
API 文档
阅读文档,将 Grok 4.6 集成到你的技术栈中。
阅读文档
在 Grok Build 中免费试用
立即前往 x.ai/build 开始使用。
来源:xAI:News(网页) · x.ai