跳到正文
北京时间
原文
xAI:News(网页)·· 2026-07-08精选AI 评分85

xAI 发布 Grok 4.5

Introducing Grok 4.5 Jul 8, 2026 # Introducing Grok 4.5 Grok 4.5 is SpaceXAI's smartest model built for coding, agentic tasks, and knowledge work. Read More

AI 导读

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

推荐理由

Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。

正文 · AI 翻译

今天,我们正式推出 Grok 4.5,这是 SpaceXAI 最智能的模型,专为在编程、智能体任务和知识工作方面表现出色而打造。它是我们迄今为止最强的模型,并与 Cursor 一同训练。

真实世界的工程卓越表现

Grok 4.5 在涵盖编程、科学、工程和数学知识的数据集上进行了训练。凭借智能且高效的推理能力,Grok 4.5 在真实工程任务中表现出色,并在这些任务上超越了同级别的领先模型。

DeepSWE 1.0 DeepSWE 1.1 SWE Marathon Terminal Bench 2.1 SWE Bench Pro

竞品数据取自各开发者发布的系统卡或基准排行榜

模型得分的基准柱状图。DeepSWE 1.0(评测由 Datacurve 创建,由 AA 使用各模型提供方的测试框架运行):Fable (max) 66.1%,GPT 5.5 (xhigh) 64.31%,Grok 4.5 62.0%,Opus 4.8 (max) 55.75%,Opus 4.7 (max) 40.12%。DeepSWE 1.1(由 Datacurve 运行的 mini-swe-agent 测试框架):Fable (max) 70%,GPT 5.5 (xhigh) 67%,Opus 4.8 (max) 59%,Grok 4.5 53%,GLM 5.2 44%。SWE Marathon 解决率(pass@1):Grok 4.5 29.0%,Opus 4.8 (max) 26.0%,Fable (max) 24.0%,Opus 4.7 (max) 16.0%。Terminal Bench 2.1:Fable (max) 84.3%,GPT 5.5 (xhigh) 83.4%,Grok 4.5 83.3%,Opus 4.8 (max) 78.9%,Opus 4.7 (max) 78.9%。SWE Bench Pro 解决率:Fable (max) 80.4%,Opus 4.8 (max) 69.2%,Grok 4.5 64.7%,Opus 4.7 (max) 64.3%,GLM 5.2 62.1%,GPT 5.5 (xhigh) 58.6%。竞品数据取自各开发者发布的系统卡或基准排行榜。

训练 Grok 4.5

Grok 4.5 在数万块 NVIDIA GB300 GPU 上完成训练,并采用了专为大规模训练运行设计的训练与稳定性技术。除了原始 token 数量之外,我们还在数据过滤与整理上投入了大量精力:去重、质量评分以及面向领域的筛选,从而让数据配比保持高覆盖度与高信号密度。

我们以对每 token 智能的高度关注来扩展强化学习。我们的 RL 训练覆盖数十万个任务,聚焦于多步骤软件工程及其他技术工作,并采用自动化与基于模型的评分。我们的技术栈专为高度异步训练而构建,因此智能体 rollout 可以持续运行数小时,同时学习在数万块 GPU 上持续进行。其结果是,在真实工程与智能体任务上实现了更智能、更高效的推理。

用一个提示词构建

Grok 4.5 在编程方面能力惊人,从具有挑战性的 Rust 和 C/C++ 任务,到从提示词到生产环境的端到端应用构建。以下是一些由该模型通过一个提示词构建的示例。即便规格说明极少,Grok 4.5 也非常擅长创建设计良好、端到端可用的应用。

太阳系

制作一个精美的宇宙与太阳系模拟。应支持加速与可调节时间、真实的运动、轨道、恒星。使用 threejs。让 HUD 样式精美,并符合现代设计原则。

制作一个精美的宇宙与太阳系模拟。应当支持可调节的时间加速、真实的运动、轨道和恒星。使用 threejs。让 HUD 样式精美,并符合现代设计原则。

app.localhost — cosmos

比 flash 模型更快

Grok 4.5 以 80 TPS 的 fast-model 速度提供服务。结合在相同任务上比最新领先模型高出一倍的 token 效率,该模型能更快、以远更低的成本为你带来智能结果。

Token 效率

每个 SWE Bench Pro 任务的平均输出 token 数

Grok 4.5 0

Opus 4.8 (max)0

少 4.2× token

0 70 k tokens

Token 效率,每个 SWE Bench Pro 任务的平均输出 token 数 — Grok 4.5 平均以 15,954 个输出 token 解决任务,约为 Opus 4.8 (max) 的 67,020 的 4.2× 更少

擅长 Office 工作

Grok 4.5 现已成为 Grok Build 的默认模型。除了编程能力之外,Grok Build 还能构建复杂的 Excel 模型,涉及从网络进行研究、多工作表公式运用,甚至会留下便签或备注以供日后参考。

在 PowerPoint 和 Word 中,Grok 4.5 同样一丝不苟。该模型能够使用 PowerPoint 原生形状构建复杂图表、设计直观的幻灯片内容,并在 Word 中撰写清晰的文稿。

拟定一份 5 页的季度业务回顾大纲

Q3 Review.pptx

开始 插入 设计 切换 动画 审阅

新建幻灯片 版式 加粗 倾斜 下划线 排列 设计灵感 加载项 Grok

季度回顾 10月 · FY26

Q3 业务回顾

营收、利润率、销售管道——以及我们下一步的投资方向

01 营收 02 利润率 03 销售管道 04 展望

第 1 页,共 5 页 · 英语(美国)100%

进一步了解我们面向 Word、PowerPoint 和 Excel 的插件。

定价

与其他领先模型相比,Grok 4.5 以极具竞争力的成本交付。Grok 4.5 的定价为每百万输入 token 2 美元、每百万输出 token 6 美元。该模型还实现了约为同类领先模型 2 倍的 token 效率,用不到一半的步骤即可解决任务。总体而言,Grok 4.5 在单位时间和成本上交付了最高的智能水平。

快速上手

Grok 4.5 即日起可在 Grok Build、所有套餐的 Cursor 中,以及 SpaceXAI 控制台中使用。只需获取一个 API key,几行代码即可上手:

curl -s https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.5",
    "input": "Find and fix the bug, then explain it: function median(a){a.sort();return a[a.length/2]}"
  }'

创建 API Key

API 文档

阅读文档,将 Grok 4.5 集成到你的技术栈中。

在 Grok Build 中免费试用

我们限时在Grok Build和 Cursor 中提供 Grok 4.5 的免费使用。即日起在x.ai/cli开始使用。

来源:xAI:News(网页) · x.ai