xAI 发布 Grok 4.7:同价同速,编码与智能体能力提升
先了解这件事
2026 年 9 月 21 日至 22 日,xAI(报道中亦称 SpaceXAI)发布 Grok 4.7,定位最强编码与知识工作模型,采用更大基座模型并加长强化学习训练,强化自我验证与长上下文管理。官方称定价与 Grok 4.6 相同,为每百万输入 token 2 美元、输出 6 美元,速度持平,另有价格与速度加倍的快速变体,已登陆 Grok Build、Cursor、API 和 OpenRouter。Artificial Analysis 评测其智能指数 46 分,较 Grok 4.6 高 2 分,进入前四;编码智能体指数从 47 升至 56,位列第 4,马斯克称这使 xAI 在智能体编码上排名第三,仅次于 Anthropic 和 OpenAI。模型卡显示多项基准提升:Terminal-Bench 20.3%→38.0%、SWE-Marathon 31.9%→46.0%、EEBench 60.0%→66.0%、Harvey Legal Agent 15.8%→19.6%。Arena 将其纳入 Agent Arena 及 Text、Vision、Code、Document 四类 Battle Mode。The Decoder 则称其基准成绩明显落后 Claude 与 GPT-6。9 月 23 日,Arena 称 Grok 4.7 (xHigh) 以 1632 分进入 Code Arena: WebDev 榜第 10 名,较 Grok 4.6 (High) 提升 16 分、上升 6 位;同日马斯克引用 Next.js 评测称 Grok 4.7 得 94%,低于 Opus 5.5、GPT 6 Sol、Fable 5.1 的 97%,但便宜 2 至 7 倍。此后有用户实测称 Grok-4.7-high 不敌 GPT-5.6-sol-medium,工程项目表现欠佳。9 月 25 日,Arena 公布 Grok 4.7 (xHigh) 进入 Agent Arena 榜单第 16 位,净改进分 +3.96%。9 月 26 日,Tencent WorkBuddy 宣布上线 Grok-4.7。9 月 29 日,SpaceXAI 宣布 Grok 4.7 上线 Amazon Bedrock。
AI 根据报道生成 · 9 小时前更新
事件进展
- 9月29日 07:10 · 1 篇报道Grok 4.7 上线 Amazon BedrockSpaceXAI:Grok 4.7 上线 Amazon Bedrock
- 9月26日 02:26 · 1 篇报道WorkBuddy 上线 Grok-4.7Tencent WorkBuddy:WorkBuddy 上线 Grok-4.7
- 9月25日 11:53 · 1 篇报道Grok 4.7 (xHigh) 登上 Agent Arena 第16位,净改进分 +3.96%Arena:Grok 4.7 (xHigh) 登上 Agent Arena 第16位,净改进分 +3.96%
- 9月23日 20:27 · 1 篇报道Grok-4.7-high 实测不敌 GPT-5.6-sol-mediumkarminski:Grok-4.7-high 实测不敌 GPT-5.6-sol-medium
- 9月23日 06:07 · 1 篇报道Grok 4.7 小模型表现亮眼Elon Musk:Grok 4.7 小模型表现亮眼
- 9月23日 04:35 · 1 篇报道Grok 4.7 (xHigh) 以 1632 分登 Code Arena: WebDev 榜第 10 名Arena:Grok 4.7 (xHigh) 以 1632 分登 Code Arena: WebDev 榜第 10 名
- 9月22日 23:42 · 1 篇报道Grok 4.7 在特斯拉做实际工程Elon Musk:Grok 4.7 在特斯拉做实际工程
- 9月22日 23:40 · 1 篇报道Grok 4.7 生成交互式3D喷气引擎可视化Elon Musk:Grok 4.7 生成交互式3D喷气引擎可视化
- 9月22日 22:59 · 1 篇报道马斯克称 Grok 4.7 搭配 Build 是日常主力工具Elon Musk:马斯克称 Grok 4.7 搭配 Build 是日常主力工具
- 9月22日 22:34 · 1 篇报道Grok 将能生成照片级物理精确游戏Elon Musk:Grok 将能生成照片级物理精确游戏
- 9月22日 10:02 · 1 篇报道卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案公众号:数字生命卡兹克:卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案
- 9月22日 08:08 · 1 篇报道Grok 4.7 音乐纠错测试满分Elon Musk:Grok 4.7 音乐纠错测试满分
- 9月22日 06:01 · 1 篇报道Grok 4.7 飞行模拟器实测比肩 GPT-6 AstraEric Zakariasson:Grok 4.7 飞行模拟器实测比肩 GPT-6 Astra
- 9月22日 01:28 · 1 篇报道Grok 4.7 限时一周七折opencode:Grok 4.7 限时一周七折
- 9月22日 01:13 · 1 篇报道Grok 4.7 与 Build harness 配合表现出色Elon Musk:Grok 4.7 与 Build harness 配合表现出色
- 9月22日 00:37 · 2 篇报道Grok 4.7 上线 Arena 的 Agent Arena 评测Arena:Grok 4.7 上线 Arena 的 Agent Arena 评测
- 9月22日 00:31 · 1 篇报道Grok 4.7 上线 OpenRouterOpenRouter:Grok 4.7 上线 OpenRouter
- 9月22日 00:20 · 1 篇报道SpaceXAI发布Grok 4.7编程与知识工作模型Eric Zakariasson:Grok 4.7 发布,官方称同价同速下较 Grok 4.6 显著提升
- 9月21日 08:00 · 15 篇报道Grok 4.7 今日正式推出,已开始滚动发布xAI:News:xAI 发布 Grok 4.7,主打编码与知识工作
- 9月21日 00:00 · 5 篇报道Artificial Analysis 评测 Grok 4.7:智能指数得分 46,编码智能体指数升至 56Artificial Analysis 完整文章:Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4
报道时间线
沿着报道,了解事件的不同侧面。
- X:Tencent WorkBuddy (@WorkBuddy_AI)WorkBuddy 上线 Grok-4.7
模型阵容新增:Grok-4.7⚡ 现已在 WorkBuddy 上线。用它来跑你的下一个任务试试吧!
- X:Arena (@arena)Grok 4.7 (xHigh) 登上 Agent Arena 第16位,净改进分 +3.96%
Arena 宣布 Grok 4.7 (xHigh) 进入 Agent Arena 榜单第16位,净改进分 +3.96%。
- X:karminski (@karminski3)Grok-4.7-high 实测不敌 GPT-5.6-sol-medium
用户实测 Grok-4.7-high 一天后认为其打不过 GPT-5.6-sol-medium,写了不少垃圾代码。该模型 oneshot 尚可,但工程项目表现拉胯,视野窄、缺代码直觉和经验,常漏边界条件,用分布式锁即可复现死锁且难以修复。
- X:Elon Musk (@elonmusk, xAI)Grok 4.7 小模型表现亮眼
有意思。Grok 4.7 作为一个小型模型表现相当不错。 (引用 @rauchg):我们跑了最新的 Next.js 评测。结果:① Opus 5.5 [97%] ② GPT 6 Sol [97%] ③ Fable 5.1 [97%] ④ Grok 4.7 [94%] 值得注意的是,Grok 便宜 2x-7x。
- X:Arena (@arena)Grok 4.7 (xHigh) 以 1632 分登 Code Arena: WebDev 榜第 10 名
Arena 官方宣布 Grok 4.7 (xHigh) 进入 Code Arena: WebDev 榜第 10 名,得 1632 分,较 Grok 4.6 (High) 提升 16 分并上升 6 位,后者现列第 16 名(1616 分)。
- X:Elon Musk (@elonmusk, xAI)Grok 4.7 在特斯拉做实际工程
Grok 4.7 在特斯拉做真正的工程工作 [引用 @yunta_tsai]:过去几周,Grok Build 团队为 4.7 优化了 harness: - 更好的呈现,更少废话,更好的文笔 - 更好的自我验证 - 提升思考效率 - 改进长时程监控任务 - 改进 VLM 和多模态任务 我个人交付的许多 FSD 和 Cybercab 功能都是用我的过夜智能体完成的。 试试看。
- X:Elon Musk (@elonmusk, xAI)Grok 4.7 生成交互式3D喷气引擎可视化
Grok 4.7 [引用 @cb_doge]:Grok 4.7 在几分钟内将一个简单的提示词变成了这个交互式 3D 喷气发动机可视化工具。 这太疯狂了。🔥
- X:Elon Musk (@elonmusk, xAI)马斯克称 Grok 4.7 搭配 Build 是日常主力工具
马斯克称 Grok 4.7 搭配其 Build harness 是强劲的日常主力工具。引用推文用户表示在 Grok Build 中以 extra high 档位连续使用 Grok 4.7 数小时,Cursor Ultra 用量几乎没动,并让 4.7 在 Cursor 中做完整代码审查、再由 Fable 5.1 复核。
- X:Elon Musk (@elonmusk, xAI)Grok 将能生成照片级物理精确游戏
Grok 将能够生成照片级真实、物理精确的游戏。 [引用 @XFreeze]:Grok 4.7 刚刚在 Grok Build 中通过单条提示词构建了一款 GTA 风格的开放世界游戏 你可以四处走动、驾驶汽车、进入车辆,并探索整座城市 看起来太疯狂了,我玩得实在太开心了 😂
- MarkTechPostxAI 发布 Grok 4.7:更大基座模型,保持与 Grok 4.6 相同的 $2/$6 定价
SpaceXAI 发布新旗舰模型 Grok 4.7,面向编码、智能体任务和知识工作,定价与 Grok 4.6 相同,为每百万 token 输入 $2、输出 $6。
- 公众号:数字生命卡兹克精选卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案
作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。
- X:Elon Musk (@elonmusk, xAI)Grok 4.7 音乐纠错测试满分
太酷了 [引用 @aug5thmusic]:没想到。Grok 4.7 在我的音乐纠错测试中拿了 100%,和 GPT-6 Astra 一样。
- X:Elon Musk (@elonmusk, xAI)Elon Musk 发布 Grok 4.7,引用评测称其仅次于 Anthropic 模型
Elon Musk 宣布发布 Grok 4.7,并引用 Artificial Analysis 评测:Grok 4.7 在 AA-Briefcase 上仅次于 Anthropic 模型,排名紧随 Opus 5,Cost per Task 约为其 50%。
- X:Artificial Analysis (@ArtificialAnlys)Grok 4.7 在 AA-Briefcase 上仅次于 Anthropic 模型,排名紧追 Opus 5,每任务成本约为其 50%
Grok 4.7 在 AA-Briefcase 上仅次于 Anthropic 模型,排名紧追 Opus 5,每任务成本约为其 50%。在 AA-Briefcase-Lite 尽调场景中,Grok 4.7 分析质量 Elo 从 Grok 4.6 的 1698 升至 1994,展示 Elo 则从 1531 微降至 1499。
- IT之家SpaceXAI 发布 Grok 4.7,主打编码与知识处理,百万词元输入 2 美元起
SpaceXAI 于 9 月 22 日宣布推出新一代模型 Grok 4.7,定位编码和知识工作场景,官方称其为公司目前最强的编码和知识处理模型。该模型采用更大基座并经更长时间强化学习训练,强化自我验证与长上下文管理,在 CursorBench 4.0、GDPval、AA Briefcase 等基准较 Grok 4.6 有提升。
- X:Eric Zakariasson (@ericzakariasson)Grok 4.7 飞行模拟器实测比肩 GPT-6 Astra
有人用同一提示词让 GPT-6 Astra、Grok 4.7、Kimi K3 和 Fable 5.1 分别构建飞行模拟器,Astra 综合仍排第一,但 Grok 4.7 出乎意料地接近。Kimi K3 与 Fable 5.1 基本打平,两者产出结果更流畅,Grok 4.7 的整体质量则与 Astra 相当。综合排名为 Astra > Grok ≈ Kimi ≈ Fable。
- Hacker News 热门(buzzing.cc 中文翻译)xAI 发布 Grok 4.7:编码与知识工作能力提升,价格与 Grok 4.6 持平
xAI 发布 Grok 4.7,称其为编码与知识工作最强模型,采用更大的新基础模型并经过更长强化学习训练,定价与 Grok 4.6 相同,每百万输入 token $2、输出 token $6。
- X:Rohan Paul (@rohanpaul_ai)Grok 4.7 发布:Harvey 法律基准 19.6% 大幅领先,Terminal-Bench 4.0 得分近翻倍且价格不变
Grok 4.7 发布,官方称在同等价格和速度下较 Grok 4.6 有显著提升。Harvey Legal Agent Benchmark 上 Grok 4.7 得分 19.6%。
- X:Testing Catalog (@testingcatalog)Grok 4.7 发布,登陆 Grok Build、Cursor 和 API
Grok 4.7 已发布,可在 Grok Build、Cursor 和 API 上使用,部分任务性能接近 Opus 5,价格与 Grok 4.6 相同。官方称其在困难任务上工作时间更长、检查更仔细,并带来迄今最强的安全防护。
- X:Eric Zakariasson (@ericzakariasson)Grok 4.7 模型卡发布,多项基准较 4.6 提升且价格不变
Grok 4.7 模型卡发布,相比 4.6 多项基准提升:Terminal-Bench 20.3% → 38.0%,SWE-Marathon 31.9% → 46.0%,HealthBench Pro 48.5% → 56.7%,Legal Agent 15.8% → 19.6%,EEBench 60.0% → 66.0%。价格与 4.6 相同,模型卡见 https://media.x.ai/v1/website/4p7card-5eccc980.pdf。
- X:Elon Musk (@elonmusk, xAI)Grok 4.7 与 Build harness 配合表现出色
Grok 4.7 与我们的 Build harness 配合得非常好 https://X.ai/Build
- X:Elon Musk (@elonmusk, xAI)精选马斯克称 Grok 4.7 使 xAI 在智能体编码领域位列第三
Elon Musk 引用 Artificial Analysis 评测称,Grok 4.7 使 xAI 在智能体编码上排名第三,仅次于 Anthropic 和 OpenAI。
- X:Arena (@arena)Grok 4.7 上线 Agent Arena,Arena 发起历代版本走势投票
Grok 4.7 已上线 Agent Arena,并进入 Text、Vision、Code 和 Document 四类 Battle Mode。Arena 用全球用户数百万条真实长程智能体任务、结合网络搜索、文件系统和终端工具访问,以因果追踪方法衡量模型相对平均模型的表现;官方同时发起投票预测 Grok 4.7 的净改进分数落点,分数将在用户投票后公布。
- The Decoder:AI NewsxAI 发布 Grok 4.7,价格低廉但基准成绩明显落后 Claude 与 GPT-6
xAI 发布 Grok 4.7,定价为每百万输入 token 2 美元、输出 token 6 美元,公司称其基于更大基座模型并经过更长强化学习训练。
- X:Artificial Analysis (@ArtificialAnlys)精选Artificial Analysis 评测 Grok 4.7:智能指数得分 46,编码智能体指数升至 56
Artificial Analysis 发布 Grok 4.7 评测,其在 Artificial Analysis Intelligence Index 得分 46,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四大 AI 实验室。
- X:Arena (@arena)Grok 4.7 上线 Arena 的 Agent Arena 评测
Arena 宣布 xAI 的 Grok 4.7 已加入 Agent Arena 评测,用户可投票影响排行榜。该评测基于数百万真实的长周期智能体任务,模型可使用网页搜索、文件系统和终端工具完成复杂工作流,并用因果追踪方法衡量相对表现。Grok 4.7 还进入 Battle Mode 的文本、视觉、代码和文档类别。引用方称其相较 Grok 4.6 在同价同速下有明显提升。
- X:Michael Truell (@mntruell)Grok 4.7 发布,速度与价格不变下能力提升
Grok 4.7 发布,相比 Grok 4.6 在相同价格和速度下能力更强。附带对比表显示其输入 $2/百万 token、输出 $6/百万 token,在 CursorBench 4.0 得分 46.3%(4.6 为 40.4%)、EEBench 64.0%、Terminal-Bench 4.0 38.0%、Harvey Legal Agent 19.6%,多项基准领先对比模型。
- X:Andrew Milich (@milichab)Grok 4.7 发布:同价同速下较 Grok 4.6 明显提升
Grok 4.7 发布,官方称在相同价格和速度下较 Grok 4.6 有明显提升。Andrew Milich 推荐该模型擅长编码、工程工作和 3D,可在 Grok Build 和 Cursor 中以高 TPS 作为思考伙伴使用。图表显示 Grok 4.7 xHigh 输入 $2 / 输出 $6 每百万 token,EEBench 64.0%、CursorBench 4.0 46.3%、DeepSWE v1.1 71.0%(High Effort)。
- X:OpenRouter (@OpenRouter)Grok 4.7 上线 OpenRouter
xAI 的 Grok 4.7 已上线 OpenRouter。官方称其为目前最强的编码与知识工作模型,能在困难任务上持续工作更久、更仔细地自查,并在 CursorBench 4.0 上处于价格性能前沿。使用入口:https://openrouter.ai/x-ai/grok-4.7
- X:Lauren Tan (@poteto)Grok 4.7 发布,作者转发称在价格和速度不变的情况下较 Grok 4.6 显著提升
Grok 4.7 发布,官方称其在与 Grok 4.6 相同的价格和速度下有显著提升。 Lauren Tan 转发并致以'4.7 day'祝贺,所附对比图显示 Grok 4.7 xHigh 输入 $2/百万 token、输出 $6/百万 token,与 4.6 持平;在 EEBench 64.0%、Harvey Legal Agent 19.6%、CursorBench 4.0 46.3% 等基准上较 4.6 提升明显,DeepSWE v1.1 为 71.0%(High Effort)。
- X:Eric Zakariasson (@ericzakariasson)Grok 4.7 发布,官方称同价同速下较 Grok 4.6 显著提升
- X:SpaceXAI (@SpaceXAI)xAI 发布 Grok 4.7,同价同速下较 Grok 4.6 明显提升
- Hacker News:AI 热帖xAI 发布 Grok 4.7,主打编码与长时任务
xAI 发布 Grok 4.7,称其为目前编码与知识工作能力最强的模型,价格与速度与 Grok 4.6 持平,输入 $2、输出 $6 每百万 token。新模型采用更大的 base model 并加长强化学习训练,CursorBench 4.0 得分 46.3%,HackerBench v0.3 仅放行 3.3% 危险双用途提示。
- xAI:News精选xAI 发布 Grok 4.7,主打编码与知识工作
xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。
- Artificial Analysis 完整文章精选Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4
Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
本事件热度走势
当前热度 39·可比范围峰值 198(9月22日 13:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。