我们发布 GPT-5-Codex —— 这是 GPT-5 的一个版本,针对 Codex 中的智能体编程做了进一步优化。 可在 Codex CLI、IDE 扩展、网页、移动端中使用,并可用于 Github 中的代码审查。https://openai.com/index/introducing-upgrades-to-codex/
推荐理由:GPT-5-Codex 发布,针对 Agentic 编码优化,可动态分配计算资源,简单查询快 10 倍
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
我们发布 GPT-5-Codex —— 这是 GPT-5 的一个版本,针对 Codex 中的智能体编程做了进一步优化。 可在 Codex CLI、IDE 扩展、网页、移动端中使用,并可用于 Github 中的代码审查。https://openai.com/index/introducing-upgrades-to-codex/
推荐理由:GPT-5-Codex 发布,针对 Agentic 编码优化,可动态分配计算资源,简单查询快 10 倍
Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。
推荐理由:官方披露融资估值的同时给出 ARR、净消耗和并购后的增长数字,读者可以据此评估其 AI 编码业务的真实成色。
Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。
推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。
xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。
推荐理由:xAI发布专为Agentic Coding优化的极速编程模型,已集成Cursor、Copilot等主流工具,价格极具竞争力
Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。
推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。
安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 插件(下载量超 100 万)存在间接提示词注入漏洞,可利用被归类为 readonly 的 find 命令的 -exec 参数绕过人工确认,在开发者主机上执行任意命令,甚至可诱导 Claude 4 下载远程指令并让 Sliver 恶意软件加入 C2 服务器。
推荐理由:作者完整复现了从间接提示词注入到任意代码执行的攻击链,并附绕过 Claude 拒答的细节,可帮助开发者理解此类漏洞的成因与防护。
METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。
推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。
GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。
推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。
推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案
OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。
推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。
Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。
推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。
Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。
推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA
METR 的随机对照实验让16名资深开源开发者处理246个真实issue,允许使用AI(主要是Cursor Pro 搭配 Claude 3.5/3.7 Sonnet)时完成耗时反而增加19%。
推荐理由:原文给出RCT实验设计和开发者预期与实测的反差数据,读者可以据此校准对AI编码工具收益的判断。
Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。
推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。
所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能——由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。
我们推出 LiveCodeBench Pro,一个实时、极具挑战性的基准测试,包含来自 IOI、Codeforces 和 ICPC 的竞赛编程题目。 诸如 o3 和 Gemini 2.5 等前沿模型在 Hard 划分上得分为 0%。 排行榜:https://livecodebenchpro.com/ https://t.co/pwxQNicEnr
推荐理由:o3与Gemini 2.5在IOI级竞赛题上零分,LLM推理天花板显现
Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。
推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。
TensorZero 团队将自家的开源框架作为自托管代理接入 Cursor,经 Ngrok 和 Nginx 绕过 Cursor 服务器与 CORS 限制后,成功观察并控制其全部 LLM 调用。
推荐理由:作者实测把自托管代理接进 Cursor,读者可以照着复现并查看其真实提示词与模型调用。
Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。
推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。