跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 681–700 条 · 共 716 条
9月16日周二
  1. Noam Brown

    OpenAI 发布 GPT-5-Codex,针对智能体编程优化的 GPT-5 版本。简单查询响应速度提升10倍,复杂查询思考时间延长2倍以获得更多算力支持。已上线 Codex CLI、IDE 插件、网页、移动端及 GitHub 代码审查。

    引用OpenAI@OpenAI

    我们发布 GPT-5-Codex —— 这是 GPT-5 的一个版本,针对 Codex 中的智能体编程做了进一步优化。 可在 Codex CLI、IDE 扩展、网页、移动端中使用,并可用于 Github 中的代码审查。https://openai.com/index/introducing-upgrades-to-codex/

    推荐理由:GPT-5-Codex 发布,针对 Agentic 编码优化,可动态分配计算资源,简单查询快 10 倍

9月8日周一
  1. Cognition 模型 / Devin 博客(网页)70

    Cognition 融资超 4 亿美元,估值达 102 亿美元

    Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。

    推荐理由:官方披露融资估值的同时给出 ARR、净消耗和并购后的增长数字,读者可以据此评估其 AI 编码业务的真实成色。

9月2日周二
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Platform 发布 Code Execution Tool v2 公测版,支持 Bash 命令与文件操作

    Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。

    推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。

8月28日周四
  1. xAI:News(网页)

    xAI发布轻量级编程模型Grok Code Fast 1

    xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。

    推荐理由:xAI发布专为Agentic Coding优化的极速编程模型,已集成Cursor、Copilot等主流工具,价格极具竞争力

8月21日周四
  1. Linear:Now(RSS)60

    Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

    Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。

    推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。

8月20日周三
  1. Johann Rehberger / Embrace The Red(RSS)77

    Amazon Q Developer VS Code 插件被曝可通过提示词注入执行任意代码

    安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 插件(下载量超 100 万)存在间接提示词注入漏洞,可利用被归类为 readonly 的 find 命令的 -exec 参数绕过人工确认,在开发者主机上执行任意命令,甚至可诱导 Claude 4 下载远程指令并让 Sliver 恶意软件加入 C2 服务器。

    推荐理由:作者完整复现了从间接提示词注入到任意代码执行的攻击链,并附绕过 Claude 拒答的细节,可帮助开发者理解此类漏洞的成因与防护。

8月13日周三
  1. METR:Research(网页)61

    METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

    METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。

    推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月7日周四
  1. OpenRouter:Announcements(RSS)68

    GPT-5 已在 OpenRouter 上线

    GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。

    推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。

  2. OpenRouter:Announcements(RSS)68

    GPT-5 现已上线

    OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

    推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。

  3. OpenRouter:Announcements(RSS)66

    GPT-5 现已上线

    GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。

    推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

7月31日周四
  1. LMSYS:Blog(Chatbot Arena 团队)

    智谱发布 GLM-4.5 系列模型并原生支持 SGLang

    智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

    推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月14日周一
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 模型现可在 Cursor 中使用:试试月之暗面 Kimi K2

    OpenRouter 宣布其灵活模型路由支持在 Cursor 中运行月之暗面的 Kimi K2。用户可直接在 Cursor 中调用 OpenRouter 路由的模型,无需额外配置。

    推荐理由:一篇将 OpenRouter 模型接入 Cursor 的实操指南,虽然已过时三百多天,但对想免配置用 Kimi K2 的 Cursor 用户仍有参考价值。

  2. Cognition 模型 / Devin 博客(网页)79

    Cognition 签约收购智能体 IDE 公司 Windsurf

    Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。

    推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月11日周五
  1. Moonshot AI:Kimi Blog

    Kimi 发布 K2 模型

    Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。

    推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA

7月10日周四
  1. METR:Research(网页)79

    METR 研究发现早期2025年AI工具使资深开源开发者完成任务耗时增加19%

    METR 的随机对照实验让16名资深开源开发者处理246个真实issue,允许使用AI(主要是Cursor Pro 搭配 Claude 3.5/3.7 Sonnet)时完成耗时反而增加19%。

    推荐理由:原文给出RCT实验设计和开发者预期与实测的反差数据,读者可以据此校准对AI编码工具收益的判断。

7月1日周二
  1. Factory 研究 / 产品(RSS)70

    Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

    Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。

    推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。

6月17日周二
  1. Saining Xie

    所以这不是一个针对软件工程智能体的基准测试。它旨在通过编程测试核心推理与智能——由一些顶尖竞技程序员撰写的 71 页深度分析作为支撑。

    引用Zihan Zheng@ZihanZheng71803

    我们推出 LiveCodeBench Pro,一个实时、极具挑战性的基准测试,包含来自 IOI、Codeforces 和 ICPC 的竞赛编程题目。 诸如 o3 和 Gemini 2.5 等前沿模型在 Hard 划分上得分为 0%。 排行榜:https://livecodebenchpro.com/ https://t.co/pwxQNicEnr

    推荐理由:o3与Gemini 2.5在IOI级竞赛题上零分,LLM推理天花板显现

6月12日周四
  1. Cognition 模型 / Devin 博客(网页)71

    Cognition 撰文反对构建多智能体系统,提出上下文工程两条原则

    Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。

    推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。

6月5日周四
5月15日周四
  1. Cognition 模型 / Devin 博客(网页)65

    Devin 2.1 发布:任务置信评级、Linear/Jira 集成与内置代码库理解

    Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。

    推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。