跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 561–580 条 · 共 716 条
4月10日周五
  1. Epoch AI:研究、数据与评测69

    Epoch AI 发布 MirrorCode 初步结果:Claude Opus 4.6 可完全重实现 1.6 万行的 gotree

    Epoch AI 与 METR 联合开发的 MirrorCode 基准初步结果显示,AI 在无源码、仅有可执行权限和详细可检验规格的条件下能完全重实现真实软件,Claude Opus 4.6 成功重实现约 16,000 行 Go 代码、含 40+ 命令的生物信息学工具 gotree,四位工程师估计人类需 2-17 周。

    推荐理由:原文给出可复现的黑盒重实现评测设计与关键数字,读者可以据此判断长时程自主编码能力的边界与前提。

4月8日周三
  1. Cursor Blog66

    Bugbot 现可通过学习规则实现自我改进

    Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。

    推荐理由:AI code review 赛道卷了两年,Bugbot 78% 的解决率终于把第二名甩开 15 个点,关键不是分数而是它开始从真实 PR 反馈里自动学规则,做 code review 工具的该认真看看这套闭环逻辑。

  2. Cognition 模型 / Devin 博客(网页)63

    Cognition 拆解 Devin 如何在财富 500 强企业现代化 COBOL

    Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。

    推荐理由:原文梳理了 COBOL 难倒智能体的三个原因和可落地的两类场景,并给出迁移成本下降等具体案例,方法可参考。

4月7日周二
  1. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布软件工程智能体模型 SWE-1.6,上线 Windsurf

    Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。

    推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。

4月5日周日
  1. Greg Brockman

    Codex应用服务器为开发者提供了构建AI代理应用的便捷基础设施。用户不仅可将ChatGPT账户与任意工具框架对接,还能直接在其上开发自定义应用。该系统通过开放端点实现跨设备无缝同步——会话、技能、代理、文件夹及提示词等数据可在手机与电脑间自动流转。以"kitty litter"应用为例,开发者无需从零构建底层架构,即可接入App Server获得统一的移动端与桌面端体验。这种设计显著降低了开发门槛,提供了优秀的用户体验与开发者体验。

    引用am.will@LLMJunky

    Codex 应用服务器是一次极具远见的绝妙之举,却真的没有得到足够的赞赏 你不仅可以在任何 harness 中使用你的 chatgpt 账号,还可以直接基于他们的产品构建你自己的应用。 他们就是让基于 codex 和用 codex 进行构建变得如此出色的体验 为了展示这种实用性,我想重点介绍一下由 @SIGKITTEN 制作的 kitty litter 应用。 他不必构建整个 harness 以及所有基础设施,而是接入了应用服务器,从而在移动端和开发机之间获得统一的体验。 当我在电脑上创建一个会话时,它会自动在我的手机上可用。你在本视频中看到的所有聊天,都是在我们连接到应用服务器时自动填充的。 我所有的技能。我的智能体。我的会话。我的文件夹。我的提示词。它们都随时可用——自动地。 因为它们由应用服务器暴露出来,还有许多其他端点。 这是一种很棒的 ux/dx,真的值得一些喜爱。 这几乎就像是他们希望你在他们的产品之上进行构建 ;) 顺便说一句,Litter 很棒 👍

    推荐理由:OpenAI 官方背书 Codex 平台扩展能力,开发者可快速构建跨设备同步的 Agent 应用

4月3日周五
  1. Claude

    Claude Cowork 与 Claude Code Desktop 的 Computer use 功能正式登陆 Windows,结束 macOS 独占。该功能支持 Claude 直接控制电脑打开应用、浏览网页、填写表格等,完成各类桌面任务。

    引用Claude@claudeai

    你现在可以让 Claude 使用你的电脑来完成任务。 它可以打开你的应用程序、浏览你的浏览器、填写电子表格——任何你在桌前能做的事情。 研究预览版现已登陆 Claude Cowork 和 Claude Code,仅限 macOS。https://t.co/sVymgmtEMI

    推荐理由:Claude电脑控制功能登陆Windows,开发者现可在PC端调用AI自动化操作办公任务。

  2. Greg Brockman

    OpenAI 调整 Codex 定价策略,推出 $0 起步的纯 Codex 席位,完全按使用量付费。年付团队席位从 $25/月降至 $20/月,每新增一个席位赠送 $100 积分(最高 $500),方便团队零成本试用。

    引用Rohan Varma@rohanvarma

    我们刚刚让团队试用 Codex 变得毫无阻力! > 全新的 $0 Codex 专属席位,仅用于 Codex 访问,完全按使用量计费 > 年度团队席位从每月 $25 降至 $20 你每为新工作区或现有工作区添加一个 Codex 专属席位,我们就为你的团队返还 $100,最高可达 $500!💰 免费开始使用,只为实际用量付费 🤌🏾 https://openai.com/index/codex-flexible-pricing-for-teams/

    推荐理由:OpenAI 调整 Codex 定价策略,推出 $0 起步的按量付费模式,大幅降低团队试用门槛

4月2日周四
  1. Cursor Blog

    Cursor 3.0 发布:以 Agent 为核心的统一开发空间

    Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。

    推荐理由:Cursor 3 重磅发布:原生 Agent 工作流、云地无缝切换与多仓库管理

  2. Claude Code:GitHub Releases(RSS)

    Claude Code v2.1.90 版本更新

    Claude Code 发布 v2.1.90 版本。新增 `/powerup` 交互式教程命令,通过动画演示教授功能使用;增加环境变量支持离线环境保留 marketplace 缓存。修复多项关键 bug:解决速率限制对话框崩溃、`--resume` 缓存未命中、编辑操作与 format-on-save 冲突等问题。性能方面优化 MCP 工具缓存、SSE 传输及长对话转录效率。同时移除 DNS 缓存查询自动权限以增强隐私,并加固 PowerShell 工具权限检查。

    推荐理由:Claude Code新增/powerup交互式教程与多项性能优化,提升开发体验

  3. Claude:Blog(网页)

    构建 Claude 应用的三大最佳实践

    Anthropic 分享构建 Claude 应用的三大实践:使用 Claude 已掌握的通用工具(如 bash 和文本编辑器);允许其自行编排工具调用链,减少不必要的上下文回传以降低 token 消耗;随着模型能力进化,重新评估 agent harness 的预设限制。实测显示,让 Opus 4.6 自主过滤工具输出,在 BrowseComp 基准测试中准确率从 45.3% 提升至 61.6%。

    推荐理由:Anthropic官方分享构建Claude Agent的三大最佳实践,含模型性能数据与代码编排技巧

3月31日周二
  1. Trail of Bits:AI安全研究72

    Trail of Bits 如何让公司走向 AI 原生:从 5% 接受到 94 个插件、201 个技能

    Trail of Bits 分享其一年内将 AI 采用率从约 5% 推到全公司落地的系统方法,目前已有 94 个插件、201 个技能、84 个专用智能体,部分审计项目每周发现的漏洞从约 15 个增至 200 个,约 20% 的客户报告漏洞最初由 AI 发现。

    推荐理由:Trail of Bits 以亲历者身份复盘内部 AI 化的完整系统,给出心理障碍分析和可复制的组织方法,适合参考落地路径。

  2. Artificial Analysis

    KwaiKAT发布非推理代码模型KAT-Coder-Pro V2,在Artificial Analysis Intelligence Index获44分,较V1提升8分,与Claude Sonnet 4.6持平。该模型token效率显著,运行仅需约9M输出token,远低于Claude系列及DeepSeek等推理模型。Agent能力大幅提升,Terminal-Bench Hard得分49%(提升40个百分点),匹配Claude Opus 4.6。成本降至73美元,响应速度达109 token/秒。但在长上下文推理和知识回忆方面较V1有所退步。

    推荐理由:快手发布 KAT-Coder-Pro V2,非推理架构实现 44 分智能指数,Agent 能力跃升 40 个百分点,成本仅为 Claude Sonnet 的 5%。

3月30日周一
3月28日周六
  1. Greg Brockman

    OpenAI 推出 Codex use cases 示例库,涵盖编程与非编程任务的实用场景。用户可在 Codex 应用中直接打开各用例的 starter prompt 开始使用。

    引用Romain Huet@romainhuet

    我们刚刚推出了 Codex 用例! 这是一个涵盖编程和非编程任务的实用示例库,提供了使用 Codex 的真实方式。 我特别喜欢的一点是:如果你有这款应用,你可以直接在 Codex 中打开每个用例的起始提示词! https://developers.openai.com/codex/use-cases

    推荐理由:OpenAI Codex 推出使用案例库,覆盖编程与日常任务,可直接在应用中试用。

3月27日周五
  1. Cursor Blog72

    Composer 2技术报告:面向智能体软件工程的代码模型训练

    本报告介绍了代码模型Composer 2的训练过程。该模型基于开源基础模型Kimi K2.5,通过两阶段训练:首先进行侧重代码的持续预训练以深化编码知识,随后在高度模拟真实Cursor环境的大规模强化学习中提升端到端智能体性能。在自建的真实任务评估集CursorBench上,Composer 2得分为61.3,较前代提升37%,与前沿模型性能相当。在公开基准SWE-bench Multilingual和Terminal-Bench上分别获得73.7和61.7分,并在保持高精度的同时实现了显著更低的推理成本。训练依托为Blackwell GPU定制的高效MoE训练内核、跨区域异步强化学习管道等大规模基础设施完成。

    推荐理由:Cursor 把 Composer 2 的训练全流程摊开讲了,从 Kimi K2.5 继续预训练到大规模 RL,关键是 RL 在真实 Cursor 会话里跑,不是玩具环境。做 coding agent 的团队,这份报告值得逐段拆。

  2. OpenAI Developers

    Codex 已重置所有套餐的使用限制,方便用户体验新推出的插件。现在可以无限制地使用 Codex 构建项目,尽情尝试。

    引用Tibo@thsottiaux

    大家好。我们已经重置了所有套餐的 Codex 使用限制,让大家可以尽情体验我们刚刚推出的出色插件,也因为已经有一段时间了! 你可以用 Codex 无限制地构建任何东西。玩得开心!

    推荐理由:OpenAI Codex重置使用限制并推新插件,开发者可无限构建应用