跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 601–620 条 · 共 716 条
3月19日周四
  1. Cursor Blog

    Composer 2 正式发布

    Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。

    推荐理由:Cursor发布Composer 2编程Agent,性能大幅提升且定价极具竞争力

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)

    OpenAI 将收购 Astral

    OpenAI 收购 Astral,加速 Codex 发展以支持下一代 Python 开发工具。Astral 是 Python 生态重要工具开发商,此次收购将整合其技术能力,强化 OpenAI 在开发者工具领域的布局。

    推荐理由:OpenAI收购Astral加强Codex Python工具链,Agent能力再升级

  3. Cognition 模型 / Devin 博客(网页)67

    Cognition 推出 managed Devins:Devin 可拆解任务并并行调度多个子 Devin

    Cognition 宣布 Devin 可将大型任务拆解并委派给多个并行运行的 managed Devins。每个子 Devin 在独立虚拟机中运行,拥有自己的终端、浏览器、开发环境和会话链接,主 Devin 负责拆分任务、分配工作、监控进度并汇总结果,还能读取子会话轨迹以改进后续任务拆解。用户可监控 ACU 消耗、发送中途指令、暂停或终止子会话。功能现已对所有用户开放。

    推荐理由:原文给出了多智能体协作的能力细节和适用场景,读者可以据此判断它是否适合拆解自己的大型编码任务。

  4. LlamaIndex:产品、工程与评测69

    LlamaIndex 开源 LiteParse:面向 AI Agent 的本地文档解析工具

    LlamaIndex 开源 LiteParse,一个完全本地运行的 CLI 和 TS 原生库,可从 PDF、Office 文档和图片中提取布局感知文本,无需 Python 依赖,内置 Tesseract.js OCR 并支持外接 PaddleOCR、EasyOCR 等 OCR 服务。

    推荐理由:开源工具主打本地快速解析加截图兜底的 Agent 模式,并自建评测对比 PyPDF 等基线,读者可评估是否迁移现有解析流程。

3月18日周三
  1. Greg Brockman

    OpenAI 发布 GPT-5.4 mini,已在 ChatGPT、Codex 及 API 上线。针对编程、计算机使用、多模态理解与 subagents 优化,速度较 GPT-5 mini 提升 2 倍。

    引用OpenAI@OpenAI

    GPT-5.4 mini 现已登陆 ChatGPT、Codex 和 API。 针对编程、计算机使用、多模态理解和子智能体进行了优化。而且它的速度是 GPT-5 mini 的 2 倍。 https://openai.com/index/introducing-gpt-5-4-mini-and-nano/ https://t.co/sirArgn37L

    推荐理由:OpenAI 发布 GPT-5.4 mini,针对编码和 Agent 优化且速度翻倍

  2. MiniMax:Blog(网页)61

    MiniMax M2.7:自我进化的早期回声

    M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。

    推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。

3月17日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    推出 GPT-5.4 mini 和 nano

    GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。

    推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化

  2. Greg Brockman

    Codex 新增 Subagents 功能,支持创建专业子代理并行处理任务,保持主上下文窗口整洁,并可实时引导单个代理,让工作流大幅提速。

    引用OpenAI Developers@OpenAIDevs

    子代理现已在 Codex 中可用。 你可以通过启动专门的代理来加速你的工作流程,以便: • 保持你的主上下文窗口干净 • 并行处理任务的不同部分 • 随着工作进展,分别引导各个代理 https://t.co/QJC2ZYtYcA

    推荐理由:OpenAI Codex 正式支持子代理,可并行处理复杂编程任务

  3. Sam Altman

    GPT 5.4 虽强,但最突出的是人性化特质。相比已擅长编程的 5.3,5.4 更受欢迎的关键在于个性而非纯能力。用户声称想要高效自闭症天才程序员,实际渴望的是有性格的互动体验。

    引用rohit@krishnanrohit

    GPT 5.4 非常出色,但它最显著的特征是它的人性化。5.3 Codex 在编程方面已经令人难以置信,所以看看是什么让它如此成功就很有意思了。 人们声称他们想要一个 10 倍自闭症天才程序员,但他们真正想要的是个性。

    推荐理由:Sam Altman谈GPT 5.4:人格魅力比纯编码能力更关键

  4. Greg Brockman

    Sam Altman 称赞 Codex 团队是硬核构建者,产品实力过硬,圈内硬核开发者已纷纷转向使用,使用量正快速增长。

    引用Sam Altman@sama

    Codex 团队是硬核的构建者,这一点在他们的作品中体现得淋漓尽致。我认识的硬核构建者全都转投了 Codex,这毫不意外。 Codex 的使用量正在飞速增长:https://t.co/lRKcNJDY8n

    推荐理由:OpenAI 高层确认 Codex 使用量激增,硬核开发者正集体迁移

3月16日周一
  1. 公众号:月之暗面(Kimi)60

    推荐:10万人亲测好用的原版OpenClaw安装器

    Kimi支持的个人开发者开源项目OneClaw下载量突破10万,提供一键安装包,1分钟即可在本地部署原版OpenClaw,无需命令行或环境配置。功能包括纯净卸载、自由切换模型、远程控制,支持连接飞书、企微、钉钉、QQ、Kimi Claw;内置2万+技能的技能商店,可无损迁移记忆和Skills。Kimi提供包月方案和API按需购买。使用地址:oneclaw.cn。

    推荐理由:如果你曾被 OpenClaw 的部署门槛劝退,OneClaw 可以让你两分钟跑起来,适合在备用机尝尝鲜,但别在生产环境乱搞。

  2. Mistral AI:News(网页)72

    Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

    Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

    推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

3月14日周六
  1. Boris Cherny

    Claude Code 推出远程控制功能,运行 `claude remote-control` 后可直接在手机 App 上启动电脑端新会话。该功能已向 Max、Team 及 Enterprise 用户(v2.1.74+)开放,目前需先在手机配置 GitHub,启动速度优化中。

    引用Noah Zweben@noahzweben

    远程控制 - 会话生成: 运行 claude remote-control,然后在移动应用中生成一个新的本地会话。 * 面向 Max、Team 和 Enterprise 推出(>=2.1.74) *已在移动端设置好 GH(即将放宽) * 正在努力加快会话启动时间 https://t.co/tFEe9hcZL6

    推荐理由:Claude Code 支持手机远程启动桌面会话,随时随地开启 Vibe Coding

3月12日周四
  1. Andrej Karpathy

    不是 IDE 时代结束,而是需要能管理 AI Agent 的"更大 IDE"。编程基本单位从文件变为 Agent,人类在更高层级编程。Karpathy 呼吁打造"Agent 指挥中心"式 IDE,支持多 Agent 状态监控、工具切换和用量统计。

    引用Andrej Karpathy@karpathy

    @nummanali tmux 网格很棒,但我觉得需要一个合适的“代理指挥中心”IDE,用于管理成队的代理,我可以按显示器将其最大化。例如,我想要显示/隐藏切换它们,查看是否有任何处于空闲状态,弹出相关工具(例如终端)、统计信息(使用情况)等。

    推荐理由:Karpathy 提出 Agent 时代 IDE 演进方向:从文件到 Agent 的编程范式转变

3月10日周二
  1. METR:Notes(网页)62

    METR 研究:约半数通过 SWE-bench Verified 的 AI PR 不会被维护者合并

    METR 让 scikit-learn、Sphinx、pytest 的 4 位维护者盲审 296 个 AI 生成的 PR,发现约一半通过 SWE-bench Verified 自动评分的补丁不会被合并进主分支;经金标准基线归一后,维护者合并率平均比自动评分低 24.2 个百分点。研究强调 AI 补丁未像人类开发者那样获得迭代反馈,不应据此断言是能力上限,但直接按基准分数推断智能体实际用处可能高估。

    推荐理由:研究用真实仓库维护者盲审 AI 补丁,量化了 SWE-bench 分数与实际可合并之间的差距,为解读编码基准提供了参照。

3月8日周日
3月6日周五
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)

    Codex Security 开放研究预览

    Codex Security 开放研究预览。这款 AI 应用安全代理通过分析项目上下文,检测、验证并修复复杂漏洞,相比传统方案具备更高置信度和更低误报率。

    推荐理由:OpenAI发布Codex安全Agent,可自动检测修复代码漏洞