Composer 2 正式发布
Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。
推荐理由:Cursor发布Composer 2编程Agent,性能大幅提升且定价极具竞争力
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。
推荐理由:Cursor发布Composer 2编程Agent,性能大幅提升且定价极具竞争力
OpenAI 收购 Astral,加速 Codex 发展以支持下一代 Python 开发工具。Astral 是 Python 生态重要工具开发商,此次收购将整合其技术能力,强化 OpenAI 在开发者工具领域的布局。
推荐理由:OpenAI收购Astral加强Codex Python工具链,Agent能力再升级
Cognition 宣布 Devin 可将大型任务拆解并委派给多个并行运行的 managed Devins。每个子 Devin 在独立虚拟机中运行,拥有自己的终端、浏览器、开发环境和会话链接,主 Devin 负责拆分任务、分配工作、监控进度并汇总结果,还能读取子会话轨迹以改进后续任务拆解。用户可监控 ACU 消耗、发送中途指令、暂停或终止子会话。功能现已对所有用户开放。
推荐理由:原文给出了多智能体协作的能力细节和适用场景,读者可以据此判断它是否适合拆解自己的大型编码任务。
LlamaIndex 开源 LiteParse,一个完全本地运行的 CLI 和 TS 原生库,可从 PDF、Office 文档和图片中提取布局感知文本,无需 Python 依赖,内置 Tesseract.js OCR 并支持外接 PaddleOCR、EasyOCR 等 OCR 服务。
推荐理由:开源工具主打本地快速解析加截图兜底的 Agent 模式,并自建评测对比 PyPDF 等基线,读者可评估是否迁移现有解析流程。
GPT-5.4 mini 现已登陆 ChatGPT、Codex 和 API。 针对编程、计算机使用、多模态理解和子智能体进行了优化。而且它的速度是 GPT-5 mini 的 2 倍。 https://openai.com/index/introducing-gpt-5-4-mini-and-nano/ https://t.co/sirArgn37L
推荐理由:OpenAI 发布 GPT-5.4 mini,针对编码和 Agent 优化且速度翻倍
GPT-5.4 mini 今日在 ChatGPT、Codex 和 API 中可用。针对编程、计算机使用、多模态理解和子代理场景优化,推理速度比 GPT-5 mini 快 2 倍。
推荐理由:OpenAI 发布 GPT-5.4 mini,支持子代理且速度翻倍
M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。
推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。
GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。
推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化
Codex 新增 Subagents 功能,支持创建专业子代理并行处理任务,保持主上下文窗口整洁,并可实时引导单个代理,让工作流大幅提速。
子代理现已在 Codex 中可用。 你可以通过启动专门的代理来加速你的工作流程,以便: • 保持你的主上下文窗口干净 • 并行处理任务的不同部分 • 随着工作进展,分别引导各个代理 https://t.co/QJC2ZYtYcA
推荐理由:OpenAI Codex 正式支持子代理,可并行处理复杂编程任务
GPT 5.4 虽强,但最突出的是人性化特质。相比已擅长编程的 5.3,5.4 更受欢迎的关键在于个性而非纯能力。用户声称想要高效自闭症天才程序员,实际渴望的是有性格的互动体验。
GPT 5.4 非常出色,但它最显著的特征是它的人性化。5.3 Codex 在编程方面已经令人难以置信,所以看看是什么让它如此成功就很有意思了。 人们声称他们想要一个 10 倍自闭症天才程序员,但他们真正想要的是个性。
推荐理由:Sam Altman谈GPT 5.4:人格魅力比纯编码能力更关键
Sam Altman 称赞 Codex 团队是硬核构建者,产品实力过硬,圈内硬核开发者已纷纷转向使用,使用量正快速增长。
Codex 团队是硬核的构建者,这一点在他们的作品中体现得淋漓尽致。我认识的硬核构建者全都转投了 Codex,这毫不意外。 Codex 的使用量正在飞速增长:https://t.co/lRKcNJDY8n
推荐理由:OpenAI 高层确认 Codex 使用量激增,硬核开发者正集体迁移
Kimi支持的个人开发者开源项目OneClaw下载量突破10万,提供一键安装包,1分钟即可在本地部署原版OpenClaw,无需命令行或环境配置。功能包括纯净卸载、自由切换模型、远程控制,支持连接飞书、企微、钉钉、QQ、Kimi Claw;内置2万+技能的技能商店,可无损迁移记忆和Skills。Kimi提供包月方案和API按需购买。使用地址:oneclaw.cn。
推荐理由:如果你曾被 OpenClaw 的部署门槛劝退,OneClaw 可以让你两分钟跑起来,适合在备用机尝尝鲜,但别在生产环境乱搞。
Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。
推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。
远程控制 - 会话生成: 运行 claude remote-control,然后在移动应用中生成一个新的本地会话。 * 面向 Max、Team 和 Enterprise 推出(>=2.1.74) *已在移动端设置好 GH(即将放宽) * 正在努力加快会话启动时间 https://t.co/tFEe9hcZL6
推荐理由:Claude Code 支持手机远程启动桌面会话,随时随地开启 Vibe Coding
100 万上下文窗口:现已面向 Claude Opus 4.6 和 Claude Sonnet 4.6 全面开放。https://t.co/jreruGukcm
推荐理由:Claude Code 默认启用 Opus 4.6 百万上下文,长代码处理能力大幅提升
@nummanali tmux 网格很棒,但我觉得需要一个合适的“代理指挥中心”IDE,用于管理成队的代理,我可以按显示器将其最大化。例如,我想要显示/隐藏切换它们,查看是否有任何处于空闲状态,弹出相关工具(例如终端)、统计信息(使用情况)等。
推荐理由:Karpathy 提出 Agent 时代 IDE 演进方向:从文件到 Agent 的编程范式转变
推荐理由:Google Workspace 全面升级 Gemini 能力,文档表格幻灯片 AI 功能今日上线
METR 让 scikit-learn、Sphinx、pytest 的 4 位维护者盲审 296 个 AI 生成的 PR,发现约一半通过 SWE-bench Verified 自动评分的补丁不会被合并进主分支;经金标准基线归一后,维护者合并率平均比自动评分低 24.2 个百分点。研究强调 AI 补丁未像人类开发者那样获得迭代反馈,不应据此断言是能力上限,但直接按基准分数推断智能体实际用处可能高估。
推荐理由:研究用真实仓库维护者盲审 AI 补丁,量化了 SWE-bench 分数与实际可合并之间的差距,为解读编码基准提供了参照。
GPT-5.4 在编程、知识工作、计算机使用等方面表现出色,很高兴看到大家如此喜欢它。 但它也是我最喜欢聊天的模型!我们在模型个性方面已经偏离目标有一段时间了,所以能朝着正确方向前进感觉特别好。
推荐理由:GPT-5.4获Sam Altman盛赞,对话体验与Agent能力双双突破
Codex Security 开放研究预览。这款 AI 应用安全代理通过分析项目上下文,检测、验证并修复复杂漏洞,相比传统方案具备更高置信度和更低误报率。
推荐理由:OpenAI发布Codex安全Agent,可自动检测修复代码漏洞