@poolsideai 的首批公开基础模型刚刚在 OpenRouter 上发布! Laguna M.1 和 Laguna XS.2。专为智能体编码和长周期工作从头构建。限时免费 ⬇️
推荐理由:Poolside 终于把自家模型放出来了,主打长上下文 agentic coding,免费期是薅羊毛窗口。做 coding agent 的团队值得拿 Laguna 跑一轮自己的 benchmark,看看和 Claude、Codex 的真实差距。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
@poolsideai 的首批公开基础模型刚刚在 OpenRouter 上发布! Laguna M.1 和 Laguna XS.2。专为智能体编码和长周期工作从头构建。限时免费 ⬇️
推荐理由:Poolside 终于把自家模型放出来了,主打长上下文 agentic coding,免费期是薅羊毛窗口。做 coding agent 的团队值得拿 Laguna 跑一轮自己的 benchmark,看看和 Claude、Codex 的真实差距。
Symphony 是一个用于 Codex 编排的开源规范,能够将问题跟踪器转化为持续运行的智能体系统。该系统通过自动化任务协调与执行,显著提升工程团队的产出效率,同时减少开发者在不同任务间频繁切换带来的认知负担。其核心在于以标准化、可扩展的方式,将日常开发流程转化为由智能体持续驱动的工作流。
推荐理由:OpenAI 把 Codex 的编排层抽成开源规范,等于告诉所有做 coding agent 的团队,底层调度逻辑不用自己造轮子了。做 AI 编程工具的值得花半小时看架构思路。
本次更新为 Claude Code 带来多项增强与修复。新增功能包括 MCP 服务器的 `alwaysLoad` 配置、`claude plugin prune` 命令以及 `/skills` 界面搜索框。用户体验方面,优化了全屏模式滚动、对话框键盘滚动和长 URL 点击体验。重点修复了处理多张图片或使用 `/usage` 命令时可能出现的数 GB 内存泄漏问题,并解决了 Bash 工具在工作目录被删除后失效等稳定性缺陷。此外,还改进了 MCP 服务器的错误重试机制和终端会话标题的本地化显示。
推荐理由:Claude Code 这版修了一堆让人抓狂的内存泄漏和崩溃问题,加上 alwaysLoad 和 plugin prune 两个实用功能,重度用户值得立刻升级,但对非用户来说只是例行迭代。
小米 MiMo-V2.5 现已正式开源! 采用 MIT 许可证,支持商业部署、继续训练和微调——无需额外授权。 两个模型均支持 1M 模型 token 上下文窗口: • MiMo-V2.5-Pro:专为复杂智能体和编码任务构建,在 GDPVal-AA 和 ClawEval 上排名开源模型第一 • MiMo-V2.5:原生全模态模型,具备强大的智能体能力 模型的价值不由排名衡量——而由它解决的问题来衡量。 现在就与 MiMo 一起构建吧! 🤗 权重:https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 博客:https://mimo.xiaomi.com/index#blog
推荐理由:小米这次把 1T 参数的 Code Agent 模型直接 MIT 开源,还送 100T 免费 token,诚意拉满。做 coding agent 的团队值得认真看看,这可能是目前开源阵营里最强的代码智能体基座。
推荐理由:OpenAI 把 Codex 从单次对话变成了任务队列的常驻工人,Symphony 这个开源编排层让 issue 自动派发 agent,做工程管理的人可以认真看看这个范式。


推荐理由:小米把 MiMo-V2.5 直接 MIT 开源且支持商用,1M 上下文 + Agent 能力在开源阵营里确实能打,做 Agent 产品的团队值得花半小时跑一下 benchmark 看看真实水平。
自6月1日起,GitHub Copilot 的使用将开始消耗 GitHub AI Credits,计费模式正式从固定订阅制转变为基于实际使用量的计费。这一变化意味着用户的费用将与 AI 助手的具体调用量直接挂钩,而非统一的月费或年费。
推荐理由:GitHub Copilot 从订阅制转向按量计费,这是 AI 编程工具定价范式的标志性拐点,所有重度用户和竞品都得重新算账。
OpenAI宣布停止使用SWE-bench Verified基准评估前沿编码能力。该基准基于GitHub历史问题构建,其任务分布已无法准确反映当前AI编码助手需解决的实际问题类型。随着模型性能提升,基准测试集趋于饱和,区分度下降,现有模型表现已接近人类水平。因此,团队将转向更具挑战性和现实复杂度的新评估方法。
推荐理由:OpenAI 亲自给 SWE-bench Verified 判了死刑,这比任何第三方评测都有说服力。做 coding agent 选型的人该认真想想,你的 benchmark 体系是不是也该换了。
Cognition 发布 Devin CLI,一个可在本地终端运行、完整访问代码库和工具的编码 Agent,可选 Opus 4.7、GPT-5.5 和自家 SWE-1.6 等模型,并用 Rust 编写终端渲染库提升 UI 速度。
推荐理由:官方介绍了本地终端 Agent 与云端会话交接的组合玩法,多智能体并行、沙箱隔离等差异点对编码工作流有直接参考。
🆕 @OpenAIDevs GPT-5.5 现已正式发布,并正在 GitHub Copilot 中逐步推出。 我们的早期测试显示 ➡️ 它在复杂的智能体编程任务上表现最为出色 ➡️ 它能解决此前 GPT 模型无法解决的现实世界编程难题 在 Copilot CLI 或 @code 中试用吧。👇 https://github.blog/changelog/2026-04-24-gpt-5-5-is-generally-available-for-github-copilot/
推荐理由:GPT-5.5 进 Copilot 不是模型发布那么简单,它意味着最强编码模型第一次以默认选项塞进每个开发者的 IDE 里,做 coding agent 的团队该重新跑一遍自己的 benchmark 了。
非常兴奋 GPT-5.5 今天正在向 GitHub Copilot、M365 Copilot、Copilot Studio 和 Foundry 推出。 凭借更深入的推理、更强的多步骤执行能力,以及在漫长复杂任务中更出色的表现,GPT-5.5 帮助你更快地从想法走向执行,用更少的迭代就能得到正确的结果。 这一切都是为了帮助你在整个工作流程中,为合适的任务选择正确的模型,或多个模型。
推荐理由:GPT-5.5 本身是代际级更新,但这条推文只是转发 Nadella 的官宣,没有新数据或新角度。真正值得关注的是它已经铺进 Copilot 全线,做编码和办公场景的人今天就能摸到。
OpenRouter Agent SDK 提供 create-agent-tui 和 create-headless-agent 两种技能,可在几分钟内脚手架搭建个性化编码智能体。前者附带终端 UI,后者为无头模式,适用于脚本与管道自动化场景。
推荐理由:虽然隔了一个多月,但这个官方教程把 Agent SDK 的脚手架玩法拆得很透,想自己搭 coding agent 的开发者抄一遍就能跑起来,省得从头写 harness。
Claude 代码工具发布 v2.1.119 版本,带来多项功能优化与问题修复。主要更新包括:用户配置现持久化至本地文件;新增 `prUrlTemplate` 设置以自定义 PR 徽章链接;`--from-pr` 命令扩展支持 GitLab、Bitbucket 等多个平台。工具权限与交互行为在多处实现统一,例如 `--print` 模式现在遵从代理的前置元数据定义。界面体验获得改进,如斜杠命令建议会高亮匹配字符,长描述自动换行。此外,本次更新修复了大量已知问题,涉及粘贴格式错乱、工具意外隐藏、MCP 服务器连接失败、权限模式行为异常及界面显示错误等。
推荐理由:Claude Code 这次更新全是打磨细节,没有大功能但修了一堆让人骂娘的 bug,重度用户值得升级,其他人等下一个大版本也行。
OpenAI 发布了新一代模型 GPT-5.5。其上下文窗口从 GPT-5 的 128K 大幅扩展至 512K,推理速度提升约 40%,在多模态理解与代码生成基准测试中表现显著超越前代。模型在复杂指令遵循和长文档处理方面能力突出,同时 API 调用成本降低了 30%。这一升级被视为通向通用人工智能(AGI)道路上的一个重要里程碑。
推荐理由:Ethan Mollick 拿 GPT-5.5 压测了论文写作和游戏设计,代际提升肉眼可见,但锯齿前沿仍未消失。这篇一手实测告诉你当前能力的天花板和暗角,比任何官方博客都值得看。
OpenAI 正式推出 GPT-5.5,该模型被定义为一种代理模型,能够通过自主切换多种工具来完成复杂任务。公司宣称其代表了一种“新型智能”。与此同时,GPT-5.5 的 API 调用价格将提升至原来的两倍。
推荐理由:GPT-5.5 是 OpenAI 的又一次代际发布,核心在 agentic 能力,但 API 价格翻倍可能让中间层开发者犹豫。基准上领先但非全面碾压,值得关注长上下文和 Pro 版的重度研究场景。
OpenAI推出迄今最智能的GPT-5.5模型,其速度更快、能力更强,专为处理跨工具的复杂任务而构建。该模型在编程、学术研究与数据分析等领域表现出显著提升,能够高效整合多工具工作流,旨在应对更高阶的专业需求。
推荐理由:我觉得 GPT-5.5 第一次让大模型在“自主干活”上接近可用,不仅编码更强,还能帮科学家做研究,这是 Agent 从 Demo 到工具的关键一步。
该内容探索了10个实用的ChatGPT Codex用例,旨在自动化任务、创建交付物,并将真实的输入转化为跨工具、文件和工作流的输出。
推荐理由:虽然发布一月有余,但官方整理的十个 Codex 日常自动化用例依然是最佳上手模板,从邮件整理到数据报表,产品人和运营可以直接抄作业。
SWE-chat是首个从开源开发者真实工作环境中收集的大规模代码智能体交互数据集,目前已包含6000个会话、超过6.3万条用户提示和35.5万次智能体工具调用。研究发现代码编写模式呈现双峰分布:41%的会话中智能体几乎编写了所有提交代码,而23%的会话完全由人工编写。尽管能力快速提升,代码智能体在自然场景中效率仍不理想,仅44%的智能体生成代码最终被用户采纳,且其代码比人工代码引入更多安全漏洞。用户在44%的交互轮次中会对智能体输出进行修正、报告失败或中断操作。该数据集通过完整记录人机代码归属的交互轨迹,为超越人工基准测试、基于实证理解AI智能体在真实开发流程中的表现提供了基础。
推荐理由:这是目前唯一来自真实开发者的编码代理交互数据集,揭示代理产出的代码存活率仅44%,且引入更多安全漏洞,对于所有推代理的团队都是必读的现实检验。
Qwen 发布 Qwen3.6-27B 开源模型,这款 27B 参数的稠密模型在编码基准测试中超越了上一代 397B 总参数/17B 激活参数的 MoE 旗舰模型 Qwen3.5-397B-A17B。模型体积从 807GB 大幅缩减至 55.6GB,16.8GB 的量化版本即可在本地运行,生成速度约 25 tokens/s。实测显示其能生成复杂的 SVG 图形代码,展现出旗舰级的编程能力。
推荐理由:通义千问 3.6 27B 用 55GB 瘦身换来了超 397B MoE 的编码能力,Simon 亲手跑出的 SVG 效果惊艳,2026 年最值得本地部署的开源小模型。
Responses API 集成 WebSockets 技术优化 Codex 智能体循环架构。通过建立持久化连接并引入连接级缓存机制,该方案显著降低 API 通信开销,有效缩短模型响应延迟。这一技术改进解决了传统请求模式下的性能瓶颈,为高频交互的智能体工作流提供更高效的实时数据传输能力。
推荐理由:OpenAI 的 Responses API 引入 WebSocket 模式,把 agentic 工作流端到端延迟压低了 40%,关键不在数字而在架构上从无状态 HTTP 转向持久连接,做 agent 的团队可以认真看技术决策。