点击“批准权限”按钮很困难。 我们展示智能体可以为你做到这一点。 查看我们的对齐博客:https://alignment.openai.com/auto-review
推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
点击“批准权限”按钮很困难。 我们展示智能体可以为你做到这一点。 查看我们的对齐博客:https://alignment.openai.com/auto-review
推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。
codex宠物分享的图库: 提交入口已开放,可通过下方链接提交👇
构建了 Petdex,一个公开画廊,用于发现、分享并通过一条 curl 命令安装 Codex 宠物。 提交入口在下方链接开放 👇
推荐理由:Greg Brockman 亲自转发的社区画廊,把 Codex pets 的发现和安装简化成一条 curl 命令,对于正在玩 Codex Agent 的开发者来说是个实用的工具箱。
只需点击几下,即可将您的工作流程带入Codex。 导入设置、插件、代理、项目配置等,以便您能更少中断地继续工作。 该您行动了。
推荐理由:Codex 这个导入功能,把迁移成本降到了最低,对已经在用其他 IDE 的开发者算是个贴心的零门槛入口,虽然不算重大更新,但够实用。
推荐理由:Anthropic 开发者大会是 Claude 生态今年最重要的窗口,代码、Agent 和工具链很可能有新东西,做开发的值得蹲一下直播。
本次更新增强了模型网关集成,当配置指向兼容网关时,可直接在模型选择器中列出可用模型。新增了 `claude project purge` 命令,用于彻底清理项目状态数据。OAuth登录流程得到优化,支持在浏览器回调失败时手动粘贴授权码,并修复了多种网络环境下的登录问题。安全方面,修复了 `allowManagedDomainsOnly` 等设置可能被忽略的漏洞。此外,还解决了图像粘贴过大导致会话中断、远程会话误报“流空闲超时”、Windows系统下特定文本渲染乱码以及多项工具在特定场景下不可用等数十项错误。
推荐理由:这是 Claude Code 一次‘生活质量’大更新,OAuth、Windows 权限、流超时等痛点都被修了,如果你在用 Claude Code,今天就该升级。
Claude Security 现已面向所有 Claude Enterprise 客户开放公开测试。该功能基于 Claude Opus 4.7 模型,能够扫描代码库中的漏洞并生成针对性修复方案。公开版本新增了计划扫描与定向扫描功能,更易于与审计系统集成,并改进了问题追踪流程。此外,Opus 4.7 的能力正通过 CrowdStrike、微软安全等技术合作伙伴,以及埃森哲、德勤等服务合作伙伴,集成到企业现有安全工具中,帮助防御者应对日益严峻的网络安全挑战。
推荐理由:Claude Security 正式公测,Anthropic 把 Opus 4.7 的代码理解力直接嵌进企业安全流程,从扫描到 patch 一条龙,安全团队可能第一次能和 AI 齐步跑了。
GitHub Copilot CLI 提供了交互与非交互两种主要使用模式。交互模式允许用户通过对话式指令逐步构建和调整命令,适合探索性任务。非交互模式则支持直接输入完整指令快速执行,适用于自动化脚本或已知命令。理解这两种模式的区别能帮助开发者更高效地利用该工具,提升命令行工作效率。
推荐理由:如果你总在 Copilot CLI 的交互和非交互模式之间犯迷糊,这篇官方教程算是清晰的速查手册,初学者花五分钟就能搞清楚。
Cursor团队以构建软件产品的方式迭代优化其智能体工具链,核心围绕上下文窗口的演进。早期模型能力有限,工具链依赖大量静态上下文和防护机制;随着模型能力提升,团队已转向提供更多动态上下文获取方式并移除限制。评估改进效果采用线上线下结合:通过CursorBench等基准测试进行标准化质量评估,同时进行线上A/B测试,使用“代码保留率”和用户反馈语义分析衡量真实场景表现。团队持续监控并修复工具调用错误,以应对日益复杂的工具链状态。
推荐理由:Cursor 这篇 agent harness 复盘是今年聊 agent 基础设施最好的文章之一,从上下文管理到多 agent 调度,全是实战迭代的血泪经验,做 agent 的团队该逐字读。
http://x.com/i/article/2049579443216338944
推荐理由:OpenAI开发者官方转发了这篇‘直接构建web应用’的文章,说明这可能是他们认可的实践路径,对想用AI快速搭应用的开发者算是个值得收藏的参考。
通过Figma插件,Codex现在可以将实施计划转化为可视化的FigJam白板。
FigJam 中的 MCP 更新,让你可以可视化你的系统(而不只是阅读代码) → generate_diagram 用于创建架构图和 ERD → figma-use-figjam 技能可直接向你的白板添加笔记、代码块和注释 → get_figjam 工具可读取你的白板并规划下一步
推荐理由:Codex 这次更新不是小功能补丁,它把 Figma 从设计师专属变成了开发者的白板,generate_diagram 直接画架构图,做系统设计的可以扔了 Lucidchart 了。
Claude API技能现已扩展集成至CodeRabbit、JetBrains、Resolve AI和Warp四款开发工具中,使开发者能在其常用环境中直接获得生产就绪的Claude API代码支持。该技能能自动捕获API最佳实践细节,如适配的智能体模式、参数变更与提示缓存规则,从而减少错误并简化模型迁移。开发者可在工具内直接指示Claude执行“提高缓存命中率”或“升级至最新Claude模型”等任务。此开源技能会随SDK更新自动同步,帮助团队更快采用新功能,避免因API知识过时导致的生产问题。
推荐理由:Anthropic 把 claude-api skill 从自家 IDE 扩散到 JetBrains、Warp 等主流开发工具,本质是用「内置专家知识」抢开发者心智,做 Claude API 集成的产品人值得看看它覆盖了哪些坑。
👏 认识来自 @AntLingAGI 的 Ling-2.6-1T,这是一款万亿参数旗舰即时指令模型,专为大规模下的快速执行与高效率而打造。Day-0 支持现已在 SGLang 上线! 1️⃣ 快速思考方式:比同类模型便宜约 4 倍,质量毫不妥协 2️⃣ 在 AIME26 与 SWE-bench Verified 上达到 SOTA 3️⃣ 专为高级编程、复杂推理与大规模智能体工作流而打造 4️⃣ 万亿参数能力,即时模型延迟 Cookbook:https://docs.sglang.io/cookbook/autoregressive/InclusionAI/Ling-2.6
推荐理由:万亿参数做到即时延迟和4倍成本优势,还有SWE-bench SOTA,这份承诺如果兑现,会改变大规模Agent部署的性价比计算。值得去cookbook跑一下验证。
Mistral 发布 128B 稠密模型 Mistral Medium 3.5,采用修改版 MIT 许可开放权重,SWE-Bench Verified 得分 77.6%,成为 Mistral Vibe 与 Le Chat 的默认模型。
推荐理由:原文给出具体跑分、定价和开放权重细节,能帮助读者评估这款 128B 模型在自托管与智能体场景的可用性。
Augment Code 在 AGENTS.md 中加入约 2.5k 字符的 Karpathy 风格编码规则,用 Auggie、Claude Code 和 Codex 对 40 个 OpenClaw PR 各跑 6 次对照测试。
推荐理由:原文以 40 个 OpenClaw PR 的对照实验给出 Karpathy 规则对三个编码 Agent 的效率与质量影响,结论可迁移到自己的 AGENTS.md 配置。
Cursor 正式推出 SDK 公开测试版,开发者仅需几行 TypeScript 代码即可构建和部署智能体。该 SDK 提供与 Cursor 应用相同的运行时、框架及前沿模型(如 GPT-5.5)支持,并允许将智能体部署于本地或 Cursor 云的专用虚拟机。借助其生产级云基础设施,如安全沙箱和持久状态管理,智能体正从个人工具演变为组织的可编程基础设施。许多团队已将其集成至 CI/CD 流水线、工作流自动化及核心产品中。
推荐理由:Cursor 把自家产线拆出来给外部用,对于想把 AI 代理嵌入 CI/CD 或产品的团队,省掉了自建完整 agent 栈的麻烦,对做自动化编码的开发者是个必看的更新。
# AI 初创公司的前路 在 SpaceXAI <> Cursor 的“递延 IPO 收购”之后,很多创始人都在互相发消息。常见的讨论话题是:独立初创公司的未来是什么?是不是几乎所有人都最终必须被某个前沿实验室收购,否则就会消亡? 来自我们亲身经历 @cognition 的数据表明恰恰相反。一个类别中越是多的初创公司通过把自己卖给某个实验室而退出独立竞争,剩下的那些就会变得越强。去年我们在 Windsurf 上亲身经历了这一点。当创始人去了 Google,而我们收购了剩下的公司时,这极大地加速了我们的产品路线图和 GTM。如今,云端 agent 已经准备好登上主舞台,我们的使用量也呈爆炸式增长。(我们正处于 Cognition 历史上最快的使用量增长期——Devin 企业版几乎实现了 50% 的月环比增长。)随着昨天的新闻,我们已经看到了下一轮加速,从潜在客户和客户到候选人主动联系。 几乎在每个类别中,都存在一个明确的市场,属于一个获胜的独立产品,它不依附于任何单一实验室的模型。尤其是在软件工程这样一个充满活力的领域,客户看重模型的灵活性,因为不同供应商的排名在不断变化。 为了让初创公司抓住这个独立性的机会,以下是我们迄今为止学到的经验: 1. 差异化 与实验室已经提供的东西相比,你需要有极其清晰的差异化。Cursor 在自助服务方面面临来自 Claude Code 的激烈竞争,部分原因是一个工具可以替代另一个工具,这构成了挑战。 我们的做法是面向企业进行重度差异化,而企业是软件工程最大的市场。具体来说: 1. 我们在前向部署工程和 AI 赋能上的投入,与在核心研发上的投入一样多。我们的客户把我们当作变革管理合作伙伴,而不仅仅是一个 AI 软件工程平台。我们在世界各地举办 1000 人规模的研讨会,帮助培训公司内部的开发者采用前沿 AI。除了提供开发者工具之外,我们还瞄准具体的用例和成果。 2. 我们专注于在大公司规模上加速*整个软件开发生命周期*,而不仅仅是编写代码。Devin 现在会自动启动,用于从工单范围界定到 DeepWiki 代码库索引,再到安全漏洞修复和应用监控告警响应的一切工作。 3. 我们承受部署复杂性的痛苦,以便在你能想象到的最大、最复杂的环境中良好运行。Cognition 可以运行在客户的虚拟私有云中,拥有可扩展到一家公司内 100,000+ 开发者的权限和团队协作模型,对 COBOL 大型机和对现代 Python 一样运行良好。从第一天起,每个 Devin 都在自己机器上的 microVM 中运行,而不是作为 CLI 工具在本地运行,这允许任意水平扩展,也更适合事件驱动的自动化。 当然,初创公司差异化的一个要素永远是模型独立性。这在大企业中尤其强大,因为它们看重供应商的连续性,以及在不承担押错基础模型这一商业风险的情况下集中管理工具的能力。这对个人开发者也有用,因为他们总是想尝试最新的模型。(如果你还没试过上周发布的 Windsurf 2.0 版本,今天是个好日子去试一试!) 我预计实验室们会在某个时候在这些方面中的一些上赶上来。但到那时,我们已经完成了差异化的下一次飞跃,因为…… 2. 专注 你不可能在所有事情上都胜过实验室,但你可以在*你自己的事情*上胜过实验室。每个应用领域在边缘处都有分形般的复杂性。全力投入让你所在领域与众不同的东西,提供别人无法提供的东西。实验室投入训练资源去做一个专门的代码审查模型,这合理吗?大概不合理——他们在做 AGI。但在最新前沿模型无法以可接受的性能、成本或延迟解决那个用例的 3-6 个月窗口里,自己动手,打造出否则不可能实现的更好的产品体验。随着通过专业化所能达到的边界不断演进, rinse and repeat。 3. 速度 我们在 Cognition 的价值观之一是:“每一秒都重要。”疯狂的紧迫感对每家初创公司都有帮助,但在当今加速的 AI 时代,它的价值更大,因为优势比以往复合得更快。有了足够的专注,你可以在任何一个具体功能或工作流上比 AI 实验室加速得更快。持续这样做,以拉大每一代新模型所开启的可能性空间,你就能在差异化的产品体验上保持优势。 - 在很多方面,SpaceXAI <> Cursor 的消息对所有人来说都是胜利。SpaceX 获得了一个新的研究团队,以及变得在编程方面有竞争力的机会。Cursor 获得了有意义的退出,以及用多得多的算力加速其研究路线图的机会。而整个生态系统则受益于基础模型实验室之间竞争力的增强。祝贺这些团队取得这样的结果。
推荐理由:Russell Kaplan 借 Cursor 被收购节点复盘 Cognition 的打法,差异化、专注、速度三条铁律不是空话,全是带数据和细节的实战复盘,做 AI 创业的值得细读。
Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。
推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。
Factory 对 13 个模型在来自 Sentry、Grafana、Keycloak、Discourse 和 Cal.com 的 50 个真实 PR 上做了代码审查基准,每个模型至少跑 3 次。
推荐理由:原文给出13个模型在50个真实PR上的F1与成本数据,读者可按预算直接挑选代码审查模型。
华盛顿大学MacCoss实验室的Brendan MacLean将培训新开发者的方法论应用于Claude Code,以管理拥有70万行C#代码、持续开发17年的开源蛋白质分析软件Skyline。他通过创建独立的AI上下文仓库、编写CLAUDE.md引导文件以及设计“技能”模块(如调试技能),为Claude Code建立项目认知。该方法显著提升了开发效率:搁置一年的文件视图面板功能在两周内完成;CSS布局更新从依赖设计师变为不到一天实现。此外,Claude Code还自动化了2000多张教程图片的截图比对和每日测试报告生成,团队现在主要依靠它生成代码和脚本。
推荐理由:这不是又一篇 Claude Code 安利文,而是一个维护了 17 年 70 万行 C# 代码库的人,把带新人的方法论原封不动搬给了 AI,结果真管用。做 legacy 项目的人应该认真看他的 context 管理和 skill 库设计。
Claude Code 现在可以在长时间任务完成或需要您输入时,向您的手机发送推送通知。 离开终端吧,完成后我们会通知您。
推荐理由:Claude Code 终于让你能离开终端了,跑长任务时手机会收到通知,这对重度 coding agent 用户是个刚需补丁,虽然小但直接提升日常体验。