GPT-5.4 Thinking 和 GPT-5.4 Pro 开始向 ChatGPT 用户推出,同时通过 API 和 Codex 开放。该版本将推理、编程与智能体工作流能力整合为单一前沿模型。
推荐理由:GPT-5.4 正式发布,集推理、编程与 Agent 能力于一体,全平台上线
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
GPT-5.4 Thinking 和 GPT-5.4 Pro 开始向 ChatGPT 用户推出,同时通过 API 和 Codex 开放。该版本将推理、编程与智能体工作流能力整合为单一前沿模型。
推荐理由:GPT-5.4 正式发布,集推理、编程与 Agent 能力于一体,全平台上线
Anthropic与Mozilla合作,使用Claude Opus 4.6审计Firefox安全。模型两周内发现22个漏洞,其中14个高危,占2025年Firefox已修复高危漏洞近五分之一。团队扫描近6000个C++文件并提交112份报告,多数已在Firefox 148中修复。Claude还能为漏洞编写利用代码,具备独立执行完整漏洞挖掘链的能力。
推荐理由:Claude发现14个Firefox高危漏洞,AI自主安全审计能力取得实质性突破
OpenAI 推出 GPT-5.4,面向专业工作的最强高效前沿模型,支持 100 万 token 长上下文,具备顶尖编程、计算机使用与工具搜索能力。
推荐理由:OpenAI 发布 GPT-5.4,支持 1M 上下文与增强 Agent 能力
Google Search 的 AI Mode 已向美国所有用户开放 Canvas 功能,新增文档起草和交互式工具构建能力,用户可直接在搜索页面完成创作。
推荐理由:Google Search AI Mode 全面开放 Canvas 功能,支持文档起草与交互式工具构建
这周我一直在尝试 Copilot Tasks,在这种协作模式下分配任务(甚至是重复性任务)并让它们端到端自主完成,再使用 Agent 模式来优化和迭代输出,这太棒了。举几个例子……
推荐理由:微软 CEO 亲自演示,AI 自主任务执行或成办公新标配
PromptArmor 发现 GitHub Copilot CLI 可通过 README 中的间接提示注入,利用内置只读命令列表中的 env 包裹 curl 和 sh,绕过命令校验与外部 URL 审批,在 macOS 上无人工批准地下载并执行恶意软件。
推荐理由:作者实测演示了绕过 Copilot CLI 人工审批的具体命令链,并披露 GitHub 已确认但暂不修复,读者可据此评估自身使用风险。
PlanetScale 引入 Bugbot 作为 AI 代码审查代理,应对 AI 代码生成普及后审查环节成为瓶颈的问题。Bugbot 能发现人类难以察觉的深层逻辑缺陷,如状态同步间隙和异步控制器交互问题,而非仅检查语法错误。目前 80% 的 Bugbot 评论在合并前被工程师处理,每月审查超 2000 个 PR,节省相当于两名全职工程师的审查工作量,显著降低生产环境宕机风险。
推荐理由:Cursor Bugbot 企业落地数据:Agent 审查解决 80% 问题,揭示 AI 编程时代代码审查成新瓶颈
Cognition 发布 SWE-1.6 早期预览,当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%,达到 51.7%,速度同为 950 tok/s,并向小部分用户开放早期访问。
推荐理由:官方给出 SWE-1.6 预览版成绩与 RL 训练细节,并提出基准之外的 Model UX 问题,对做智能体训练的人有参考价值。
AI 编程进入第三时代:从 Tab 补全到同步 Agent,再到可独立运行数小时的云 Agent。Cursor 内部数据显示,Agent 用户已反超 Tab 用户 2 倍,35% 的 PR 由云 Agent 自主创建。开发者角色从逐行编码转向构建"软件工厂"——定义问题、配置工具并审查产物。Cursor 昨日正式发布 cloud agents,支持并行任务与独立 VM 运行。
推荐理由:Cursor 定义 AI 编程第三时代:云端 Agent 已占其内部 35% PR,用户量反超 Tab 两倍
Cognition 发文介绍其从创立起就用 Devin 构建 Devin,上周合并了 659 个 Devin PR,高于 2025 年最好一周的 154 个。文章覆盖全接口使用(web、Slack、Linear、CLI、API)及 Ask Devin 代码问答、Devin Review 自动代码审查、每日设计系统审计、!
推荐理由:Cognition 以当事方身份披露用 Devin 开发 Devin 的完整工作流,上周合并 659 个 Devin PR,读者可对照自身团队借鉴具体用法。
OpenAI 与 Figma 推出全新 Codex 集成,打通代码与设计的双向链路。开发团队可直接在代码实现与 Figma 画布间无缝切换,加速迭代和交付流程。
推荐理由:OpenAI Codex 集成 Figma,打通代码与设计工作流
LLM Skirmish 是一个让大语言模型通过编写代码进行1v1实时战略游戏对战的基准测试。基于Screeps开源API,每场锦标赛包含五轮,LLM可根据对战日志调整策略以测试上下文学习能力。结果显示,Claude Opus 4.5以85%胜率排名第一,GPT 5.2次之。Gemini 3 Pro表现异常:首轮胜率70%,后四轮骤降至15%,疑似因上下文腐烂。成本方面,Claude Opus 4.5每轮$4.12最贵,GPT 5.2性价比高出1.7倍。
推荐理由:LLM实时战略游戏对战基准,Claude大幅领先且展现独特上下文学习能力
OpenAI 发布 Codex 模型提示词指南,API 上的 Codex 调优模型为 gpt-5.3-codex,推荐用 medium 推理力度平衡智能与速度,复杂任务可用 high 或 xhigh。
推荐理由:官方为 gpt-5.3-codex 给出完整提示词与工具迁移指南,覆盖并行调用、compaction 和 phase 参数等可落地的集成细节。
Cognition 发布 Devin 2.2,智能体现在可用 computer use 在自己的 Linux 桌面上端到端测试网页和桌面应用,并在开 PR 前自查代码、自动修复问题,完成后回传屏幕录制供用户审阅。
推荐理由:官方公告给出自主测试、自动修复和启动提速等具体能力变化,读者可以据此评估对现有开发流程的影响。
METR 宣布更改其开发者生产力实验设计,认为 2025 年 8 月启动的新一轮实验数据不能可靠反映 AI 工具对开发效率的影响。
推荐理由:原文解释了新一轮 AI 开发者效率实验为何出现选择偏差并导致结果不可靠,还列出后续多种替代测量方案,方法层面的教训可以迁移到类似研究。
Ramp 基于 Modal Sandboxes 构建内部后台编码智能体 Ramp Inspect,目前启动了 Ramp 超过一半的已合并 pull request,其中超过 80% 的 Inspect 代码由其自身编写。
推荐理由:原文给出 Ramp Inspect 的架构细节、启动优化方式和采用数据,读者可借鉴后台编码智能体的落地方案。
PromptArmor 发布安全公告,指出 OpenAI Codex CLI 在用户信任项目后会自动加载并执行 .codex/config.toml 中的任意代码,且信任对话框只提示 prompt injection 风险,未说明会执行项目级配置命令。
推荐理由:原文给出了具体的攻击链演示和组织级缓解方案,读者可以据此评估在不可信仓库中使用 Codex 的实际风险。
METR 基于 2026 年 1 月 7 名技术人员的 5305 份 Claude Code transcript,用 LLM judge 估算无 AI 完成同样任务所需时间,得出时间节省倍数约 1.5x 至 13x。作者认为该数值因任务替代、任务选择、员工专业化和 judge 验证有限(仅 34 个人工标注)而高估真实提升,只是软上界;并发 agent 数更高的员工时间节省倍数更高。
推荐理由:作者用 5305 份 Claude Code transcript 估算时间节省倍数,并说明它为何只是真实生产力提升的软上界,方法细节可直接借鉴。
Seed2.0系列正式发布,推出Pro、Lite、Mini三款通用Agent模型及专用Code模型,针对复杂多模态任务与长链路Agent场景优化。模型在视觉理解、数学推理与长上下文处理方面达SOTA水平,SuperGPQA分数超越GPT-5.2,并在ICPC、IMO、CMO测试中获金牌。支持科学研究级任务,token成本较顶尖模型降低约一个数量级。目前已上线豆包App、TRAE及火山引擎API。
推荐理由:字节 Seed2.0 正式发布,Agent 与多模态能力全面升级,已接入豆包和 TRAE
MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。
推荐理由:MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。