CodeMender 发布:面向代码安全的 AI 智能体
CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。
推荐理由:DeepMind 发布代码安全 AI Agent CodeMender,可自动修复关键软件漏洞
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。
推荐理由:DeepMind 发布代码安全 AI Agent CodeMender,可自动修复关键软件漏洞
PromptArmor 发布安全研究,展示 Claude Code 新上线的插件 Marketplace 功能可被用于攻击。恶意插件先利用 Hook 改写 settings.local. 权限或自动批准 curl 命令,绕过人工审批防护,再通过 Command 中的提示词注入诱使 Claude 把代码库上下文用 curl 发到攻击者服务器。
推荐理由:原文完整演示了恶意插件绕过 Claude Code 人工审批并外泄文件的三步攻击链,适合关注 Agent 插件安全的开发者参考。
Claude Code引入沙盒化技术,通过文件系统与网络双重隔离来增强安全性,并大幅减少权限提示。内部测试显示,该技术将权限提示安全地降低了84%。新推出的沙盒运行时(作为开源研究预览版)允许开发者自定义目录和网络访问权限,使Claude能在限定范围内自主运行命令。同时,网页版Claude Code在云端隔离沙盒中运行,即使遭遇提示注入或代码入侵,也能有效保护Git密钥等敏感凭证不被泄露,从而提升开发安全性与效率。
推荐理由:Claude Code 的沙箱方案把安全和自主性这对矛盾解开了,权限提示减少 84% 不是数字游戏,是真把 agent 从「每步都要你点确认」变成「在笼子里自己跑」,做 coding agent 的团队该认真看看这套 OS 级隔离思路。
Anthropic 推出网页版 Claude Code,以研究预览形式向 Pro、Max 及企业用户开放。用户可直接在浏览器中分配编码任务,无需本地终端,支持并行处理多个 GitHub 仓库的开发工作,并自动创建 PR 和变更摘要。该服务基于云端隔离沙盒运行,具备网络和文件系统限制,同时登陆 iOS 应用支持移动编码。云会话与现有 Claude Code 使用共享速率限制。
推荐理由:Claude Code搬进浏览器,零门槛并行编程提PR,手机端也能随时跑任务
OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。
推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。
Cognition 发布 SWE-grep 和 SWE-grep-mini 模型,专注高度并行的代码上下文检索,检索能力匹敌前沿编码模型但耗时低一个数量级。模型每轮最多发起 8 个并行工具调用、限制 4 轮,通过多轮强化学习训练,奖励为文件与行范围检索的加权 F1;由 SWE-grep 蒸馏并继续 RL 得到 SWE-grep-mini。
推荐理由:原文给出检索质量分数与推理速度对比数字,并说明多轮 RL 训练方法,读者可评估这种专用检索模型能否迁移到自己的编码工作流。
Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。
推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。
CodeMender 是一款可自动修复关键软件漏洞的 AI agent,早期成果显示其有望大幅提升开发者生产力与安全性。
推荐理由:DeepMind CEO 发布自动修复代码漏洞的 AI agent CodeMender 早期成果
Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。
推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。
Claude Code 今晨发布多项功能升级,Claude Developer Platform 同步推出两项上下文管理新功能,具体更新详情可通过官方链接查看。
推荐理由:Claude Code 官方升级,推出上下文管理新功能
Anthropic 发布 Claude Sonnet 4.5,称其为全球最佳编程模型。该模型在构建复杂智能体与计算机使用方面表现最强,推理和数学测试成绩也有显著提升。
推荐理由:Claude Sonnet 4.5 发布,官方称最强编程与 Agent 能力
Anthropic 发布 Claude Sonnet 4.5,定位为复杂智能体和编程场景的最佳模型,拥有最高综合智能水平。同时推出 Amazon Bedrock 和 Vertex AI 的全球端点定价、新的 `model_context_window_exceeded` 停止原因、记忆工具(beta)以及上下文编辑功能(beta),后者可在接近 token 限制时自动清理旧工具结果与调用。
推荐理由:这是Anthropic放出的Sonnet 4.5,瞄准编码和复杂Agent场景,Memory工具和上下文编辑也一起开了,对靠API搞产品的开发者算大版本更新,但普通用户不必自己折腾。
Cognition 发布基于 Claude Sonnet 4.5 重构的新版 Devin,速度提升 2 倍,Junior Developer Evals 提升 12%,已在 Agent Preview 上线,旧版 Devin 仍可用。
推荐理由:来自一线 Agent 团队的适配复盘,给出了 Sonnet 4.5 的具体新行为和对应的工程应对,可迁移到类似智能体架构。
TensorZero 在数据抽取、智能体编码和客服三个任务上对比了 OpenAI RFT(o4-mini)与 SFT(GPT-4.1 mini)。
推荐理由:作者用三个真实任务实测 OpenAI RFT 与 SFT 的效果和成本差距,给出了按任务类型判断 RFT 是否值得用的可比结论。
DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。
推荐理由:V3.1-Terminus 重点改进了语言混杂和 Agent 表现,开源权重与 API 已同步,适合评估多语言应用和工具调用的稳定性提升。
OpenAI 推理系统在 2025 ICPC 世界总决赛中获得 12/12 满分,成绩相当于人类参赛者第一名。其中 11 道题目由 GPT-5 解决。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:GPT-5在ICPC世界总决赛获满分,编程推理能力达人类冠军水平
OpenAI 推理系统在 2025 ICPC 世界总决赛中解出全部 12 道算法题,获得 12/12 满分。该成绩在所有人类参赛队伍中排名第一,足以夺得冠军。
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:通用推理模型首次在顶级编程竞赛击败人类冠军,算法岗竞争格局或将重塑
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
推荐理由:Gemini 2.5 Deep Think 在顶级编程竞赛 ICPC 中斩获金牌级别成绩,代码推理能力再突破
1/n 我非常激动地分享,我们的 @OpenAI 推理系统在 2025 年 ICPC 世界总决赛中获得了 12/12 的满分,这是首屈一指的大学编程竞赛,来自世界各地的顶尖大学团队在此解决复杂的算法问题。这本来会让它在所有人类参赛者中排名第一。🥇🥇
推荐理由:AI首次在ICPC总决赛拿满分并超越人类最强,这不是又一个刷榜新闻,而是推理模型在算法思维上开始与顶尖人类选手平起平坐的信号。做coding agent的同行该严肃对待了。
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 世界编程大赛中取得金牌水平成绩。继 IMO 数学竞赛后,这是该模型在竞技领域取得的又一历史性突破。


推荐理由:Gemini 2.5 Deep Think 在 ICPC 编程竞赛中达到金牌水平,AI 推理能力再获突破