跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1361–1380 条 · 共 1,387 条
6月5日周四
  1. Transluce(网页)66

    Transluce 提出 PRBO 方法,用 RL 智能体自动发现 Llama、Qwen、DeepSeek 的罕见病理行为

    Transluce 发布研究报告,提出 PRBO(倾向下界)作为稀疏奖励的代理,训练 RL 调查智能体生成真实自然的提示,以激发开源权重模型的指定罕见行为,覆盖 Llama 3.1/4、Qwen 2.5 和 DeepSeek-V3。

    推荐理由:Transluce 提出用 PRBO 和 RL 调查智能体自动激发模型的罕见问题行为,并分析这些行为在真实提示下能否复现。

5月31日周六
  1. Cato AI Labs:AI安全原创研究85

    Aim Labs 披露 Microsoft 365 Copilot 零点击漏洞 EchoLeak 可实现数据外泄

    Aim Labs 发现并已向微软 MSRC 披露 M365 Copilot 的零点击漏洞链 EchoLeak,攻击者只需发送一封邮件即可在用户无感知、无特定操作的情况下自动外泄 Copilot 上下文中的敏感数据。

    推荐理由:安全团队原创拆解了 EchoLeak 零点击攻击链与 LLM Scope Violation 概念,读者可据此评估其他 RAG 应用的同类暴露面。

5月22日周四
  1. Hacker News:AI 热帖

    将Agent封装为MCP服务器示例

    MCP Agent Server示例展示了将Agent工作流封装为MCP服务器的"Agent即服务"架构。提供asyncio(轻量级内存执行,适合开发测试)和Temporal(生产级持久化、支持暂停恢复)两种实现。通过装饰器暴露Agent能力,支持多Agent互操作,可与Claude Desktop等任意MCP客户端集成,实现复杂工作流的标准化封装与跨平台复用。

    推荐理由:展示 Agent 即 MCP 服务器新范式,支持多 Agent 协作与主流客户端集成

5月20日周二
  1. Google DeepMind:Blog(RSS)

    构建通用 AI 助手的愿景

    Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。

    推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向

5月15日周四
  1. Cognition 模型 / Devin 博客(网页)65

    Devin 2.1 发布:任务置信评级、Linear/Jira 集成与内置代码库理解

    Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。

    推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。

4月18日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code:智能体编码最佳实践指南

    Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。

    推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。

4月3日周四
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 发布 Devin 2.0,推出 Agent 原生 IDE 并新增 $20 起的灵活方案

    Cognition 发布 Devin 2.0,带来 Agent 原生 IDE 体验和 $20 起的新方案。用户可并行运行多个 Devin,各自配备云端 IDE,可在 IDE 内用 Cmd+I、Cmd+K 等快捷键审查和修改 Devin 的代码。

    推荐理由:官方公告列出新 IDE 体验、三项新功能和 $20 起的新定价,读者可据此评估 Devin 在编码工作流中的可用性变化。

3月19日周三
  1. METR:Research(网页)75

    METR 发布时间视野研究:AI 可完成任务时长每约 7 个月翻倍

    METR 提出以 AI 智能体能完成的任务时长(按人类专业人士所需时间衡量)来度量模型能力,发现过去 6 年该指标呈指数增长,翻倍时间约 7 个月,且在 SWE-Bench Verified 上翻倍时间不足 3 个月。

    推荐理由:METR 用任务时长衡量模型能力,给出六年间指数增长趋势和约 7 个月翻倍速度,为理解模型真实工作能力提供一个可比较的框架。

3月6日周四
2月19日周三
  1. xAI:News(网页)

    Grok 3 Beta 发布:推理智能体时代来临

    Grok 3 Beta 正式发布,开启"推理智能体"时代。新版本强化深度推理与自主决策能力,支持复杂任务拆解和多步逻辑链处理,在数学、编程等推理密集型场景表现显著提升,标志着 AI 从简单问答向自主推理决策的范式转变。

    推荐理由:xAI发布Grok 3 Beta,主打推理智能体能力

2月13日周四
  1. Cognition 模型 / Devin 博客(网页)64

    Linktree 复盘用 Devin 一个月写约 300 个 PR 的实践经验

    Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。

    推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。

2月10日周一
  1. Sam Altman:Blog(RSS)

    三点观察

    OpenAI 阐述关于 AI 经济学的三点观察:模型智能与训练资源的对数成正比,可预测扩展;AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律速度;智能线性增长将产生超指数级社会经济价值。据此,AI 代理将如虚拟同事般渗透各领域,科学进步将大幅加速,虽然短期内生活照旧,但长期将深刻重塑社会经济结构,个人意志力和适应能力将成为关键价值。

    推荐理由:Sam Altman 提出 AI 经济学三大观察,描绘 AGI 时代 Agent 工作图景

1月21日周二
  1. Modal 官方工程博客(RSS)65

    Modal Sandboxes 正式可用,为不可信代码提供安全执行环境

    Modal 宣布 Sandboxes 正式可用,这是安全运行 LLM、用户或第三方来源不可信代码的隔离执行环境。它提供 exec API,可在运行时用与 Functions 相同的 Image API 动态配置任意语言依赖,支持文件系统快照以持久化和多 Sandbox 扇出,并复用 Functions 基础设施带来快速冷启动、GPU 和全球区域选择。

    推荐理由:Modal 官方宣布 Sandboxes 正式可用,给出 exec API、动态镜像和 SWE-bench 7 分钟跑完 Verified 等实测数字,可据此评估智能体代码执行方案。

1月8日周三
  1. Cato AI Labs:AI安全原创研究72

    Aim Labs 披露 Cursor IDE 的 CurXecute 漏洞,可经 MCP 提示词注入实现 RCE(CVE-2025-54135)

    Aim Labs(Cato)披露 Cursor IDE 的高危漏洞 CurXecute(CVE-2025-54135,评分 8.6),外部托管的一条提示词注入可静默改写 ~/.cursor/mcp. 并以用户权限执行任意命令,实现 RCE。

    推荐理由:原文给出完整的提示词注入到 RCE 攻击链细节和漏洞机理,读者可以据此审视 MCP 类 Agent 的运行时防护。

  2. Answer.AI 官方研发博客(RSS)78

    Answer.AI 实测 Devin:20 项任务仅 3 次成功,自主编程能力存疑

    Answer.AI 团队对 AI 软件工程师 Devin 进行了为期一个月的深度测试。尽管早期在 API 集成等简单任务中表现尚可,但在扩展至新项目创建、研究及代码修改等 20 项真实任务时,结果令人失望:仅 3 项成功,14 项失败,且无法预测成败规律。Devin 常陷入技术死胡同、生成过度复杂的“面条代码”,或在面对不可行任务时产生幻觉并浪费大量时间。文章指出其实际表现远低于宣传预期,难以替代人类开发者。

    推荐理由:来自知名 AI 评测机构的详实一手数据,揭示了明星产品 Devin 在真实工作流中的局限性,为评估当前自主编程 Agent 的实际成熟度提供了重要参考。

1月6日周一
  1. Sam Altman:Blog(RSS)

    反思

    Sam Altman在ChatGPT两周年之际回顾OpenAI九年历程:从坚信AGI可能实现,到2022年意外推出ChatGPT并引爆前所未有的增长曲线。他坦承过去两年从零构建公司的混乱压力,以及被董事会突然解雇的危机教训。如今周活用户已达3亿,在迈向AGI的道路上,他既感激这段经历,也承认未来仍充满未知。

    推荐理由:Sam Altman 反思创业历程,预测 2025 年 AI Agent 将实质性改变企业产出

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录

    升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。

    推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。

12月19日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)80

    构建高效智能体:从简单模式开始

    Anthropic基于实践经验指出,成功的LLM智能体往往采用简单、可组合的模式,而非复杂框架。文章区分了工作流(预定义路径编排)与智能体(LLM动态自主决策),建议开发者优先采用最简单方案,仅在必要时增加复杂性。许多核心模式直接调用LLM API仅需几行代码即可实现。文中介绍了增强型LLM、提示链等基础构建模块,强调应为特定用例定制检索、工具等增强功能,并推荐通过Model Context Protocol集成第三方工具生态。

    推荐理由:Anthropic 官方把过去一年踩过的坑浓缩成一篇 Agent 架构指南,核心观点是「别上框架,先用最简单的模式」。做 Agent 产品的开发者,这篇比任何第三方教程都值得当 checklist 用。

12月10日周二
  1. Cognition 模型 / Devin 博客(网页)73

    Cognition 宣布 Devin 正式全面开放使用

    Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。

    推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。