跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1321–1340 条 · 共 1,387 条
9月30日周二
  1. Ethan Mollick:One Useful Thing(RSS)

    真正的 AI Agents 与真正的工作

    探讨 AI Agents 在真实工作场景中的定位,指出其核心挑战在于对抗"无限PPT"的形式主义陷阱。强调真正的智能体应当服务于以人为本的实质性工作,而非制造更多文档流程或官僚化产出。

    推荐理由:Ethan Mollick 深度解析 AI Agent 在实际工作中的应用与人类价值重塑

9月29日周一
  1. OpenAI Developers(RSS)65

    OpenAI 发布 Agentic Commerce Protocol 开放标准,连接商家与 ChatGPT 用户

    OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准,作为两者之间的基础设施。它让 ChatGPT 能接收结构化商品目录数据、理解商家库存并在对话中呈现相关商品。文档提供了带示例 payload 的入门指引,以及关于商品文案、变体建模和归因的 feed 质量优化最佳实践。

    推荐理由:OpenAI 官方文档介绍了 ACP 的定位和接入路径,商家可据此了解如何让商品出现在 ChatGPT 中。

  2. Claude Platform:开发者版本说明(RSS)75

    Claude Sonnet 4.5 发布,面向复杂智能体与编程任务

    Anthropic 发布 Claude Sonnet 4.5,定位为复杂智能体和编程场景的最佳模型,拥有最高综合智能水平。同时推出 Amazon Bedrock 和 Vertex AI 的全球端点定价、新的 `model_context_window_exceeded` 停止原因、记忆工具(beta)以及上下文编辑功能(beta),后者可在接近 token 限制时自动清理旧工具结果与调用。

    推荐理由:这是Anthropic放出的Sonnet 4.5,瞄准编码和复杂Agent场景,Memory工具和上下文编辑也一起开了,对靠API搞产品的开发者算大版本更新,但普通用户不必自己折腾。

  3. Cognition 模型 / Devin 博客(网页)65

    Cognition 为 Claude Sonnet 4.5 重构 Devin:新版本快 2 倍、评测提升 12%

    Cognition 发布基于 Claude Sonnet 4.5 重构的新版 Devin,速度提升 2 倍,Junior Developer Evals 提升 12%,已在 Agent Preview 上线,旧版 Devin 仍可用。

    推荐理由:来自一线 Agent 团队的适配复盘,给出了 Sonnet 4.5 的具体新行为和对应的工程应对,可迁移到类似智能体架构。

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    为AI智能体实施有效的上下文工程

    随着AI应用从单次提示转向构建长期运行的智能体,焦点正从“提示工程”演进为“上下文工程”。后者旨在为大型语言模型优化有限的上下文窗口内的全部信息,包括指令、工具、外部数据和对话历史。其核心挑战在于模型存在“注意力预算”限制和“上下文腐化”现象——随着上下文增长,模型回忆信息的准确性会下降。因此,上下文工程要求精心编排高价值信息,以有限的资源最大化产出期望结果,这已成为构建高性能、可操控智能体的关键。

    推荐理由:Anthropic 亲自下场定义 context engineering 这个新范式,把 prompt engineering 之后的工程方法论讲透了。做 Agent 的人如果还在死磕 prompt,这篇会让你重新审视整个技术栈。

9月25日周四
9月23日周二
  1. Sam Altman:Blog(RSS)

    充裕的智能

    计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。

    推荐理由:Sam Altman阐述OpenAI基础设施扩张愿景,计划每周新建1吉瓦算力

9月16日周二
  1. Noam Brown

    OpenAI 发布 GPT-5-Codex,针对智能体编程优化的 GPT-5 版本。简单查询响应速度提升10倍,复杂查询思考时间延长2倍以获得更多算力支持。已上线 Codex CLI、IDE 插件、网页、移动端及 GitHub 代码审查。

    引用OpenAI@OpenAI

    我们发布 GPT-5-Codex —— 这是 GPT-5 的一个版本,针对 Codex 中的智能体编程做了进一步优化。 可在 Codex CLI、IDE 扩展、网页、移动端中使用,并可用于 Github 中的代码审查。https://openai.com/index/introducing-upgrades-to-codex/

    推荐理由:GPT-5-Codex 发布,针对 Agentic 编码优化,可动态分配计算资源,简单查询快 10 倍

9月11日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体编写高效工具——与智能体协作

    文章探讨如何为基于大语言模型的智能体设计高效工具。核心方法是通过与智能体(如Claude Code)协作,采用快速原型构建和全面评估的迭代流程来优化工具性能。关键设计原则包括:选择适当的工具实现范围,使用命名空间明确功能边界,从工具向智能体返回有意义的上下文,优化响应以提高token效率,以及对工具描述进行提示词工程。工具本质上是确定性系统与非确定性智能体之间的新契约,设计应优先考虑智能体的使用体验,而非传统开发者导向的API思路,以扩大智能体解决实际任务的能力。

    推荐理由:Anthropic 把自家内部反复打磨的 agent 工具开发方法论完整公开了,从评估流程到 prompt 工程细节全是实操干货,做 MCP server 或 agent 工具链的人可以直接抄作业。

9月8日周一
  1. Cognition 模型 / Devin 博客(网页)70

    Cognition 融资超 4 亿美元,估值达 102 亿美元

    Cognition 宣布融资超 4 亿美元,投后估值 102 亿美元,由 Founders Fund 领投。Devin 的 ARR 从 2024 年 9 月的 100 万美元增至 2025 年 6 月的 7300 万美元,公司历史总净消耗低于 2000 万美元;收购 Windsurf 使 ARR 翻倍以上,并购后七周合并企业级 ARR 增长超 30%。

    推荐理由:官方披露融资估值的同时给出 ARR、净消耗和并购后的增长数字,读者可以据此评估其 AI 编码业务的真实成色。

9月3日周三
  1. Linear:Now(RSS)61

    Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

    Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。

    推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

8月28日周四
  1. xAI:News(网页)

    xAI发布轻量级编程模型Grok Code Fast 1

    xAI发布轻量级编程模型Grok Code Fast 1,采用全新架构,基于真实PR数据训练,精通grep、终端和文件编辑等工具。推理速度达190 tokens/秒,定价输入$0.20/百万tokens、输出$1.50/百万tokens,SWE-Bench-Verified得分70.8%。目前已在GitHub Copilot、Cursor、Cline等平台限时免费开放。

    推荐理由:xAI发布专为Agentic Coding优化的极速编程模型,已集成Cursor、Copilot等主流工具,价格极具竞争力

8月25日周一
  1. Claude:Blog(网页)

    Anthropic发布Claude浏览器扩展:AI自动操作功能向付费用户开放

    Anthropic正式发布Claude for Chrome扩展,允许AI在浏览器中执行点击、填表等操作。该功能已从1000名Max用户试点扩展至所有付费订阅者,新增Claude Code集成、定时任务及多标签工作流。针对提示词注入攻击,Anthropic通过站点权限、操作确认等防护措施,基于123个测试案例的红队测试,将攻击成功率从23.6%降至11.2%,并屏蔽高风险网站以确保安全。

    推荐理由:Claude浏览器代理正式开放,自动操作网页同时攻克提示注入安全难题

8月21日周四
  1. Linear:Now(RSS)60

    Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

    Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。

    推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。

  2. 公众号:DeepSeek(深度求索)80

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。

    推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。

  3. 公众号:DeepSeek(深度求索)63

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。

    推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。