跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1281–1300 条 · 共 1,387 条
12月4日周四
12月3日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

    蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。

    推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。

12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)60

    大规模验证代码的实用方法

    研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。

    推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。

12月1日周一
  1. 公众号:DeepSeek(深度求索)66

    DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理

    DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。

    推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。

11月26日周三
  1. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    为长时运行智能体设计有效约束方案

    为解决AI智能体在跨越多上下文窗口执行长期任务时的“记忆丢失”与进展不一致问题,Anthropic为Claude Agent SDK开发了一套双重方案。该方案包含一个初始化智能体,负责在首次运行时建立基础环境并生成功能清单;以及一个编码智能体,负责在后续会话中进行增量开发并提交清晰可合并的代码。通过结构化的进度日志和Git历史等机制,引导智能体避免“试图一次性完成所有功能”或“过早宣布完成”的失败模式,从而实现跨会话的持续有效协作。

    推荐理由:Anthropic 把 Claude Agent SDK 跑长任务踩过的坑全摊开了,初始化 agent + 增量进度文件这套方案不复杂但极实用,做 Agent 产品的团队可以直接抄作业。

11月25日周二
  1. Hugging Face:Blog(RSS)83

    构建深度研究智能体:实现顶尖水平的经验

    Tavily团队因模型迭代重建了深度研究系统,核心是从工作流转向智能体架构,并聚焦上下文工程。通过Tavily Advanced Search进行上下文管理的网络检索,高效获取高相关度内容,避免信息过载。智能体设计模仿人类研究模式:收集信息、提炼要点、决策下一步,仅在生成最终交付物时引用原始资料,大幅减少令牌消耗,实现线性增长而非传统二次方增长。团队遵循简化编排逻辑、关注模型与工具优化方向、强化上下文工程等原则,以构建能随模型进化而持续改进的智能体系统。

    推荐理由:分享构建高效 AI 代理的实战技巧,优化上下文工程以提升性能。

11月24日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude开发者平台推出高级工具使用功能,提升AI代理效率

    Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。

    推荐理由:做 Agent 的人都卡在工具一多上下文就爆、调用就错这两个坑上,Anthropic 这三个功能直接把工具管理从「全塞进去」变成「按需加载+代码编排+示例纠错」,是目前最工程化的解法。

11月22日周六
  1. Sierra:Blog(RSS)60

    Sierra 上线 7 个季度后 ARR 突破 1 亿美元

    Sierra 在 2024 年 2 月上线后仅用 7 个季度实现年经常性收入(ARR)突破 1 亿美元。这一增速使 Sierra 成为历史上增长最快的企业软件公司之一。

    推荐理由:Sierra 用 7 个季度做到 1 亿美元 ARR,这个增速在 SaaS 史上很罕见,对做企业 Agent 的团队来说,是商业化路径被验证的真信号。

11月20日周四
  1. PromptArmor:Threat Intelligence73

    PromptArmor 演示 Google Antigravity 经间接提示词注入窃取用户凭据和代码

    PromptArmor 发布研究,演示 Google Antigravity(Google 的 agentic 代码编辑器)可通过间接提示词注入被操纵,调用浏览器子代理将用户凭据和代码外泄到攻击者控制的 webhook.site 地址。

    推荐理由:作者以第一手复现展示 Google Antigravity 被间接提示词注入窃取凭据的完整链条,并指出默认 Allowlist 含 webhook.site 等关键细节。

11月19日周三
  1. xAI:News(网页)

    Grok 与沙特阿拉伯达成全国性部署合作

    xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。

    推荐理由:xAI与沙特达成国家级合作,将全国部署Grok并建设超大规模AI算力基础设施

  2. xAI:News(网页)

    xAI发布Grok 4.1 Fast与Agent Tools API

    xAI发布Grok 4.1 Fast模型及Agent Tools API。Grok 4.1 Fast支持200万token上下文,在τ²-bench Telecom基准测试中获100%得分且成本仅105美元,函数调用准确率72%。Agent Tools API集成实时X数据、网页搜索与代码执行功能。该模型在深度研究基准测试中超越GPT-5等竞品,成本更低且幻觉率较上代降低一半。

    推荐理由:xAI 发布 Grok 4.1 Fast 及 Agent Tools API,支持 2M 上下文与原生工具调用,剑指企业级 Agent 应用。

  3. Ethan Mollick:One Useful Thing(RSS)

    从 GPT-3 到 Gemini 3 的三年

    GPT-3 发布至 Gemini 3 的三年间,大模型技术完成从聊天机器人(chatbots)到智能体(agents)的范式跃迁。

    推荐理由:Ethan Mollick 深度回顾 AI 三年演进,剖析从聊天机器人到 Agent 的变革趋势

11月14日周五
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 Devin 2025 年度绩效复盘,总结 18 个月智能体落地经验

    Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。

    推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。

11月13日周四
11月12日周三
  1. Claude:Blog(网页)

    通过 Skills 改进前端设计

    LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。

    推荐理由:Claude官方分享通过Skills解决AI生成界面同质化问题的实践技巧,附字体与主题优化Prompt示例。

11月5日周三
  1. PromptArmor:Threat Intelligence76

    PromptArmor 披露 CellShock 攻击:Claude for Excel 可经间接提示词注入外泄敏感财务数据

    PromptArmor 披露名为 CellShock 的攻击链,Claude for Excel 在测试版中可被间接提示词注入操纵,通过恶意 IMAGE 公式把用户的机密财务数据(营收预测、现金流增长、运营利润率等)编码进 URL 参数外泄到攻击者服务器。

    推荐理由:原文完整演示了一条针对 Claude for Excel 的间接提示词注入数据外泄链,并给出企业侧可落地的缓解配置建议。

11月4日周二
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 发布 Windsurf Codemaps:AI 生成的代码结构地图

    Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动,生成 AI 标注的代码结构地图,帮助工程师在调试、重构和上手新代码库前理解代码。

    推荐理由:官方介绍了 Codemaps 的入口、模型选择和 Cascade 引用方式,读者可以据此判断它如何用于代码库理解和上下文工程。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    通过代码执行提升MCP智能体效率

    随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。

    推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。