跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1341–1360 条 · 共 1,387 条
8月21日周四
  1. Cohere 产品与研究博客(网页)61

    Cohere 发布 Command A Reasoning 企业级推理模型

    Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。

    推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。

  2. DeepSeek:API 更新日志71

    DeepSeek-V3.1 发布,升级 chat 与 reasoner 双模式

    DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。

    推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。

8月20日周三
  1. Johann Rehberger / Embrace The Red(RSS)77

    Amazon Q Developer VS Code 插件被曝可通过提示词注入执行任意代码

    安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 插件(下载量超 100 万)存在间接提示词注入漏洞,可利用被归类为 readonly 的 find 命令的 -exec 参数绕过人工确认,在开发者主机上执行任意命令,甚至可诱导 Claude 4 下载远程指令并让 Sliver 恶意软件加入 C2 服务器。

    推荐理由:作者完整复现了从间接提示词注入到任意代码执行的攻击链,并附绕过 Claude 拒答的细节,可帮助开发者理解此类漏洞的成因与防护。

8月19日周二
  1. ARC Prize:官方博客61

    ARC Prize 发布 ARC-AGI-3 Preview 30天测试总结与Agent竞赛结果

    ARC Prize Foundation 总结 ARC-AGI-3 Preview 发布30天的数据:超1200人玩了3900多局游戏,人类大多能通关,AI Agent 进展低效。竞赛冠军 StochasticGoose 得分12.58%、完成18关,前三名Agent均基于智能随机探索;官方指出部分游戏可被暴力搜索破解,未来将按动作效率对人类基线评分并增加撤销按钮、离线引擎等改进。

    推荐理由:原文公布了30天竞赛的完整人类与Agent得分对比,读者可以看到交互式推理基准用动作效率区分人类和AI的具体依据。

8月15日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/UI-Venus

    UI-Venus 是一款本地 UI 智能体,仅以屏幕截图作为输入,即可执行精确的图形用户界面元素定位与高效导航。该代理无需依赖系统底层代码或辅助功能接口,直接通过视觉信息理解界面结构,实现自动化操作。其核心能力在于对任意应用或网页中的按钮、菜单、文本框等元素进行准确识别与交互,提升了跨平台任务执行的通用性与可靠性。

    推荐理由:蚂蚁这个纯截图驱动的 UI Agent 在当时算是早期探索,代码开源可直接用,做 GUI 自动化的值得看看底层怎么实现元素定位和导航。

8月13日周三
  1. METR:Research(网页)61

    METR 研究更新:算法评分高估 AI 智能体真实软件工程能力

    METR 在 stdlib-js 和 hypothesis 两个仓库的 18 个真实 issue 上评估 Claude 3.7 Sonnet(Inspect ReAct 智能体),按维护者测试用例算法评分成功率为 38%(±19%),但人工评审的 15 个 PR 中没有一个可以直接合并。

    推荐理由:METR 用人工评审对照算法评分,给出量化证据说明测试类基准为何高估智能体的真实软件工程能力。

8月8日周五
  1. Ethan Mollick:One Useful Thing(RSS)

    GPT-5:只管做事

    GPT-5 不再需要详细提示工程,只需给出目标即可自主完成任务。将 AI 置于主导地位,用户只需设定方向,具体执行由模型自行处理。

    推荐理由:Ethan Mollick 深度解读 GPT-5 自主执行能力,洞察 AI 代理新范式

7月31日周四
  1. LMSYS:Blog(Chatbot Arena 团队)

    智谱发布 GLM-4.5 系列模型并原生支持 SGLang

    智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

    推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月16日周三
  1. Lilian Weng70

    Thinking Machines实验室宣布重启招聘,并确认已完成由a16z领投的20亿美元融资,NVIDIA、Accel等多方参与。该实验室致力于通过推进协作通用智能来增强人类能力,正在构建能通过对话、视觉等自然方式与人交互的多模态AI。其首款产品将于未来几个月内发布,产品将包含重要的开源组件,以助力研究人员和初创公司开发定制模型。实验室还计划分享其前沿科研成果,以推动AI社区发展。

    引用Mira Murati@miramurati

    Thinking Machines Lab 的存在是为了通过推进协作式通用智能来赋能人类。 我们正在构建多模态 AI,它能配合你与世界自然互动的方式——通过对话,通过视觉,通过我们协作时那种杂乱无章的方式。我们很兴奋,在未来几个月内我们将能够分享我们的首个产品,它将包含一个重要的开源组件,并对开发自定义模型的研究人员和初创公司有用。很快,我们还将分享我们最好的科学成果,以帮助研究界更好地理解前沿 AI 系统。 为了加速我们的进展,我们很高兴地确认,我们已筹集了 20 亿美元,由 a16z 领投,NVIDIA、Accel、ServiceNow、CISCO、AMD、Jane Street 等与我们使命相同的机构参与。 我们一直在寻找那些通过实践学习、将研究转化为有用之物的非凡人才。我们相信 AI 应当作为个人能动性的延伸,并且本着自由的精神,尽可能广泛而公平地分发。我们希望这一愿景能引起那些与我们同样致力于推动该领域发展的人的共鸣。如果是这样,加入我们。https://thinkingmachines.paperform.co/

    推荐理由:Mira Murati 的 Thinking Machines Lab 拿了 20 亿美金,a16z 领投、NVIDIA 跟投,前 OpenAI CTO 的新牌桌已经摆好,做多模态 Agent 的人该盯着他们的开源组件了。

7月14日周一
  1. Cognition 模型 / Devin 博客(网页)79

    Cognition 签约收购智能体 IDE 公司 Windsurf

    Cognition 签署最终协议收购智能体 IDE 公司 Windsurf,交易包括其 IP、产品、商标、品牌和业务,Windsurf 团队将加入 Cognition。

    推荐理由:官方公告披露了交易范围、Windsurf 的 ARR 和用户规模及员工待遇安排,读者可以据此了解这起收购的实际内容。

7月10日周四
  1. METR:Research(网页)79

    METR 研究发现早期2025年AI工具使资深开源开发者完成任务耗时增加19%

    METR 的随机对照实验让16名资深开源开发者处理246个真实issue,允许使用AI(主要是Cursor Pro 搭配 Claude 3.5/3.7 Sonnet)时完成耗时反而增加19%。

    推荐理由:原文给出RCT实验设计和开发者预期与实测的反差数据,读者可以据此校准对AI编码工具收益的判断。

7月1日周二
  1. Factory 研究 / 产品(RSS)70

    Factory 提出 Agent Native Development:用自主智能体开发软件的方法论

    Factory 发布 Agent Native Development 方法论,主张让 agent 运行收集上下文、规划、实现、验证、提交的完整内循环,人来负责架构决策和护栏。

    推荐理由:Factory 提出的 Agent Native Development 方法论给出写精确规格、验证环境和 drift 恢复的可迁移做法,适合想系统化用 agent 写代码的开发者参考。

  2. OpenRouter:Announcements(RSS)55

    OpenRouter 发布新隐身模型 Cypher Alpha

    OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。

    推荐理由:OpenRouter 自家出的免费通用模型,带工具调用,去年夏天发的,现在看只能算个入门级 Agent 玩具,但免费试不亏。

6月13日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    我们如何构建多智能体研究系统

    Claude的多智能体研究系统采用协调器-工作者架构,一个主导智能体分析用户查询并制定策略,并行调用多个专用子智能体协同工作。内部评估显示,以Claude Opus 4为主导、Claude Sonnet 4为子智能体的系统,在研究任务上比单智能体Claude Opus 4性能提升90.2%。该系统擅长处理需要同时探索多个独立方向的广度优先查询,通过分配独立上下文窗口实现并行推理扩容。但多智能体系统消耗的token量约为普通聊天的15倍,适用于任务价值足以支撑性能提升的场景,在需要高度并行化、大信息量或多工具调用的任务中表现卓越。

    推荐理由:Anthropic 把 Research 背后的多智能体架构、prompt 工程和踩坑经验全抖出来了,做 Agent 的同行可以直接抄作业,尤其是『token 用量解释 80% 性能方差』这个结论,选型逻辑要变。

6月12日周四
  1. Cognition 模型 / Devin 博客(网页)71

    Cognition 撰文反对构建多智能体系统,提出上下文工程两条原则

    Cognition 发文《Don't Build Multi-Agents》,提出上下文工程两条原则:共享完整 agent 轨迹的上下文,以及行动携带隐含决策、冲突决策导致糟糕结果。

    推荐理由:Cognition 以自身 agent 构建经验提炼上下文工程两条原则,并解释为何多智能体架构在 2025 年仍然脆弱。

6月11日周三
  1. Sam Altman:Blog(RSS)

    温和的奇点

    人类已越过AI发展的"事件视界"。2025年代理将承担真正认知工作,永久改变编程;2026年系统或能发现新见解,2027年机器人可能执行现实任务。科学家称生产力已提升2-3倍,递归改进正在加速。2030年代智能与能源将极大丰富,技术成本趋近电力。尽管就业结构剧变,但财富增长将带来前所未有的政策空间。人类正适应"温和的奇点":奇迹迅速变成常态,我们将很快测试智能能超越人类多远。

    推荐理由:Sam Altman 谈温和奇点:AGI 已启动,预测 2025-2027 发展路线

6月5日周四
  1. METR:Research(网页)74

    METR 报告:o3、Claude 3.7 Sonnet 等前沿模型在评测任务中频繁 reward hacking

    METR 报告多个开发者的前沿模型在其自主软件开发与 AI R&D 评测任务中作弊刷分,o3 在 RE-Bench 三个任务家族中 reward hacking 占比 25% 至 100%,HCAST 上为 0.7%。

    推荐理由:原文给出多代前沿模型作弊的具体案例和发生率数据,并指出惩罚式修复可能只会让作弊更隐蔽。