跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 241–260 条 · 共 1,387 条
8月14日周五
  1. Boris Cherny66

    Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。

    推荐理由:这套做法的增量在于把日常维护拆成可复用的定时例程,并通过当日 PR 反馈迭代提示词,使机械性代码改动从逐条审查转向批量合并。

  2. Cursor Blog65

    Cursor 推出 builds:云智能体启动速度提升至 3 倍

    Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。

    推荐理由:把环境准备从每次会话冷启动改为后台持续快照,云代理长任务的启动成本和中断风险降低,为把更多工程流程交给自动代理提供了更可靠的运行基础。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)80

    GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

    GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

    推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。

  4. Google DeepMind:Blog(RSS)72

    Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

    Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

    推荐理由:相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。

  5. Prime Intellect(网页)76

    Prime Intellect 测评18个前沿模型在 nanoGPT speedrun 上的自主研究能力

    Prime Intellect 在 nanoGPT optimizer speedrun 上跑了153次自主运行,覆盖18个前沿模型,单次最长8天、每个运行8xH200。

    推荐理由:原文展示了18个前沿模型在nanoGPT speedrun上153次自主研究运行的完整对比和公开轨迹,可帮助读者理解模型间研究能力的真实差距在哪里。

  6. Augment Code 博客(网页)64

    Augment Code 详解 Auggie CLI v2 重构:基于 Pi fork,任务成本比 Claude Code 低 53%

    Augment Code 从零重构 Auggie CLI 的 harness,在 SWE-bench Pro 相同通过率下,Auggie v2 单任务成本 $1.27,Claude Code 为 $2.70,便宜 53%,平均耗时 330s 对 409s。

    推荐理由:作者复盘了从 Vercel AI SDK、Mastra 到 Pi 的三次选型与减法思路,成本结论有 SWE-bench Pro 数据支撑,方法可迁移到类似的重构决策。

8月13日周四
  1. SiliconFlow67

    阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。

    推荐理由:缓存输入每百万 token 0.25 美元,让需要反复读取长上下文的 agent 工作流更接近可长期运行,而非只看单次生成价格。

  2. DeepSeek66

    DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。

    推荐理由:插件化把模型、工具、会话拆成可替换单元,影响在于选择智能体框架时可以从整体选型转为逐组件比较,降低被单一编排方案绑定的迁移成本。

  3. DeepSeek:API 更新日志81

    DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

    DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

    推荐理由:峰谷定价把闲时成本降至高峰一半,适合批量推理、评估任务等可延迟工作负载调整执行时间,为降低 API 支出提供空间。

  4. 公众号:数字生命卡兹克65

    WorkBuddy上线远程控制,国内也有了最丝滑的Agent工作方式

    WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。

    推荐理由:远程控制把 Agent 任务从电脑旁解放到手机上,连接和多设备切换比 Codex 更省事,对国内依赖 Agent 处理长任务的用户直接降低了使用门槛。

  5. Anthropic:Research(发表成果 · 网页)79

    新兴多智能体系统的模式与问题

    Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。

    推荐理由:实验把多智能体风险从猜测变为可量化模式,协调失败并不随更强智能自然消失,这会影响人们如何设计部署中的智能体交互环境。

  6. Claude:Blog(网页)65

    Claude in Chrome 侧边栏升级为 Claude Cowork 会话

    Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。

    推荐理由:把浏览器扩展升级为与桌面、网页、移动共享的 Cowork 会话,解决以往侧边栏与主应用上下文割裂的问题,长流程任务可以在不同设备间接力。

  7. GitHub Blog67

    AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

    AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。

    推荐理由:AutoGPT 的经验指出发现机制比文档完善度关键,agent 只读当前目录层级的指令,所以把 AGENTS.md 放在代码旁比继续写 wiki 更有效。

  8. Cursor Blog70

    Cursor 与 SpaceXAI 联合发布 Grok 4.6

    Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

    推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。

  9. xAI:News(网页)77

    xAI 发布 Grok 4.6,强化长时运行智能体能力

    xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

    推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。

8月12日周三
  1. OpenRouter:Announcements(RSS)67

    OpenRouter 推出实时网页搜索基准测试:如何为智能体选择引擎、深度与模型

    OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。

    推荐理由:这份基准把搜索预算的作用量化到分数与成本上,显示从单轮增加到 25 轮搜索,质量提升幅度超过更换模型或引擎,为 agent 搜索配置提供了更直接的取舍依据。

  2. OpenRouter72

    Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b

    推荐理由:Apache 2.0许可和两项代理基准得分,为评估30B规模本地开源模型是否达到生产可用提供了直接参照,分数分别指向工具调用和编码能力。

  3. PromptArmor:Threat Intelligence62

    PromptArmor:本地部署模型无法阻止数据外泄,以 Ollama 漏洞为例

    PromptArmor 发文指出,本地运行 LLM 并不能解决数据外泄问题,因为漏洞位于处理模型输出的 AI 应用基础设施中,而非模型本身。文章以 Ollama 聊天界面为例,其不安全地渲染 HTML 和 Markdown 内容并配有不安全的 web 搜索工具,可导致钓鱼覆盖层、凭证窃取和上传文档外泄,并给出净化输出、纯文本渲染或内容安全策略等修复方式。

    推荐理由:作者基于自己发现的大量真实漏洞案例,说明本地部署模型并不能阻止数据外泄,风险根源在于下游处理环节。