跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 221–240 条 · 共 1,387 条
8月21日周五
  1. 公众号:DeepSeek(深度求索)73

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。该模型通过 API 提供,图片按 token 计费,一张最多占 384 tokens,价格与 V4-Flash 一致。同期上线的 Files API 免费,支持图片上传后通过 file_id 复用。

    推荐理由:比文本能力持平更实际的是多模态 Agent 能力接近 Opus-4.8,同时图片按 token 计费与 V4-Flash 一致,原先依赖外部视觉模型的 Agent 流程可能改用单一 API 且成本更低。

  2. Claude:Blog(网页)63

    Claude Platform 正式上线 Computer Use、Skills API 与 Files API,新增浏览器操作工具

    Anthropic 宣布 Computer Use、Skills API 与 Files API 在 Claude Platform 全面可用,并新增浏览器操作工具,让智能体可操作软件、调用团队技能并返回成品文件。

    推荐理由:这次正式版让 computer use 每轮可执行多个动作,浏览器工具按页面结构而非像素定位元素,长流程任务的调用次数和执行时间可能明显下降,对无 API 系统上的自动化团队影响直接。

  3. Mistral AI:News(网页)68

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,为 AI 系统提供多步检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供,支持云端与本地部署。

    推荐理由:官方给出 FinanceBench 与 OfficeQA Pro 上的具体数字和五工具设计,读者可评估其对现有 RAG 流水线的替代价值。

8月20日周四
  1. IT之家(RSS)72

    阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕

    阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

    推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。

  2. 公众号:MiniMax(稀宇科技)61

    MiniMax Design 发布:从操作像素到操作语义和表达意图

    MiniMax 推出 MiniMax Design,一款将多模态模型能力转化为生产力的 Harness,可理解目标、拆解任务并调用模型与 Skills,完成从素材处理到最终交付的完整流程。该产品围绕原生多模态视频模型 H3 构建,擅长处理目标明确的商业内容任务,并提供 Agent 3D 导演台、自动剪辑与字幕功能,支持接入 ComfyUI 等开源生态工作流。

    推荐理由:意图先行与三维导演台将视频试错从生成后移到分镜前,这会改变需要批量产出多平台广告素材的团队在工具切换和返工上的成本。

8月19日周三
  1. HuggingFace Daily Papers(社区热门论文)72

    StartupBench:面向市场验证端到端工作流的通用智能体基准测试

    StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。

    推荐理由:不同于基于研究者自选任务的基准,StartupBench 从有真实用户的产品工作流提炼任务,给出的约 30% 完成率将团队评估焦点从榜单得分拉回到端到端交付。

  2. Answer.AI 官方研发博客(RSS)63

    为什么 LLM 无法简化你的代码:Answer.AI 工程师用 Naur 理论解读复杂度

    Answer.AI 工程师借鉴 Peter Naur 的《Programming as Theory building》,指出决定代码复杂度的关键信息存在于工程师头脑中的 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 造成的复杂度膨胀。

    推荐理由:作者结合 Answer.AI 支付系统重构实例,说明决定代码复杂度的信息不在代码里,解释了为何 LoC 等指标约束不了 LLM 的复杂度膨胀。

  3. Claude65

    Claude 现在可以在 Gmail 中发送邮件,并管理 Google Drive 中的文件。 让 Claude 回复某个邮件线程,它会起草并发送回复。你可以控制何时需要你的批准。 从连接器菜单中选择连接 Gmail 或 Google Drive 即可试用。所有付费套餐均可用。

    推荐理由:把 Gmail 起草与发送、Drive 文件操作收进 Claude 对话,减少在工具间切换,审批环节仍由人决定,对依赖这两项服务的付费用户是具体效率变化。

  4. Claude:Blog(网页)63

    Claude Tag 如何担任 Anthropic CI/CD 故障的一线响应者

    Anthropic 的 CI 工程师用 Claude Tag 构建了值班智能体,作为 CI/CD 故障的一线响应者。Claude 在事故发生后中位 14 分钟发布首份基于证据的分析,最快案例中 3 分钟内验证修复并确认错误率恢复基线。该方案通过 Slack 频道、Datadog 或 Grafana 工具访问及 GitHub 技能文件实现,Anthropic 已发布通用设置套件供其他团队部署。

    推荐理由:文章把 AI on-call 从概念落成可复制的工程架构,用 markdown 技能文件和 lessons.md 实现自我迭代,并给出 14 分钟首报、最快 4 分钟定位等实测数据。

  5. Hugging Face:Blog(RSS)66

    智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准

    智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。

    推荐理由:把智能体记忆的配置从越多越好修正为按模型能力校准,弱模型用检索核心比全量更准且成本更低,为上下文预算提供量化依据。

  6. Tessl:产品与工程博客66

    Paul Stack 分享人类做架构、AI 写代码的五人团队实践

    Paul Stack 自 1 月底起不再手写代码,团队规定 agent 写每一行代码,不接受人类编写的代码 PR。工作流为状态机加 CLAUDE.md 可执行契约,CI 设五个合并门禁;此前 30 天开启 295 个 issue,ship 217 个,triage 中位数 4.6 小时,triage 到 ship 中位数 1.6 小时。

    推荐理由:作者用自家五人团队全程由 agent 写代码的实践,说明流程、约束和门禁如何设计,是可参考的一手方法论。

8月18日周二
  1. Google AI:DEV 作者专属(RSS)67

    设计 AI 评测:先求清晰,再谈可视化

    本文演示如何用开源评测框架 Inspect AI 和 Harbor 评估 agent 技能,并借助 Google Sheets 和 Data Studio 进行可视化分析。

    推荐理由:把技能评估拆成模型基线、技能条件与多维事实打分,让团队用同一套脚本量化技能增量,而不是凭单次演示做判断。

8月17日周一
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)74

    OpenAI 如何用前沿智能加固自身防御:The Defender’s Window

    OpenAI 在 OpenAI-Hugging Face 事件后反思低估了模型真实网络攻击能力,正通过四大支柱强化自身安全:用 Codex 验证代码漏洞、用智能体优先分流安全告警、持续枚举攻击路径,并仅向可信防御者开放网络能力。文中演示 ChatGPT Work(基于 GPT-5.6 Sol)15 分钟发现个人网站 13 个问题并在一小时内完成修复。

    推荐理由:把防御动作拆成可逐步放开权限的自动化阶梯,从只读扫描到自动关单,比泛泛的全员上 AI 更可落地,安全团队能据此排定试点顺序。

  2. OpenRouter:Announcements(RSS)63

    OpenRouter 推出 Activity 仪表盘与 Analytics API:按智能体、模型、请求追踪 AI 使用成本

    OpenRouter 发布 Activity 仪表盘和 beta Analytics API,可按智能体、模型、请求维度查看支出、token 量、缓存命中率等指标,并支持下钻至单条请求日志。

    推荐理由:这项功能的价值在于聚合看板能下钻到单次请求,把成本异常直接定位到具体 API key 和任务,内部案例用一行模型替换就修正了每月约 6.2K 美元的误配支出。

8月14日周五
  1. 公众号:小红书技术(dots.llm)79

    dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

    小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

    推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。

  2. SiliconFlow65

    DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

    推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。

  3. 公众号:蚂蚁百灵(Ling)62

    蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

    蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。

    推荐理由:真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。

  4. 公众号:数字生命卡兹克69

    从0到1速通DeepSeek Harness:一切皆插件的Agent基建

    DeepSeek发布Agent产品DeepSeek Harness,核心理念“一切皆插件”,基于名为Cordis的内核,支持在Agent运行中随时更换插件并保持状态不崩,官方预设100多个一方插件。产品提供标准、PTC、极简、创造四种模式,其中创造模式可让Agent现场创造并挂载新插件实现自改造。目前为开发者预览版,GitHub已获3.7万Star。

    推荐理由:文章把Harness定位为插件化基建而非单一Agent,Cordis内核的时间与空间可组合性解释了Agent如何在运行中插拔能力,这比模板本身更值得理解。