跳到正文
北京时间

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 1301–1320 条 · 共 1,387 条
11月3日周一
  1. LMSYS:Blog(Chatbot Arena 团队)

    在 NVIDIA DGX Spark 上优化 GPT-OSS:实现本地大模型部署

    与 NVIDIA 合作,在 DGX Spark 上通过 SGLang 成功支持 GPT-OSS 20B 与 120B 模型,实现 20B 版本约 70 tokens/s、120B 版本约 50 tokens/s 的生成速度,达到目前最优水平。用户可通过 Docker 部署 SGLang 服务,接入 Open WebUI 实现本地聊天,或借助 LMRouter 转换请求格式以完全本地化运行 Claude Code。该方案使在 DGX Spark 上部署多百亿参数本地编码智能体成为现实。

    推荐理由:DGX Spark本地跑通Claude Code完全离线,隐私敏感开发者的新选择

10月30日周四
  1. Hugging Face:Blog(RSS)83

    Aligning to What? Rethinking Agent Generalization in MiniMax M2

    MiniMax 在 Hugging Face 发布博客,探讨其 M2 智能体模型的泛化能力。文章核心在于重新思考智能体应“对齐”到什么标准或目标,以提升其在未见任务和环境中的通用性能。这涉及对模型训练范式和评估指标的反思,旨在突破当前智能体在特定任务上过拟合、难以泛化的局限。

    推荐理由:Agent 泛化是 AI 实用化关键,这篇重新思考可能带来新突破。

  2. MiniMax:Blog(网页)

    MiniMax发布新一代语音模型Speech 2.6

    MiniMax发布语音模型Speech 2.6,端到端延迟降至250毫秒内,支持实时对话。新增多语言特殊格式解析能力,可自动朗读URL、邮箱、电话、日期及金额,无需预处理。推出Fluent LoRA功能,即使源录音带口音也能保留音色并生成流畅语音,支持40余种语言。已被LiveKit、Vapi等平台及智能硬件采用。

    推荐理由:MiniMax发布Speech 2.6语音模型,支持Voice Agent场景,实现超低延迟与Fluent LoRA语音克隆优化。

  3. Claude:Blog(网页)

    金融服务领域构建 AI 代理指南

    Claude 发布金融服务 AI 代理构建指南,分享 NBIM、Brex 等机构实践。NBIM 员工每周节省数百小时,McKinsey 研究显示欺诈检测生产力可提升 200% 至 2000%。AI 代理能自主整合多源数据、执行跨系统操作,在合规框架下处理客户服务与风险分析,将传统分析工具升级为可独立完成交易的自主系统。

    推荐理由:Anthropic官方分享金融AI智能体落地实践,含NBIM、Brex等真实案例与效率数据。

10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

10月28日周二
  1. MiniMax:Blog(网页)

    MiniMax 发布 Hailuo 2.3 / 2.3 Fast 视频模型

    MiniMax 推出 Hailuo 2.3 视频生成模型,在物理动作流畅度、艺术风格化(支持动漫、水墨、游戏 CG)及角色微表情方面显著提升,维持 Hailuo 02 原价,Fast 版本批量创作成本降低 50%。Hailuo Video Agent 同步升级为 Media Agent,支持多模态一键视频生成与分步自定义创作,已全平台上线并开放免费试用。

    推荐理由:MiniMax 发布 Hailuo 2.3 视频模型及 Media Agent,支持多模态一键生成

10月27日周一
  1. MiniMax:Blog(网页)62

    MiniMax M2与AI智能体:简中见巧

    MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。

    推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。

10月24日周五
  1. Google DeepMind:Blog(RSS)

    Gemini 2.5 Computer Use 模型发布

    Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。

    推荐理由:Google 发布 Gemini 2.5 Computer Use 模型,支持 Agent 自主操作图形界面

10月21日周二
  1. PromptArmor:Threat Intelligence69

    PromptArmor 演示如何通过恶意 Marketplace 插件劫持 Claude Code 并外泄用户数据

    PromptArmor 发布安全研究,展示 Claude Code 新上线的插件 Marketplace 功能可被用于攻击。恶意插件先利用 Hook 改写 settings.local. 权限或自动批准 curl 命令,绕过人工审批防护,再通过 Command 中的提示词注入诱使 Claude 把代码库上下文用 curl 发到攻击者服务器。

    推荐理由:原文完整演示了恶意插件绕过 Claude Code 人工审批并外泄文件的三步攻击链,适合关注 Agent 插件安全的开发者参考。

10月20日周一
  1. Claude:Blog(网页)

    Claude Code 发布网页版

    Anthropic 推出网页版 Claude Code,以研究预览形式向 Pro、Max 及企业用户开放。用户可直接在浏览器中分配编码任务,无需本地终端,支持并行处理多个 GitHub 仓库的开发工作,并自动创建 PR 和变更摘要。该服务基于云端隔离沙盒运行,具备网络和文件系统限制,同时登陆 iOS 应用支持移动编码。云会话与现有 Claude Code 使用共享速率限制。

    推荐理由:Claude Code搬进浏览器,零门槛并行编程提PR,手机端也能随时跑任务

10月16日周四
  1. Claude Platform:开发者版本说明(RSS)67

    Claude Platform 发布 Agent Skills 功能,支持 PowerPoint/Excel/Word/PDF 文件处理

    Anthropic 在 Claude Platform 推出 Agent Skills(技能)测试版,通过动态加载指令、脚本和资源来扩展 Claude 的能力。首批提供 PowerPoint、Excel、Word 和 PDF 文件的预置技能,用户也可通过 Skills API 上传自定义技能封装领域知识和组织工作流。该功能需启用代码执行工具。

    推荐理由:Anthropic给Claude加上Agent Skills,直接把领域知识打包成可复用技能,构建复杂Agent的门槛降了一个数量级,做自动化的团队该关注了。

  2. Cognition 模型 / Devin 博客(网页)62

    Cognition 发布 SWE-grep 与 SWE-grep-mini,用 RL 训练快速并行代码检索模型

    Cognition 发布 SWE-grep 和 SWE-grep-mini 模型,专注高度并行的代码上下文检索,检索能力匹敌前沿编码模型但耗时低一个数量级。模型每轮最多发起 8 个并行工具调用、限制 4 轮,通过多轮强化学习训练,奖励为文件与行范围检索的加权 F1;由 SWE-grep 蒸馏并继续 RL 得到 SWE-grep-mini。

    推荐理由:原文给出检索质量分数与推理速度对比数字,并说明多轮 RL 训练方法,读者可评估这种专用检索模型能否迁移到自己的编码工作流。

  3. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体配备现实世界技能:Agent Skills 开放标准

    Anthropic 推出了“Agent Skills”开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。

    推荐理由:Agent Skills 把「给 Agent 喂知识」从手写 prompt 变成了可复用的文件夹协议,做 Claude Code 或 Agent 产品的人现在就该动手试,这比 MCP 更轻量也更贴近日常开发。

10月13日周一
  1. Answer.AI 官方研发博客(RSS)60

    Kerem Turgutlu 用 SolveIt 将 Karpathy 的 tokenizer 视频教程做成书章

    Answer.AI 的 Kerem Turgutlu 撰文讲解如何用 SolveIt 把 Andrej Karpathy 超两小时的 tokenizers 视频教程转成带可运行代码、超链接和图片的书章。

    推荐理由:作者完整复盘两阶段对话工作流,把超两小时视频转成可运行代码的书章,方法可直接迁移到任意长视频转写场景。

10月9日周四
10月7日周二
10月2日周四
  1. Andrej Karpathy

    Sutton(《The Bitter Lesson》作者)在播客中质疑 LLM 并非真正的"苦涩的教训"产物——它们依赖有限的人类数据且充满偏见。他主张 AI 应像动物一样通过 RL 与世界动态交互,而非模仿人类文本。作者认同 LLM 确实充斥人工干预,但认为预训练是应对冷启动的实用"进化替代方案",纯 RL 在现实世界难以行得通。

    引用Dwarkesh Patel@dwarkesh_sp

    .@RichardSSutton,强化学习之父,不认为 LLM 是“苦涩教训”的信徒。 我对 Richard 立场的善意解读:我们需要某种新架构来实现持续(在职)学习。 而如果我们有了持续学习,就不需要专门的训练阶段——智能体就像所有人类、乃至所有动物一样,边做边学。 这种新范式将使我们当前基于 LLM 的方法过时。 我尽力表达了这样一种观点:LLM 将成为这种经验学习得以发生的基础。现场有些火花四溅。 0:00:00 – LLM 是死路一条吗? 0:13:51 – 人类会做模仿学习吗? 0:23:57 – 经验时代 0:34:25 – 当前架构在分布外泛化能力很差 0:42:17 – AI 领域的意外 0:47:28 – AGI 之后“苦涩教训”仍然适用吗? 0:54:35 – 向 AI 的传承

    推荐理由:Karpathy解读Sutton对LLM的批判,提出「召唤幽灵」vs「构建动物」的深刻比喻,反思AI发展路径

10月1日周三
  1. OpenRouter:Announcements(RSS)58

    OpenRouter 推出每月100万免费BYOK请求

    OpenRouter 向每位客户每月提供100万次“Bring Your Own Key”(BYOK)请求,完全免费。

    推荐理由:这个公告虽然旧了,但 OpenRouter 的 BYOK 免费额度至今仍在,对想低成本折腾模型的个人开发者来说,每月 100 万次请求比很多付费计划都香。