跳到正文
北京时间

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

252条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 121–140 条 · 共 252 条
6月4日周四
  1. Hugging Face:Blog(RSS)66

    Hugging Face 为编码智能体重塑 hf CLI 输出格式

    Hugging Face 重新设计 hf CLI,使其同时服务人类用户和编码智能体(Claude Code、Codex 等)。CLI 通过环境变量自动检测智能体驱动,输出紧凑无截断的 TSV 格式,避免 ANSI 和交互提示,大幅降低 token 消耗。复杂多步任务中,不使用 CLI 的智能体 token 消耗最高达 hf CLI 的 6 倍。2026 年 4 月起,Hugging Face 追踪 Hub 智能体流量,Claude Code 约 4 万用户、近 4900 万次请求,Codex 紧随其后。

    推荐理由:HF CLI 现在会自动检测 agent 并切换输出,复杂任务上 token 消耗比 curl/SDK 节省 2-6 倍。如果你在用 Claude Code 或 Codex 操作 Hugging Face Hub,这是必读的升级指南。

  2. HuggingFace Daily Papers(社区热门论文)70

    RHO:利用过往轨迹优化LLM智能体工具链的自监督方法

    Retrospective Harness Optimization (RHO) 是一种自监督方法,仅利用过往轨迹优化LLM智能体的工具链(技能、工具和工作流程集合)。RHO从历史任务中选取多样化的困难任务核心集,并行重新执行;智能体通过自我验证和自我一致性分析回放,生成候选工具链更新,并依据自身成对自我偏好选择最有效更新。在软件工程、技术工作和知识工作三个领域评估中,单轮优化将SWE-Bench Pro通过率从59%提升至78%,无需外部评分。分析表明RHO有效针对先前失败模式,优化后的工具链改变智能体行为模式,在长周期会话中维持更高准确率。

    推荐理由:不靠人工标注就能让 Agent 自我提升,单轮直接把 SWE-Bench Pro 通过率从 59% 拉到 78%,做自主 Agent 优化的同学应该仔细读一下。

  3. MiniMax (official)78

    Mem0 是 MiniMax M3 的官方启动合作伙伴! M3 的 1M token 上下文窗口 + @mem0ai 的记忆层 = 真正记住的 AI 应用。 构建具有持久记忆的个性化 AI 智能体,现在启动周内 M3 享五折优惠。 开始使用 Minimax → https://platform.minimax.io/docs/guides/models-intro 注册 mem0 → http://app.mem0.ai/?utm_source=minimax_x_post

    推荐理由:MiniMax 把 1M 上下文和 Mem0 记忆层绑在一起,不是单纯秀参数,是给 Agent 装了个硬盘,做长期记忆产品的该关注一下。

  4. Claude:Blog(网页)68

    Claude Code技能使用经验:Anthropic内部实践

    Anthropic 分享了内部使用 Claude Code 的 Skills(技能)功能的经验。Skills 是指令、脚本和资源的文件夹,智能体可发现并调用它们以提升准确性和效率。Anthropic 内部已有数百个活跃使用的技能,它们可归为九类,包括库和 API 参考、产品验证、数据获取与分析、业务流程与团队自动化、代码脚手架与模板、代码质量与审查等。最佳技能专注于单一类别,涵盖过多功能会混淆智能体。团队发现,投入时间优化验证类技能对 Claude 输出质量的提升最显著。

    推荐理由:这不是产品公告,而是从几百个内部技能中血泪总结出的实战手册。如果你想让Claude Code真正变成你的工程副驾驶,这9类技能和‘gotchas’章节至少省你三个月踩坑。

6月3日周三
  1. Google Gemini67

    参加 @GoogleDeepMind 首席工程师 @__apf__ 的演示,了解 Gemini Spark 如何帮助简化您的日常工作流程。由 Gemini 3.5 Flash 驱动,Spark 建立在 Gemini 与 @GoogleWorkspace 应用(如 Docs 和 Gmail)连接的能力之上,以执行复杂任务。

    推荐理由:这是 Gemini 把 Agent 能力真正嵌入日常工作流的一步,跟 Workspace 的深度集成会让很多不会编程的人也能用上自动化,值得关注。

  2. 公众号:月之暗面(Kimi)67

    Kimi Work Beta版发布:面向知识工作者的本地Agent

    Kimi Work Beta版随Kimi最新Mac和Windows客户端推出,是基于Kimi Code的通用型本地Agent。它内置Kimi WebBridge浏览器操作方案,支持安装和使用Skill、运行定时任务,并能根据任务复杂度自主创建最多300个子Agent的团队。开发中使用的Kimi K2.6模型支持13小时连续编码、4000余次工具调用,累计产出超5万行有效代码,其中92%由AI自主生成。用户可用自然语言描述目标,Kimi Work即可拆解任务、并行执行、调用工具、操作浏览器,交付文档、表格、PPT等工作产物。

    推荐理由:Kimi 把代码 Agent 的本地能力包装成了面向普通人的工作 Agent,300 个子 Agent 集群让繁琐的任务并行处理成为可能,对天天跟文档表格打交道的人是真提效。

  3. Claude:Blog(网页)77

    Claude Code 新增动态工作流功能

    Claude Code 新增动态工作流功能,允许模型在运行时即兴创建和协调多智能体框架来处理复杂任务。该功能通过执行特定的 JavaScript 文件来生成和协调拥有独立上下文窗口的子代理,可解决单一上下文窗口中长时间执行任务可能出现的智能惰性等问题。工作流适用于研究、安全分析、代码审查等场景,通常消耗更多 token,更适合高价值复杂任务,其最佳实践仍在发展中。

    推荐理由:Claude Code 现在能自己动态生成多代理协调器,这在调试、审查、研究等复杂任务上是个真正的生产力跃迁,但普通编码工作用它反而是杀鸡用牛刀。

  4. Thariq69

    工作流是 Claude Code 自技能和子智能体以来最大的能力升级。 我和 @sidbid 深入探讨了最佳实践、示例等内容。我特别兴奋于它为 Claude Code 启用的非技术任务。

    引用Thariq@trq212

    http://x.com/i/article/2061850535708483585

    推荐理由:Claude Code 的工作流功能这次把自动化从纯代码推到了非技术任务,是开发者和产品人都能立刻用上的升级,虽然不算颠覆但很实打实。

  5. ClaudeDevs77

    我们为 Claude Platform 添加了一个 CLI,使每个 API 端点都可以从你的终端运行。 调用 Messages API,启动 Claude 托管智能体,并将结果直接管道传输到你的 shell。 ant CLI 被使用 claude-api 技能的编码智能体(Claude Code)很好地理解。

    推荐理由:Ant CLI 把 Claude Platform 的所有 API 端点都弄进了终端,配合 Claude Code 用很顺手,做 Agent 或脚本开发的可以直接上手玩。

  6. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    Codex 赋能每一种角色、工具和工作流

    OpenAI 的 Codex 新增了插件、站点和注释等功能。这些新功能旨在帮助分析师、营销人员、设计师、投资者等各类团队,利用 AI 完成更多工作。Codex 进一步拓展其作为 AI 编码工具的应用场景,以支持更广泛的角色、集成更多工具并优化现有工作流。

    推荐理由:Codex不再只是开发者工具,六个角色插件和Sites功能把AI带进了营销、销售、投资等日常流,非技术团队可以直接上手,这是大企业AI落地的实用一步。

6月2日周二
  1. OpenRouter:Announcements(RSS)77

    OpenRouter 5月发布亮点

    OpenRouter 发布5月更新,推出语音与转录API、模型融合(Model Fusion)功能,并为平台添加了私有模型和企业工作区管控能力。此次更新共上线20个新模型,其中包括 Gemini 3.5 Flash 和 Claude Opus 4.8。

    推荐理由:OpenRouter 五月交付了一整套平台级能力,从安全护栏到语音 API 再到模型融合,Pareto Code Router 按质量阈值选廉价模型这个思路,对 coding agent 的成本控制很实用。如果你重度依赖 OpenRouter,这次更新值得细读。

  2. Perplexity70

    推出Search as Code,我们为AI智能体打造的全新搜索架构。 它直接编写Python代码调用我们的搜索栈,而非逐个循环函数调用。 现已在Perplexity Agent API中提供,并成为Computer的默认选项。 https://research.perplexity.ai/articles/rethinking-search-as-code-generation

    推荐理由:Perplexity这次更新把Agent搜索从函数调用链改成直接生成Python代码,思路简洁有效,API开发者应该能立刻感受到token和延迟的下降,可以在Computer里试一下默认效果。

6月1日周一
  1. IT之家(RSS)73

    王兴:美团 AI Agent“小美”与腾讯元宝即将深度合作,用户订单无缝连接

    美团2026年第一季度财报显示营收910.39亿元,净利润亏损68.27亿元。财报电话会上,CEO王兴透露其AI Agent“小美”将与腾讯元宝深度合作。用户在腾讯元宝中提交本地服务需求,将被无缝连接至美团的外卖点餐、配送等生态。王兴强调,面向智能体的服务(To A)正变得日益重要,美团已将AI助手“小团”置于App核心位置,并拓展AI服务外延。

    推荐理由:美团把「小美」接进腾讯元宝,是Agent在本地生活服务里落地的明确信号,虽然还是早期合作,但「服务AI Agent」这个提法值得留意。

  2. Tencent Hy73

    腾讯混元正式发布专为OpenClaw等长期协作智能体(Agent)设计的记忆插件 Hy-Memory。它基于6层记忆框架、System1/System2双系统与三层进化链构建,旨在成为智能体的“第二大脑”。该插件解决了记忆碎片化问题,实现了显著性能提升:记忆数量减少70%以上,单条记忆信息密度提升45%以上,在超长上下文场景中token消耗降低35%,记忆更新速度提升20%。

    推荐理由:腾讯混元给Agent做了个记忆插件,声称能减少70%冗余记忆并提升密度,还直接支持OpenClaw,对正在踩坑Agent长期记忆的团队是个现成的实验品。

  3. 公众号:MiniMax(稀宇科技)78

    MiniMax M3 发布:前沿 Coding、1M 上下文与原生多模态集于一身

    MiniMax 发布 M3 模型,采用全新稀疏注意力架构 MSA,支持 1M 上下文窗口,并原生支持图片、视频输入及电脑桌面操作,是国内首个齐备这些要素的开源模型。

    推荐理由:M3在复现论文和CUDA优化中的长程自主迭代,将模型评估从单轮得分推进到真实协作场景,为衡量Agent Coding能力提供了更具参考价值的维度。

5月30日周六
  1. Claude Code:GitHub Releases(RSS)67

    v2.1.157 更新

    此版本主要改进了插件系统,现可自动加载 `.claude/skills` 目录中的插件,并通过 `claude plugin init` 创建;`/plugin` 命令增加了自动补全。`claude agents` 现在会应用 `settings.json` 中的 `agent` 字段,并支持 `--agent` 参数覆盖。更新修复了多个具体问题,包括处理不可用图片导致的崩溃、在 tmux 中的剪贴板复制失效(2.1.153 回归)、后台会话恢复后日期不正确等。此外,优化了长对话及恢复对话的性能,并改进了在 VS Code、Cursor 和 Windsurf 等 IDE 中的体验。

    推荐理由:Claude Code 这个版本把插件从市场限制中解放出来,自动加载本地 skills 目录,对喜欢自己鼓捣定制工作流的开发者是个实实在在的便利。

  2. OpenAI73

    Windows用户,这条消息是给你的。 计算机使用功能现已在Windows上可用,因此Codex可以在你的Windows电脑上执行操作。 通过ChatGPT移动应用中Codex的Windows支持,你可以在工作继续在Windows电脑上进行时,随时随地启动、审查和引导任务。 这是一项早期体验,但我们正在努力提供更多方式,让你的工作无论身在何处都能持续进行。

    推荐理由:Windows 用户终于等到 Codex 能直接操控电脑了,配合手机端协同一气呵成,虽然还早期,但已经把 AI 真正带进日常工作流里。

  3. OpenRouter72

    OpenRouter 现已支持 "apply_patch",这是一个服务器工具,允许任何模型通过 Responses API 使用 V4A diffs 提出文件编辑建议。 模型生成一个补丁(创建、更新或删除文件)。OpenRouter 在服务器端验证 diff 语法。

    推荐理由:OpenRouter 这个 apply_patch 解决了多模型文件编辑的碎片化,任何模型接上就能出 diff,做 coding agent 的可以少写一堆适配代码。

  4. Tomer Tunguz 博客(VC 分析)65

    技能提炼

    “技能提炼”是一种知识转移方法,由前沿大模型(如 Opus 4.7、GPT-5.1、Gemini 3 Pro)负责撰写并优化标准化的 SKILL.md 流程文件。然后,本地运行的小模型(如 Qwen 35B、Gemma 26B)直接执行这些文件。此过程不同于压缩模型权重的知识蒸馏、训练权重的指令微调或检索事实的 RAG,其核心是提取并转移操作流程,让小模型按步骤执行,从而形成前沿模型作教师、小模型作执行者的循环。

    推荐理由:Tomer 把个人代理的完整工作流摆了出来,用大模型写 skill 小模型执行,这条蒸馏思路比调 prompt 高级,想认真跑本地代理的人该盯一下。

5月29日周五
  1. 公众号:通义实验室(千问)64

    通义实验室发布教程:在 Android 手机部署 MCP 感知服务器

    通义实验室发布教程,演示如何在 Android 手机上部署 MCP 感知服务器,使手机具备本地视觉与听觉分析能力。核心基于端侧 MNN 推理引擎和 Qwen3-VL 2B 模型(约 1.3GB),摄像头与麦克风采集的音视频在本地实时转化为结构化 JSON,再通过 MCP Tool 供 Claude Code 等云端 Agent 远程调用。整个过程不上传原始数据,仅传输语义提取结果。项目已开源,实测可识别红绿灯状态等场景。

    推荐理由:如果你做Agent总觉得AI对物理世界是瞎子,这篇教程就是解药。把Qwen3-VL塞进手机当本地眼睛,不传原始视频只给结构化文字,隐私友好又能被Claude直接调用。