跳到正文
北京时间

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

252条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 61–80 条 · 共 252 条
7月8日周三
  1. Google Blog:AI(RSS)69

    Gemini API Managed Agents 新增后台执行、远程 MCP 与自定义函数等能力

    Google 为 Gemini API 的 Managed Agents 新增后台执行、远程 MCP 服务器集成、自定义函数调用与凭证刷新功能。后台执行通过传入 `background: true` 异步运行任务,立即返回 ID 供轮询状态或流式获取进度。Managed Agents 可直接连接远程 MCP 服务器,无需自定义代理中间件,并能与内置沙箱工具(如 Google 搜索、代码执行)混合使用。自定义函数调用支持本地执行业务逻辑,内置工具自动在服务端运行。凭证刷新通过传递现有环境 ID 和新网络配置完成,沙箱内文件系统、已安装包和仓库保持不变。这些更新旨在帮助开发者构建可靠的生产级 AI 智能体。

    推荐理由:Managed Agents 这次更新解决了异步执行和远程工具调用的痛点,让 Gemini 代理能真正跑在后台,对已经在用 Gemini API 做产品的开发者属于必读更新。

7月7日周二
  1. elvis77

    Elvis Saravia 介绍使用 human-in-the-loop(HITL)来提升 agentic loops 的可靠性。他所有 Claude 和 Codex agent 会话都通过 @DialAgent MCP 服务器,该服务器为 agent 提供专属号码,支持语音、SMS、iMessage 作为原生工具。当循环/自动化处理 PR 或新功能时,agent 会通过简短电话将决策升级给人类,尤其适合在路上或离开电脑时。用户可粘贴指令让 agent 拨打电话测试。DialAgent 提供 $5 免费额度:http://getdial.ai

    推荐理由:给AI Agent装电话号直接打电话请示,这个实操方案能大幅减少循环失败,Claude Code和Codex用户有$5免费额度马上可试,出差党尤其友好。

  2. HuggingFace Daily Papers(社区热门论文)73

    LLM-as-a-Verifier:一种通用验证框架

    LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。

    推荐理由:把验证当作新的缩放轴,这个思路很扎实,尤其直接给 Claude Code 搭了扩展。做 agent 系统的开发者现在可以试试把评估模块换成连续概率打分,也许比离散判断有效。

  3. Hacker News 热门(buzzing.cc 中文翻译)75

    OfficeCLI:为AI智能体设计的开源Office套件

    OfficeCLI是全球首个专为AI智能体设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成“渲染→查看→修复”的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。支持公式、图表、条件格式、RTL布局、修订追踪、表格、数据透视表等复杂功能。提供CLI命令和基于自然语言的桌面应用AionUi,并可一键安装到Claude Code、Cursor、Windsurf、GitHub Copilot等AI编码工具中。

    推荐理由:我觉得这个工具把 AI 代理操作 Office 的最后一公里走通了,特别是内置渲染引擎让代理能‘看见’文档布局,而不是盲猜 DOM,对自动化报表和批处理文档的团队很有价值。

  4. OpenClaw🦞65

    OpenClaw 登陆 @huggingface 本地应用 🦞🤝🤗 1. 在 hf 上挑任意 GGUF/MLX 模型 2. 复制 openclaw onboard 设置 3. Voila,你得到一个完全本地的工具调用智能体。无云端、无密钥、无人监控。 让你的 claw 本地化到极致。抵抗是徒劳的 🦞

    推荐理由:OpenClaw 把本地工具调用代理做成了 HuggingFace 的一键部署,隐私敏感场景下的 Agent 开发终于有了低门槛方案,做本地自动化的值得一试。

7月3日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    面向 Web 开发者的 Safari MCP 服务器

    Safari Technology Preview 247 推出 Safari MCP 服务器,基于 Model Context Protocol,允许任何 MCP 兼容客户端连接 Safari 浏览器窗口。智能体可获取 DOM、网络请求、截图、控制台输出等信息,自主完成调试、性能分析、可访问性检查等任务。内置 `browser_console_messages`、`screenshot`、`evaluate_javascript`、`list_network_requests` 等工具。开发者安装后启用“远程自动化与外部智能体”选项,即可通过命令接入,减少窗口切换。

    推荐理由:Safari 首次以官方身份推出 MCP 服务器,让 AI 编程助手能直接调试浏览器渲染,对前端开发者做兼容性测试和性能检查很实用,不过局限在 Safari 生态。

7月2日周四
  1. MarkTechPost(RSS)72

    Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

    ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。

    推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。

  2. 公众号:昆仑万维(天工)67

    昆仑万维天工3.2发布Skywork Tags,AI智能体加入工作群聊

    昆仑万维天工3.2发布Skywork Tags,将AI智能体以团队成员身份接入Slack、飞书、钉钉、Discord、Telegram等即时通讯工具。团队可在原有工作群中@Skywork参与讨论,无需切换窗口或迁移数据。共享版Agent持续吸收多样上下文后表现反超精心调教的个人版,团队最终完全改用共享版。Skywork Tags不要求改变工作方式,让AI积累团队上下文并越用越强。

    推荐理由:Skywork Tags 的思路走对了——不逼团队搬家,而是让 AI 进群,内部测试也证明共享 Agent 能远超个人调教,做协作工具的产品人可以借鉴。

  3. Dan Hendrycks80

    Dan Hendrycks 发布 CAIS 新版《远程劳动指数》:AI 自动化完成远程项目的能力显著提升——Claude Fable 5 达到 16.1% 的专业标准完成率,是 Opus 4.8(8.3%)的近两倍,也是 Opus 4.6(4.2%)的约四倍;整体远程项目自动化率过去五个月增长约4倍。

    引用Center for AI Safety@CAIS

    新的远程劳动指数结果: AI 对真实远程工作的自动化正在快速提升。Claude Fable 5 现在能以专业标准完成 16.1% 的项目,大约是第二名模型的两倍,也高于 Opus 4.6 的 4.2% 自动化率。

    推荐理由:该数据首次以量化方式揭示当前主流大模型在真实远程工作场景中的实际替代能力,尤其 Fable 5 的突破性表现可能影响企业外包与远程协作模式;对从业者、政策制定者及AI产品方均有现实参考价值。

  4. xAI:News(网页)77

    xAI 发布 Voice Agent Builder 测试版

    xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。

    推荐理由:xAI 用 Grok Voice 原生的语音到语音路径,把生产级语音代理的搭建门槛降到了无代码、两分钟,计费也简单,做语音业务的人值得试试。

7月1日周三
  1. Anthropic:Newsroom(网页)66

    Claude Science 科研工作台正式上线

    Anthropic 推出 AI 科研工作台 Claude Science,整合常用工具与计算资源,支持从文献分析到多步骤研究的全流程。提供超 60 项预配置技能与连接器,覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域;可在macOS/Linux本地运行,或通过SSH/HPC远程使用。生成含代码和环境的可审计成果(3D蛋白质结构、基因组浏览器轨迹等),内置reviewer agent自动检查引用与计算错误。通过NVIDIA BioNeMo接入Evo 2、Boltz-2等模型,也支持连接自有模型与管道。今日以beta版面向Claude Pro、Max、Team和Enterprise用户开放。

    推荐理由:Anthropic 为科学家打造了一个整合 60+ 技能、可管理计算和审计输出的 AI 工作台,让 AI 从顾问变成可复现的实验合作者。

  2. Claude:Blog(网页)72

    Claude Code 入门:智能体循环

    Claude Code 团队将智能体循环定义为 agent 重复工作直到满足停止条件的过程,并划分出四种主要类型:turn-based 循环(用户提示触发,Claude 自行判断完成或需更多上下文)、goal-based 循环(通过 `/goal` 命令设定可验证完成标准与最大轮次)、time-based 循环(通过 `/loop` 按时间间隔重复执行,可用 `/schedule` 移至云端)、以及 proactive 循环(基于事件或计划自动运行,无人实时参与)。文章还介绍了如何编写 SKILL.md 文件将人工验证步骤编码,让 Claude 进行端到端自检,减少 turn-based 循环中的手动操作。

    推荐理由:Anthropic把agentic loops从模糊概念变成四种可复制的模式,附带SKILL.md和命令示例,Claude Code用户读完就能设计更自主的编码流程。

  3. Simon Willison 博客73

    用 shot-scraper video 让 AI 智能体录制工作演示视频

    shot-scraper 1.10 新增 shot-scraper video 命令,支持通过 storyboard.yml 文件定义操作步骤,并利用 Playwright 录制浏览器视频。演示视频展示了 Datasette 中从粘贴的 CSV/TSV/JSON 数据创建新表的功能。该功能依赖 Playwright 1.61.0 新增的 screencast 机制,解决了此前视频开头白帧、宽度固定 800px 等问题。开发者 Simon Willison 强调,将 --help 输出设计得足够详细,可使编码 Agent 直接利用该命令生成演示视频。

    推荐理由:Simon 把 agent 的产出从文字推到了视频,这个 shot-scraper video 让 agent 自己生成 storyboard 并录屏,等于给自动化流程加了一双眼睛,开发者可以立刻用上这套 demo 生成方案。

6月29日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    Herdr:驻留在终端中的AI智能体多路复用器

    Herdr是一个驻留在终端中的AI智能体多路复用器,允许用户在单一终端界面内管理和切换多个AI智能体会话。

    推荐理由:这个工具把 AI 代理管理塞进终端,比开一堆浏览器标签自然,对命令行重度用户是个值得一试的 early idea。

  2. MarkTechPost(RSS)74

    EverOS:开源Markdown优先智能体记忆运行时,支持混合检索与自进化技能

    EverMind 推出开源智能体记忆运行时 EverOS(Apache 2.0 许可)。它以可编辑的 Markdown 文件为记忆主体,经 SQLite 管理状态、LanceDB 实现混合检索(BM25 关键词 + 向量搜索 + 标量过滤)。每个完成的任务记录为 Case,离线提炼为可复用的 Skill,使记忆随使用自我进化。v1.1.0 新增 Knowledge APIs(支持分类与话题搜索的 Markdown 页面)和 Reflection(跨会话优化 Profile 和 Skill)。据 EverMind 报告,LoCoMo 得分 93.05%,LongMemEval 83.00%,HaluMem 93.04%,p95 检索延迟低于 500ms。运行时可本地优先部署,也提供 EverOS Cloud 托管选项,兼容 OpenAI 协议端点。

    推荐理由:EverOS把Agent记忆从沉重的向量数据库堆栈中解放出来,Markdown源真和自进化技能让本地开发更轻便,但基准全由团队自报,上手前最好自己测一下。

6月26日周五
  1. 公众号:数字生命卡兹克71

    Claude Code 6个实用Hook玩法

    Claude Code 内置近30个Hook事件(年初仅13个),本质是写死的规则脚本,运行时不消耗token。6个实用玩法:权限弹窗提醒、开机日程播报(问候+天气+飞书日程)、上下文预压缩时自动生成摘要卡片、结合Skill自动整理下载文件夹、启动后每小时久坐提醒、通过Bark实现手机/手表任务完成/失败推送。让AI从被动聊天框变为事件驱动的自动化系统。

    推荐理由:卡兹克把Claude Code的Hook拆成6个具体玩法,从权限弹窗到自动整理文件,每个都能直接抄作业,是让Agent从对话工具变成工作系统的最实用入门。

  2. Hacker News:AI 热帖71

    OpenKnowledge:开源、AI 优先的 Obsidian/Notion 替代品

    OpenKnowledge 是一款开源、本地优先的 Markdown 编辑器,私密免费,提供完整的所见即所得编辑体验。支持 macOS 桌面应用和 Web UI,内置文件导航、搜索、标签和图谱 wiki 链接查看器。可与 Claude、Codex、Cursor 等桌面应用协同实现 AI 编辑,并通过 MCP/CLI 兼容任意 AI 智能体框架。自带 MCP、技能和智能搜索,支持 LLM Wiki 和知识图谱。团队协作基于 Git/GitHub 实现无代码共享与自动同步。支持嵌入 HTML 及富文本组件。桌面应用内建 TUI,Linux/Windows/Intel Mac 用户可通过 CLI(Node.js 24+)以本地 Web 应用运行。可直接打开任何包含 Markdown/MDX 文件的文件夹。开源协议 GPL-3.0-or-later。

    推荐理由:把 Claude、Codex 等 AI 代理直接嵌进知识库编辑器,想法比 Notion AI 更灵活,但这类工具最终拼的是细节打磨和生态,现阶段可以尝鲜但别急着切换主力。

6月25日周四
  1. OpenRouter:Announcements(RSS)71

    OpenRouter MCP 服务器发布

    OpenRouter 推出 MCP 服务器,为编程智能体提供实时模型数据、基准排名、定价和文档查询。开发者通过一键安装(支持 Claude Code、Codex CLI、Cursor 等客户端),即可在编辑器内完成模型筛选、价格对比和测试推理,无需切换标签页。服务器整合 Artificial Analysis、Design Arena 及 OpenRouter 自身排名数据,例如推荐 GLM-5.2 作为性价比最佳的编码模型。工具集包括 models-list、model-get、model-endpoints、benchmarks 等,支持通过 chat-send 发送测试提示,比较不同模型(如 Claude Opus 4.8、GPT-5.5、DeepSeek V4 Pro)的响应、成本和延迟。API 密钥附带 7 天有效期和 10 美元消费上限,可随时撤销。

    推荐理由:OpenRouter 这个 MCP 服务器让编码 agent 直接从编辑器里选模型、查价格、跑测试,省掉了切浏览器查资料的15分钟,做 AI 开发的值得立刻装上。它把模型选择变成了 agent 自己能完成的工作流,而不只是人工猜测。