跳到正文
北京时间

全部动态

今日 155 条
11月24日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude开发者平台推出高级工具使用功能,提升AI代理效率

    Anthropic在Claude开发者平台发布三项新功能,以解决传统工具调用消耗大量上下文、易出错的问题。工具搜索工具允许按需加载工具,内部测试中将上下文消耗从约7.7万令牌降至8700令牌,降幅达85%,并将准确率从49%提升至74%。程序化工具调用支持在代码环境中调用工具,减少对上下文窗口的影响,例如Claude for Excel可借此处理数千行数据。工具使用示例则提供了展示工具有效使用方法的通用标准。这些功能共同提升了AI代理处理大规模工具库的能力。

    推荐理由:做 Agent 的人都卡在工具一多上下文就爆、调用就错这两个坑上,Anthropic 这三个功能直接把工具管理从「全塞进去」变成「按需加载+代码编排+示例纠错」,是目前最工程化的解法。

11月18日周二
  1. Inception Labs:Blog(网页)62

    Inception Labs 的 Mercury 扩散大语言模型上线 Azure AI Foundry

    Inception Labs 宣布 Mercury 上线 Azure AI Foundry,将其称为首个商用规模的扩散大语言模型(dLLM)。该模型采用扩散架构并行生成多个 token,推理速度最高达可比自回归模型的 10 倍,官方称其在知识、编码、指令遵循和数学基准上与 Gemini 2.5 Flash、Claude 4.5 Haiku 相当。

    推荐理由:原文给出扩散架构的并行生成原理、与同类模型的延迟和基准对比及许可定价,读者可据此评估实时应用的部署价值。

11月17日周一
  1. ElevenLabs:Blog(网页)62

    ElevenLabs 推出 Image & Video (Beta),整合视觉生成与音频创作

    ElevenLabs 发布 ElevenLabs Image & Video (Beta),将图像和视频生成纳入其创作平台。

    推荐理由:官方宣布音频平台扩展到图像与视频,整合多家视觉模型并在同一工作流完成配音和导出,可关注其统一创作流程的实际体验。

11月14日周五
  1. Claude Platform:开发者版本说明(RSS)63

    Claude Platform 推出结构化输出公测,支持 Claude Sonnet 4.5 和 Opus 4.1

    Claude Platform 上线结构化输出公测,可为 Claude 的响应提供有保证的 schema 一致性。开发者可通过 JSON 输出获取结构化数据,或使用严格工具调用进行验证。该功能适用于 Claude Sonnet 4.5 和 Claude Opus 4.1,需在请求中设置 beta 头 `structured-outputs-2025-11-13`。

    推荐理由:Claude 终于支持结构化输出,这是 API 开发者久盼的功能,能让 JSON 输出更稳定可控,虽然还只在两款模型上 beta,但信号明确。

11月4日周二
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 发布 Windsurf Codemaps:AI 生成的代码结构地图

    Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动,生成 AI 标注的代码结构地图,帮助工程师在调试、重构和上手新代码库前理解代码。

    推荐理由:官方介绍了 Codemaps 的入口、模型选择和 Cascade 引用方式,读者可以据此判断它如何用于代码库理解和上下文工程。

10月21日周二
  1. Together AI 研究与产品博客(RSS)66

    Together AI 上线 40 多个图像与视频生成模型,新增视频生成 API

    Together AI 宣布扩展模型库,通过 Runware 合作集成 20 多个视频模型(含 OpenAI Sora 2、Google Veo 3、Minimax Hailuo、Kling v2.1)和 15 个以上图像模型(含 Google Imagen 4.0 Ultra、Nano Banana、Qwen Image),共 40 多个。

    推荐理由:Together AI 官方给出了 40 多个图像与视频模型的名称、时长和逐模型定价,开发者可据此评估能否用一个平台替代多家供应商。

  2. OpenRouter:Announcements(RSS)68

    Provider Variance: Introducing Exacto

    同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种“提供商方差”,研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。

    推荐理由:OpenRouter 推出 Exacto,直接回答了开发者最头疼的问题:同一个模型换家供应商跑出来的结果到底差多少。做 Agent 或多模型路由的产品人,这个工具能帮你少踩很多坑。

10月20日周一
  1. LangChain:Blog(RSS)64

    LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展

    LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。

    推荐理由:三周年反思同时宣布 1.0 和 1.25 亿美元融资,LangChain 从实验框架转向企业级基础设施,影响开发者在兼容性与长期维护上的判断。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    超越权限提示:让Claude Code更安全、更自主

    Claude Code引入沙盒化技术,通过文件系统与网络双重隔离来增强安全性,并大幅减少权限提示。内部测试显示,该技术将权限提示安全地降低了84%。新推出的沙盒运行时(作为开源研究预览版)允许开发者自定义目录和网络访问权限,使Claude能在限定范围内自主运行命令。同时,网页版Claude Code在云端隔离沙盒中运行,即使遭遇提示注入或代码入侵,也能有效保护Git密钥等敏感凭证不被泄露,从而提升开发安全性与效率。

    推荐理由:Claude Code 的沙箱方案把安全和自主性这对矛盾解开了,权限提示减少 84% 不是数字游戏,是真把 agent 从「每步都要你点确认」变成「在笼子里自己跑」,做 coding agent 的团队该认真看看这套 OS 级隔离思路。

10月17日周五
  1. OpenAI Developers(RSS)68

    OpenAI 展示 Codex 在代码编辑器中的使用方式

    OpenAI 发布视频,演示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的开发工作流。内容涉及 Codex 与 IDE 扩展(codex, IDE extension),视频链接为 https://www.youtube.com/watch?v=sd21Igx4HtA。

    推荐理由:OpenAI 官方演示视频,展示如何把 Codex 接入主流代码编辑器并简化编辑器内工作流。

10月16日周四
  1. Claude Platform:开发者版本说明(RSS)67

    Claude Platform 发布 Agent Skills 功能,支持 PowerPoint/Excel/Word/PDF 文件处理

    Anthropic 在 Claude Platform 推出 Agent Skills(技能)测试版,通过动态加载指令、脚本和资源来扩展 Claude 的能力。首批提供 PowerPoint、Excel、Word 和 PDF 文件的预置技能,用户也可通过 Skills API 上传自定义技能封装领域知识和组织工作流。该功能需启用代码执行工具。

    推荐理由:Anthropic给Claude加上Agent Skills,直接把领域知识打包成可复用技能,构建复杂Agent的门槛降了一个数量级,做自动化的团队该关注了。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    为智能体配备现实世界技能:Agent Skills 开放标准

    Anthropic 推出了“Agent Skills”开放标准,旨在为通用智能体(如Claude)提供可组合、可扩展且可移植的领域专业知识。一个Skill是一个包含指令、脚本和资源的文件夹,其核心SKILL.md文件采用渐进式披露设计,智能体可根据任务动态加载所需信息,从而最小化上下文占用。例如,PDF技能赋予了Claude直接操作PDF表单的新能力。该框架允许用户通过封装和共享程序性知识来定制智能体,无需为每个用例构建碎片化的定制代理。

    推荐理由:Agent Skills 把「给 Agent 喂知识」从手写 prompt 变成了可复用的文件夹协议,做 Claude Code 或 Agent 产品的人现在就该动手试,这比 MCP 更轻量也更贴近日常开发。

10月7日周二
  1. Anthropic:Alignment Science Blog(网页)71

    Anthropic 开源 AI 安全审计工具 Petri,用智能体自动测试模型对齐行为

    Anthropic 发布开源自动审计框架 Petri(Parallel Exploration Tool for Risky Interactions),用 AI 审计智能体在多轮场景中测试目标模型,工具地址为 github.com/safety-research/petri。

    推荐理由:Anthropic 开源了用 AI 智能体自动审计目标模型行为的 Petri 框架,读者可以直接复用其审计流程和评分维度设计。

10月1日周三
  1. Thinking Machines Lab:News(网页)60

    Thinking Machines Lab 发布语言模型微调 API Tinker

    Thinking Machines Lab 于 2025 年 10 月 1 日发布 Tinker,一个用于微调语言模型的灵活 API,官方处理分布式训练的复杂性,用户可控制算法和数据。

    推荐理由:原文来自官方发布,说明了 Tinker 的微调能力、LoRA 成本方式和早期用户实例,可据此判断其对研究者的可用性。

  2. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy,让 notebook 中 LLM 调用快 60 倍

    Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。

    推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。

  3. OpenRouter:Announcements(RSS)58

    OpenRouter 推出每月100万免费BYOK请求

    OpenRouter 向每位客户每月提供100万次“Bring Your Own Key”(BYOK)请求,完全免费。

    推荐理由:这个公告虽然旧了,但 OpenRouter 的 BYOK 免费额度至今仍在,对想低成本折腾模型的个人开发者来说,每月 100 万次请求比很多付费计划都香。

  4. OpenRouter:Announcements(RSS)60

    每月 100 万次免费 BYOK 请求

    所有客户每月可免费获得 100 万次“自带密钥”(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。

    推荐理由:OpenRouter 给 BYOK 用户每月免 100 万次请求,对用自己 API key 跑 Agent 的开发者来说是实打实的成本减免,值得顺手薅。

9月29日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/dInfer

    inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。

    推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

  2. OpenAI Developers(RSS)65

    OpenAI 发布 Agentic Commerce Protocol 开放标准,连接商家与 ChatGPT 用户

    OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准,作为两者之间的基础设施。它让 ChatGPT 能接收结构化商品目录数据、理解商家库存并在对话中呈现相关商品。文档提供了带示例 payload 的入门指引,以及关于商品文案、变体建模和归因的 feed 质量优化最佳实践。

    推荐理由:OpenAI 官方文档介绍了 ACP 的定位和接入路径,商家可据此了解如何让商品出现在 ChatGPT 中。

  3. Cognition 模型 / Devin 博客(网页)65

    Cognition 为 Claude Sonnet 4.5 重构 Devin:新版本快 2 倍、评测提升 12%

    Cognition 发布基于 Claude Sonnet 4.5 重构的新版 Devin,速度提升 2 倍,Junior Developer Evals 提升 12%,已在 Agent Preview 上线,旧版 Devin 仍可用。

    推荐理由:来自一线 Agent 团队的适配复盘,给出了 Sonnet 4.5 的具体新行为和对应的工程应对,可迁移到类似智能体架构。

9月12日周五
  1. OpenAI Developers:Blog(网页)72

    OpenAI 发布 Realtime API GA 版与 gpt-realtime 模型开发者说明

    OpenAI 介绍 gpt-realtime 语音模型和 Realtime API 正式可用(GA)后的接口变化与新功能。

    推荐理由:官方逐一解释了 GA 版接口变化和新功能的使用场景,对正在接入 Realtime API 的开发者有直接参考价值。

9月9日周二
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

    FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。

    推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。

9月3日周三
  1. Linear:Now(RSS)61

    Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

    Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。

    推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

9月2日周二
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Platform 发布 Code Execution Tool v2 公测版,支持 Bash 命令与文件操作

    Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。

    推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。

8月27日周三
  1. Claude Platform:开发者版本说明(RSS)61

    Claude Platform 发布 PHP SDK 测试版

    Claude Platform 于 8 月 27 日推出 PHP SDK 测试版。该 SDK 允许开发者通过 PHP 语言调用 Claude API,构建基于 Claude 的应用程序。

    推荐理由:Anthropic 给 PHP 开发者递了橄榄枝,beta 版 SDK 让 PHP 项目接入 Claude 更容易了,虽然量级不大但补上了生态缺口。

8月21日周四
  1. Linear:Now(RSS)60

    Cursor 与 Linear 推出深度集成,可直接在 Linear 中指派任务给 Cursor 智能体

    Cursor 与 Linear 推出新集成,用户可直接在 Linear 中将问题指派给 Cursor 智能体,如同指派给队友。智能体能承担编码任务、创建 PR 并在 Linear 中更新进度,降低团队处理低优先级问题的激活成本。该集成利用 Linear 的 SDK 和 GraphQL 类型快速构建,Cursor 产品经理 Rohan Varma 表示新 API 一天内即可上线运行。

    推荐理由:Cursor 代理现在能直接从 Linear 任务面板接手编码工作,后台自动提 PR、更新进度,对那些积压 P2/P3 的团队来说,这是把 AI 真正嵌入工作流的信号。

8月7日周四
  1. OpenRouter:Announcements(RSS)66

    GPT-5 现已上线

    GPT-5 已在 OpenRouter 平台正式推出。该模型具备长上下文处理能力,专门针对复杂推理任务与代码工作流进行了优化。此次发布标志着新一代大语言模型开始接入开放路由网络,为开发者与用户提供更强大的多步骤逻辑处理和编程辅助功能。

    推荐理由:OpenRouter 上架 GPT-5 本身不算新闻,但对用 OpenRouter 做多模型路由的开发者来说,这是终于能切到最新旗舰的信号,值得第一时间跑一遍自己的 benchmark。

  2. 英国 AI Security Institute:Blog(网页)65

    英国 AISI 开源 Inspect Sandboxing Toolkit 用于安全的 AI 智能体评估

    英国 AI Security Institute 开源 Inspect Sandboxing Toolkit,一套用于安全运行智能体 AI 评估的沙箱插件。

    推荐理由:原文给出三个沙箱插件和三层隔离协议,并说明架构如何分离推理与工具执行,读者可据此选择评估隔离方案。

7月10日周四
  1. OpenRouter:Announcements(RSS)55

    OpenRouter 免费套餐更新:引入新模型维持可访问 AI 推理

    OpenRouter 发布免费套餐更新,通过引入新模型来维持可持续的 AI 推理服务,旨在继续为广大用户提供可访问的 AI 能力。

    推荐理由:OpenRouter 一年前把几个新模型塞进免费层,当时对白嫖开发者是利好,但现在点开只能闻到时间的灰尘。

6月26日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    Claude Desktop推出“桌面扩展”新格式,实现MCP服务器一键安装

    Claude Desktop推出了名为“桌面扩展”的新打包格式(.mcpb文件),旨在彻底简化MCP服务器的安装流程。该格式将服务器代码、所有依赖项和配置清单打包成一个ZIP压缩包。用户只需下载.mcpb文件并用Claude Desktop打开点击安装即可完成,无需手动配置环境、安装运行时或处理依赖冲突。此举解决了以往需要开发者工具、手动编辑配置文件和依赖管理等复杂问题,显著降低了非技术用户使用强大本地MCP服务器的门槛。

    推荐理由:MCP 服务器装机从「开发者手动改 JSON」变成「双击 .mcpb 一键安装」,Anthropic 把 MCP 生态的用户门槛砍掉了一大截,做 MCP server 的开发者现在该认真考虑打包分发了。

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

6月3日周二
  1. Suno:Blog(网页)76

    更高水平的创意控制 · Suno团队

    Suno发布了新的创作工具,旨在将创意控制权完全交还给艺术家。新功能包括支持上传最长8分钟的音频、具备行业首创编辑工具(如歌词替换、段落修改和重混)的升级版歌曲编辑器,以及可调节创作风格的“创意滑块”。创作完成后,用户可利用前沿技术将轨道分离为12条独立音轨(如人声、鼓、贝斯)进行预览和下载,便于在数字音频工作站(DAW)中进行后续编辑。

    推荐理由:Suno 这次不是加几个 style,而是给了波形编辑和 12 轨分离,把 AI 音乐从生成器变成了制作工具,音乐创作者可以进来真正干活了。

5月30日周五
  1. Modal 官方工程博客(RSS)62

    Modal 上线 B200 和 H200 GPU

    Modal 宣布 B200 和 H200 GPU 开放给所有账户使用,无需联系销售,B200 定价 $6.25/hour,H200 定价 $4.54/hour,一行代码即可在 Function 中指定。

    推荐理由:原文给出 B200 与 H200 的价格、规格对比和实测延迟数据,读者可据此评估迁移到新 GPU 的收益。

5月28日周三
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 推出推理流摘要、加密货币发票等多项新功能

    OpenRouter 上线了推理流摘要(Reasoning Streams)功能,支持流式推理过程摘要,同时新增加密货币发票支付、最终用户 ID(End-User IDs)、速率限制保护以及密钥锁定等特性。

    推荐理由:如果你在用 OpenRouter 做应用,这几个更新挺实用,推理流输出让代理开发更可控,加密支付和端用户 ID 也降低了商业化门槛。

5月22日周四
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布官方 DeepWiki MCP Server,免费开放 GitHub 仓库问答

    Cognition 发布官方 DeepWiki MCP Server,免费且无需登录或鉴权,可对 DeepWiki.com 已收录的 GitHub 仓库进行程序化问答和上下文获取。

    推荐理由:原文列出了三个可用工具和接入方式,开发者可以直接把它接进 Claude Desktop 等 MCP 客户端来查询 GitHub 仓库。

5月15日周四
  1. Cognition 模型 / Devin 博客(网页)65

    Devin 2.1 发布:任务置信评级、Linear/Jira 集成与内置代码库理解

    Cognition 发布 Devin 2.1,新增 🟢🟡🔴 置信评级,置信分与任务成功率高度相关,🟢 得分任务的 PR 合并可能性是 🔴 的两倍。同时为 Linear 和 Jira 集成加入批量自动评分,可在不启动会话的情况下为多个 issue 打分;并内置 DeepWiki 同源的代码库理解能力,可用 !ask 提问,不确定计划时等待用户确认。

    推荐理由:原文给出置信分与任务成功率的关联数据,以及按置信度筛选任务的用法,读者可据此改进 Devin 工作流。

5月5日周一
  1. Cognition 模型 / Devin 博客(网页)74

    Cognition 发布 DeepWiki,为任意 GitHub 仓库生成免费 AI 文档

    Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 免费公开,把 URL 中的 github.com 换成 deepwiki.com 即可查看任意仓库的 AI 文档。已索引超过 50,000 个热门公开仓库,涵盖 Model Context Protocol、LangChain 等;公开仓库可免费添加,私有仓库需 Devin 账号。

    推荐理由:原文给出了使用方式和已索引规模,读者可以据此判断如何用 DeepWiki 快速理解陌生代码仓库。

4月3日周四
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 发布 Devin 2.0,推出 Agent 原生 IDE 并新增 $20 起的灵活方案

    Cognition 发布 Devin 2.0,带来 Agent 原生 IDE 体验和 $20 起的新方案。用户可并行运行多个 Devin,各自配备云端 IDE,可在 IDE 内用 Cmd+I、Cmd+K 等快捷键审查和修改 Devin 的代码。

    推荐理由:官方公告列出新 IDE 体验、三项新功能和 $20 起的新定价,读者可据此评估 Devin 在编码工作流中的可用性变化。

3月6日周四
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 推出 Deep Research 工具及多款新模型

    OpenRouter API 上线首个深度研究工具,API 响应中直接包含完整引用。同时平台新增多款模型。

    推荐理由:第一个通过 API 可调用的 deep research 工具,直接返回带引用结果,想在自己产品里加 research 能力的开发者不容错过。

1月24日周五
  1. OpenRouter:Announcements(RSS)59

    OpenRouter 推出 Reasoning Tokens,用于思考模型

    OpenRouter 为思考模型(thinking models)新增推理 token(reasoning tokens),帮助用户理解模型思考过程。

    推荐理由:OpenRouter把思考模型的推理步骤给透明了,调试链路的开发者能直接看“内心戏”,但放在今天这个功能已不稀奇。