跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 621–640 条 · 共 652 条
11月4日周二
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    通过代码执行提升MCP智能体效率

    随着AI智能体通过模型上下文协议(MCP)连接的工具数量激增,传统预先加载所有工具定义并通过上下文传递中间结果的方法,导致处理速度变慢、成本增加。问题核心在于工具定义占用大量上下文空间,且中间结果(如完整会议记录)在多次工具调用间重复传递,额外消耗数万令牌。文章提出解决方案:将MCP服务器呈现为代码API,使智能体能按需加载工具,并在执行环境中处理数据,仅将精简结果传回模型,从而显著减少令牌消耗、提升效率并降低成本。

    推荐理由:Anthropic 官方把 MCP 从「能连」推进到「连多了怎么办」,用代码执行替代直接工具调用,token 省 98.7% 这个数字不是吹的。做 Agent 工程的人如果还在暴力塞 tool definition,这篇是必读的架构升级指南。

10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

10月23日周四
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    AI基建扩张观察

    AI基础设施建设正面临晶圆厂资本支出过剩的风险,同时算力扩张带来每周1吉瓦的能源消耗压力。文章指出,在长周期基础设施竞赛中,中国凭借产业链整合优势占据有利地位。分析涵盖了AI基建中的产能过剩隐忧、电力瓶颈挑战,以及地缘政治背景下的技术长跑格局,揭示了算力军备竞赛背后的资本与能源约束。

    推荐理由:AI基建泡沫与地缘博弈的冷思考,长期格局研判必读

10月21日周二
  1. OpenRouter:Announcements(RSS)68

    Provider Variance: Introducing Exacto

    同一AI模型在不同服务提供商上的性能表现可能存在显著差异。为了量化这种“提供商方差”,研究团队推出了Exacto评估平台。该平台通过标准化测试揭示,即使是相同的模型(如GPT-4、Claude或LLaMA),在不同云服务或API提供商处运行时,其输出质量、响应速度和稳定性都可能产生高达30%的波动。这一发现对企业和开发者的模型部署策略具有直接影响,强调在选择服务商时需进行针对性性能基准测试。

    推荐理由:OpenRouter 推出 Exacto,直接回答了开发者最头疼的问题:同一个模型换家供应商跑出来的结果到底差多少。做 Agent 或多模型路由的产品人,这个工具能帮你少踩很多坑。

10月20日周一
  1. LangChain:Blog(RSS)64

    LangChain 三年回顾:从开源到 12.5 亿美元公司,发布 LangChain 1.0 与 LangSmith 扩展

    LangChain 创始人 Harrison Chase 回顾项目三年历程,公司估值达 12.5 亿美元,并宣布 LangChain 1.0 发布、LangSmith 扩展及 1.25 亿美元融资。

    推荐理由:三周年反思同时宣布 1.0 和 1.25 亿美元融资,LangChain 从实验框架转向企业级基础设施,影响开发者在兼容性与长期维护上的判断。

10月15日周三
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Haiku 4.5 发布:最快最智能的 Haiku 模型,性能接近前沿

    Anthropic 推出 Claude Haiku 4.5,定位为最快且最智能的 Haiku 系列模型,性能接近前沿水平。该模型专为实时应用、高吞吐量处理以及对推理能力要求较高的成本敏感型部署场景设计。

    推荐理由:这是Haiku系列首次拥有接近前沿的性能,高速低成本让它在实时应用和高吞吐场景里很有竞争力,做成本敏感AI产品的值得认真考虑。

10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy,让 notebook 中 LLM 调用快 60 倍

    Answer.AI 发布开源 Python 包 cachy(pip install pycachy),通过补丁 httpx 的 send 方法,把 Anthropic 和 OpenAI SDK 的 LLM 调用响应自动缓存到本地并在相同请求时复用,无需编写 mock。

    推荐理由:原文给出了补丁原理和提速数据,读者可以直接复用这个零代码缓存方案加速自己的 LLM 测试和 notebook 工作流。

  2. OpenRouter:Announcements(RSS)58

    OpenRouter 推出每月100万免费BYOK请求

    OpenRouter 向每位客户每月提供100万次“Bring Your Own Key”(BYOK)请求,完全免费。

    推荐理由:这个公告虽然旧了,但 OpenRouter 的 BYOK 免费额度至今仍在,对想低成本折腾模型的个人开发者来说,每月 100 万次请求比很多付费计划都香。

  3. OpenRouter:Announcements(RSS)60

    每月 100 万次免费 BYOK 请求

    所有客户每月可免费获得 100 万次“自带密钥”(BYOK)请求。这一政策将 BYOK 功能从付费服务转变为免费提供的基础配额,大幅降低了企业使用自有密钥管理数据安全的技术与成本门槛。免费额度覆盖了绝大多数中小规模企业的典型月请求量。

    推荐理由:OpenRouter 给 BYOK 用户每月免 100 万次请求,对用自己 API key 跑 Agent 的开发者来说是实打实的成本减免,值得顺手薅。

9月29日周一
  1. 蚂蚁 inclusionAI:GitHub 新仓库58

    inclusionAI/dInfer

    inclusionAI团队发布了dInfer,一个专为扩散语言模型设计的高效推理框架。该框架旨在解决扩散模型在文本生成领域推理速度慢、资源消耗大的核心挑战。dInfer通过一系列底层优化技术,显著提升了推理效率,能够更快地生成文本,同时降低计算成本,为扩散模型在更广泛的实际应用场景中部署提供了关键技术支持。

    推荐理由:蚂蚁把扩散语言模型的推理框架开源了,这类模型的推理效率一直是落地瓶颈,做端侧或低成本部署的团队值得看看能不能接上。

9月23日周二
  1. Sam Altman

    OpenAI 与 NVIDIA 宣布合作建设 gigascale AI 工厂,将部署数百万 NVIDIA GPU,提供 10 gigawatts 算力支持 OpenAI 数据中心扩张。双方合作关系已持续近十年。

    引用NVIDIA@nvidia

    我们很自豪地宣布与 @OpenAI 达成一项里程碑式的合作,将使用数百万块 NVIDIA GPU 建设新的千兆级 AI 工厂。🤝 这项合作将供应 10 吉瓦的 GPU,以助力 @OpenAI 的数据中心增长。https://t.co/CYEB2PdfWY

    推荐理由:OpenAI 与 NVIDIA 达成里程碑合作,部署百万级 GPU 建设 10 吉瓦 AI 工厂

  2. Sam Altman:Blog(RSS)

    充裕的智能

    计划打造每周可新增1吉瓦算力的AI基础设施工厂,通过芯片、电力到机器人的全栈创新,支撑治愈癌症、全球个性化教育等宏大应用。项目将主要落地美国,未来数月公布合作伙伴,年底披露融资方案。

    推荐理由:Sam Altman阐述OpenAI基础设施扩张愿景,计划每周新建1吉瓦算力

9月17日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)73

    近期三次基础设施故障的事后分析

    八月初至九月中旬,Anthropic的三次基础设施漏洞间歇性导致Claude响应质量下降。8月5日,上下文窗口路由错误致使部分Sonnet 4请求被误导向百万token服务器,8月31日高峰时影响16%请求。8月25日,TPU服务器错误配置引发输出损坏,可能在英文回复中生成泰文或中文字符,影响Opus和Sonnet模型。同日部署的代码还触发了编译器漏洞,主要影响Haiku 3.5。所有问题均非需求或负载所致,纯属基础设施漏洞。公司通过回滚部署和修复逻辑于9月18日前全部解决。

    推荐理由:Anthropic 主动公开三个基础设施 bug 的完整复盘,这种坦诚在大厂里极少见。做 AI 产品的人都该读一下,它把「模型质量下降」从玄学拉回了工程现实,尤其是 XLA 编译器那层的坑,踩过才知道多深。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)60

    破解LLM推理中的非确定性

    LLM推理的再现性是科学进步的基础,但即使在温度设为0的贪心采样下,ChatGPT等API以及vLLM、SGLang等自托管推理引擎仍无法保证确定性结果。常见的“并发+浮点非结合性”假设并不完整——GPU上重复执行相同矩阵乘法结果完全一致。真正原因在于:部分GPU内核是非确定性的,但LLM前向传播使用的内核均为确定性;推理服务器前向传播本身是确定性的,用户感知的非确定性源于浮点运算非结合性在不同聚合顺序下导致的细微数值差异。文章揭示了这一误解,并探讨如何实现真正可重现的LLM推理输出。

    推荐理由:Horace He 把 LLM 推理非确定性的锅从并发浮点转向 batch-size,并给出了可落地的 batch-invariant 内核实现,做推理部署和 RL 的工程师都该看看。

9月9日周二
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedChat 全自托管全双工语音交互方案

    FireRedTeam 发布 FireRedChat,一个完全自托管的实时语音 AI 智能体全双工交互解决方案。系统集成了 TTS、ASR、pVAD(个性化语音活动检测)和 EoT(结束轮次检测),不依赖外部 API、无数据泄露、部署完全可控。

    推荐理由:官方发布了可完全自托管的实时语音智能体方案,组件构成和部署路径都写清楚了,适合评估私有化语音交互搭建。

9月3日周三
  1. Linear:Now(RSS)61

    Linear 发布 Triage Intelligence:用搜索与 LLM 推理自动整理工单

    Linear 上月推出 Triage Intelligence,利用搜索、排序和 LLM 推理自动为新增工单标记重复项、关联问题并推荐标签与负责人。早期版本使用 GPT-4o mini 和 Gemini 2.0 Flash 等小模型,后转向 GPT-5 和 Gemini 2.5 Pro 等更大模型实现智能体式决策。

    推荐理由:Linear 的 Triage Intelligence 用 agentic 方案把 issue 自动分类和去重做得很实用,透明可解释的交互设计让 AI 建议不再像个黑箱,做工具类产品的值得看一看。

9月2日周二
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Platform 发布 Code Execution Tool v2 公测版,支持 Bash 命令与文件操作

    Claude Platform 推出 Code Execution Tool v2 公测版,取代原先仅支持 Python 的工具,新增 Bash 命令执行和直接文件操作能力,包括用其他语言编写代码。

    推荐理由:Anthropic把代码执行工具从Python解放到了Bash和任意语言,这不再是玩具,而是能在沙箱里跑真实脚本的实用功能,做自动化的开发者可以直接拿来用了。

8月27日周三
  1. Claude Platform:开发者版本说明(RSS)61

    Claude Platform 发布 PHP SDK 测试版

    Claude Platform 于 8 月 27 日推出 PHP SDK 测试版。该 SDK 允许开发者通过 PHP 语言调用 Claude API,构建基于 Claude 的应用程序。

    推荐理由:Anthropic 给 PHP 开发者递了橄榄枝,beta 版 SDK 让 PHP 项目接入 Claude 更容易了,虽然量级不大但补上了生态缺口。

8月5日周二
  1. Hao AI Lab67

    FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为“稀疏蒸馏”的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。

    引用Hao AI Lab@haoailab

    (1/n) 🚀 借助 FastVideo,你现在可以在单块 H200 GPU 上于 5 秒内生成一段 5 秒的视频! 隆重推出 FastWan 系列,这是一个快速视频生成模型家族,通过我们称为“稀疏蒸馏”的全新配方训练而成,可将视频去噪时间加速 70 倍! 🖥️ 在线演示:https://fastwan.fastvideo.org/(感谢 @gmicloud 的支持!) 🔗 博客:https://hao-ai-lab.github.io/blogs/fastvideo_post_training/ 🔓 我们以 Apache-2.0 许可证完全开源我们的模型、代码和数据

    推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。

7月23日周三
  1. Modal 官方工程博客(RSS)69

    Modal 实测:用开源 ASR 模型将批量语音转写提速 100 倍、成本降 100 倍

    Modal 工程团队在平台上部署 NVIDIA parakeet-tdt-0.6b-v2 与 canary-1b-flash 开源 ASR 模型,对约一周(7×24 小时)ESB 基准音频做批量转写,结果比所测专有 API 快 112 倍或便宜 200 倍,且错误率略低,实现了一分钟内以 1 美元转写一周音频。

    推荐理由:原文给出可复现的批量转录优化方法与端到端实测数据,读者可以据此在自己的语音转写服务中权衡成本与吞吐。