跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 481–500 条 · 共 652 条
5月8日周五
  1. Replit ⠕67

    我们安全承诺的下一步:安全中心2.0。 我们极大地简化了理解您管理的每个Replit应用安全状况的流程,并支持批量对所有应用执行操作。 通过安全中心2.0,您可以: - 即时识别高风险应用 - 数秒内通过Agent修复关键漏洞 - 通过批量操作通知所有者或下架应用 - 导出软件物料清单(SBOM)以集成外部工具

    推荐理由:如果你用Replit管理一堆应用,这个安全中心2.0的批量修复和SBOM导出是实打实的效率提升,但对个人开发者来说属于‘有比没有好’的更新。

5月7日周四
  1. OpenRouter72

    1/ 音频现已成为OpenRouter的一等公民。 今日上线两个新端点: 📢 /api/v1/audio/speech — 文本转语音(TTS) 🎤 /api/v1/audio/transcriptions — 语音转文本(SST) 沿用您已在文本、图像和视频中使用的相同路由、计费和密钥。

    推荐理由:OpenRouter 突然把 TTS 和 STT 拉进了统一路由,用同一把 Key 和账单,做多模态 App 的人可以少调一个 API。更新不大,但省事。

  2. Apple Machine Learning Research(RSS)64

    SpecMD: 关于推测性专家预取的综合研究

    研究团队开发了SpecMD,这是一个用于在各种硬件配置上对临时缓存策略进行基准测试的标准化框架。该研究聚焦于混合专家模型,这类模型虽然实现了稀疏专家激活,但需要专家缓存机制才能将稀疏性转化为实际性能提升。此前的研究提出了以硬件为中心的缓存策略,但不同缓存策略之间以及它们与不同硬件规格之间的相互作用尚不明确。SpecMD框架旨在填补这一理解空白,系统性地评估缓存策略的交互影响与硬件适配性。

    推荐理由:MoE推理的缓存策略一直靠经验摸,Apple给的标准化框架能系统比较不同策略,做分布式推理的可以省些心力。

  3. Hacker News 热门(buzzing.cc 中文翻译)76

    Show HN: Tilde.run – 具备事务性和版本控制文件系统的代理沙箱

    Tilde.run 发布了一款代理沙箱,其核心特点是具备事务性和版本控制功能的文件系统。该系统支持事务操作,确保文件更改的原子性,同时提供完整的版本历史记录。该工具旨在为开发者提供一个安全、可回溯的代码执行环境,适用于需要高可靠性的自动化代理或脚本测试场景。目前该项目已在 Hacker News 上获得 102 点关注度。

    推荐理由:Agent 沙箱里的文件操作终于有了事务和版本回滚,对自动化链路调试是个实在的改进,搞 LLM 工具调用的可以试试。

  4. Hugging Face:Blog(RSS)65

    vLLM V0 到 V1:在线强化学习中优先确保后端行为正确性

    为确保 vLLM 从 0.8.5 到 0.18.1 的重大重写后,在线强化学习训练结果与 V0 参考运行一致,团队优先修复后端行为而非调整 RL 目标。关键修复包括:将日志概率模式设为 `processed_logprobs` 以匹配采样器分布;禁用 V1 特有的前缀缓存和异步调度等运行时默认值;调整权重更新路径以匹配 V0 的缓存保留行为;并确保 rollout 后端使用 fp32 精度的 `lm_head` 进行最终投影。这些措施消除了策略比率均值偏差,使 V1 在 KL 散度、熵等指标上与 V0 达成一致。

    推荐理由:vLLM V1迁移时踩的四个坑全在这里,从logprob语义到fp32投影头,修完才调RL目标,做在线RL的团队可以直接抄这份配置清单。

  5. Claude:Blog(网页)69

    Claude托管智能体新增功能:梦想、成果与多智能体编排

    Anthropic为其Claude托管智能体平台推出三项核心更新。“梦想”功能通过回顾会话历史提取模式,使智能体能够自我改进。“成果”功能允许开发者设定成功标准,智能体据此进行自我评估与修正,内部测试显示其显著提升了任务成功率和输出质量。“多智能体编排”功能支持主智能体将复杂任务分解,并分配给配备专用工具的子智能体并行处理。这些更新旨在以最小人工干预,增强智能体处理复杂任务的能力。

    推荐理由:Anthropic给托管Agent加了dreaming、outcomes和multiagent,这是Agent从完成任务到自我改进和协作的质变。dreaming让Agent能跨session复盘,做Agent产品的团队现在多了一个必须研究的模块。

  6. Anthropic:Newsroom(网页)81

    Claude使用限制提升及与SpaceX达成算力合作

    Anthropic与SpaceX达成合作,获得其Colossus 1数据中心超300兆瓦(含逾22万块NVIDIA GPU)的算力。此举使Claude Code的Pro、Max等多档计划的五小时速率限制立即翻倍,并取消了高峰时段限流;Claude Opus的API速率也大幅提升。公司还公布了与亚马逊、谷歌、微软等科技巨头的一系列大规模算力协议,总投资额巨大。为满足企业客户的合规需求,算力扩张计划也将覆盖亚洲和欧洲地区。

    推荐理由:跟 SpaceX 搞轨道算力是长期故事,但今天起 Claude Code 速率翻倍、API 限制松绑,对重度用户是立刻能摸到的甜头,即日生效不用等。

5月6日周三
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)69

    通过 MRC(多路径可靠连接)解锁大规模 AI 训练网络

    OpenAI 发布了名为 MRC 的新型超级计算机网络协议,旨在提升大规模 AI 训练集群的韧性与性能。该协议通过开放计算项目公开,支持在数千个 GPU 间建立高效、可靠的多路径连接,能自动绕过故障链路,将网络有效带宽提升最高达 30%,同时显著降低训练作业因网络问题中断的概率。MRC 的设计目标是应对万卡级集群的复杂网络挑战,为下一代大模型训练提供基础设施支持。

    推荐理由:虽然只是个网络协议,但MRC在超大规模训练集群里解决的是真实痛点,OpenAI自己内部用了才放出来,做万卡级训练的团队确实该看看。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    代理商现在可以创建 Cloudflare 账户、购买域名并进行部署

    Cloudflare宣布其代理商合作伙伴现可直接创建Cloudflare账户、购买域名并部署服务。这一功能整合了账户创建、域名注册和项目部署流程,简化了代理商的管理与操作步骤。此举旨在提升合作伙伴的自主性和效率,进一步扩展Cloudflare的生态系统与服务覆盖范围。

    推荐理由:Cloudflare 把账户注册、买域名、部署全开放给 Agent,等于给 AI 发了张建站许可证,做自主 Agent 和自动化运维的人可以直接拿来用。

  3. Apple Machine Learning Research(RSS)59

    Stochastic KV Routing: 实现自适应深度方向的缓存共享

    为降低大语言模型推理时KV缓存的高昂内存开销,研究提出了一种沿模型深度维度优化的新方法。该方法通过随机KV路由,在Transformer模型的各层之间动态共享KV缓存,而非每层保留完整独立缓存。实验表明,在保持模型质量基本不变的前提下,该方法能将KV缓存的内存占用减少高达50%,为降低大模型服务成本提供了与现有时间轴压缩、淘汰技术正交的新优化路径。

    推荐理由:苹果这篇不走寻常路,从深度维度压缩KV缓存,是推理服务端降本的新思路,做LLM部署的值得一读。

  4. Claude:Blog(网页)71

    金融服务行业Claude部署指南发布

    Anthropic发布金融服务行业Claude部署指南,详细介绍了Claude系列产品在金融研究、交易、承销、理赔及月末结算等场景的应用方案。指南包含产品矩阵、10个预置金融智能体模板(如招股书生成器、KYC筛查器等),并分享了AIG、澳大利亚联邦银行等机构的实践案例。同时,提供基础、试点、扩展三阶段实施路线图,旨在协助企业决策者与工程师规划AI落地路径,提升运营效率。

    推荐理由:Claude 官方首次系统性给出金融行业的部署指南,从产品矩阵到预建代理模板再到三阶段路线图,做金融 AI 落地的可以直接拿过来对齐。

  5. Tomer Tunguz 博客(VC 分析)63

    当公司里每个人都是关键人物时

    本文探讨了初创公司工程团队中AI与人力比例变化带来的结构性风险。当AI占比从10%提升至90%时,团队从20名工程师的传统层级结构,演变为仅由3名工程师核心操控大量自主代理的无管理层模式。核心权衡在于系统韧性而非吞吐量:将编排知识高度集中于极少数人,等同于以100%的利用率运行,一旦关键人员离职将造成33%的“制度记忆”损失。文章借鉴制造业保持70-90%利用率以维持系统稳健的经验,建议大多数初创公司应避免过早采用极高AI占比的模式,因为其中缺乏冗余和缓冲空间。

    推荐理由:当三个人管理着一支AI代理大军,任何一个人离开就是30%的知识蒸发。这篇文章用制造业利用率逻辑警告那些想用AI替换所有工程师的创始人:弹性才是真正的瓶颈。

5月5日周二
  1. Anthropic:Newsroom(网页)77

    金融与保险智能体解决方案

    Anthropic发布了十个针对金融服务耗时任务的预置智能体模板,涵盖制作推介书、撰写信贷备忘录、KYC文件筛查及月末关账等。这些模板可作为Claude Cowork和Claude Code的插件,或作为Claude托管智能体的配置指南,帮助团队在数天内部署应用。Claude现通过Microsoft 365插件支持在Excel、PowerPoint等Office应用间无缝工作,并扩展了合作伙伴生态,新增数据连接器和MCP应用,使智能体能直接调用实时金融数据。这些更新与Claude Opus 4.7模型搭配效果最佳,该模型在金融任务上达到先进水平。

    推荐理由:Anthropic 一口气放出十个金融模板,从 pitchbook 到月底关账全包,加上 Excel、PPT、Word 的深度集成,做金融的可以少写很多重复性胶水代码,直接套模板干活去了。

  2. Runway:News(网页)55

    60倍速冷启动:将同级GPU视为权重服务器

    Runway平台团队开发的NCCLBack系统,通过P2P权重传输将模型冷启动时间从数分钟缩短至数秒。其核心创新在于让新启动的GPU推理节点直接从集群内已加载权重的同级GPU获取模型参数,而非从云存储重复下载。该系统利用GPU互连(如InfiniBand、NVLink)高达200-400 Gbps的带宽,相比传统存储下载的2-10 Gbps实现了数量级提升。通过Redis协调与NCCL广播原语,NCCLBack确保了数据传输的效率和正确性,使得大规模集群部署新模型时,冷启动时间不随节点数量线性增长,基本保持恒定。

    推荐理由:Runway 工程师把 GPU 冷启动从分钟压到秒级,原理是让已加载权重的 GPU 直接「喂」给新同伴,而不是各自从存储下载。做大规模推理部署的团队值得细读。

  3. Google Blog:AI(RSS)71

    通过 Gemini API 中的 Webhooks 减少长时任务的摩擦与延迟

    Gemini API 引入了事件驱动的 Webhook 功能,这是一种基于推送的通知系统。它旨在消除低效的轮询需求,为长时运行的任务(如文件处理或复杂推理)提供更优的解决方案。当任务完成时,系统会自动将结果推送到用户指定的端点,从而显著降低延迟并减少资源消耗,提升开发效率与响应速度。

    推荐理由:Gemini API 终于补上 Webhooks 这块拼图,长任务不用再轮询等待,对做自动化流程和 Agent 的开发者是实打实的效率提升。

  4. SemiAnalysis71

    在行业标准推理引擎vLLM上的测试显示,NVIDIA GB300 NVL72的实测端到端性能已达GB200 NVL72的2.7倍。尽管其纸面参数仅显示NVFP4算力提升约1.5倍、HBM容量增加1.5倍且带宽相同,但在大多数服务商实际运行的中段负载区间,凭借全栈优化的复合增益,GB300实现了远超理论算力提升的性能飞跃。此次测试基于NVIDIA、Inferact和CoreWeave为开源项目提供的临时GB300系统完成,结果印证了端到端实测性能才是衡量硬件效能的黄金标准,而非单纯的纸面理论算力。

    推荐理由:纸面 FP4 算力只多 50% 的 GB300,实际推理却快了 2.7 倍,全栈优化的复合增益比参数表好看太多,做推理服务的该重新算算 TCO 了。

5月4日周一
  1. Rohan Paul71

    OpenAI成立了名为“部署公司”的百亿美元合资公司,筹集超40亿美元,旨在帮助企业克服AI部署障碍。核心观点是,当前企业采用AI的主要瓶颈已非模型质量,而是缺乏整合团队、工作流程、数据访问和安全规则的能力。该公司通过联合TPG、Brookfield等私募股权投资者,打包软件、咨询和部署方案,直接触达超2000家投资组合公司,实现规模化分发。同时,Anthropic也正与Blackstone、Goldman Sachs等华尔街机构组建类似合资公司,为私募股权支持的企业部署Claude并重建工作流程。这标志着AI实验室的竞争焦点正从模型性能演示转向工业化部署速度与路径控制的争夺。

    引用Rohan Paul@rohanpaul_ai

    WSJ:据知情人士透露,Anthropic 即将敲定一项交易,与 Blackstone、Goldman Sachs 及其他华尔街公司成立一家合资企业,目标是将 AI 工具出售给私募股权支持的公司。 Anthropic、Blackstone 和 Hellman & Friedman 预计各出资约 3 亿美元,而 Goldman Sachs 预计投资约 1.5 亿美元。 这家新公司将像一支 AI 部署部队那样运作,意味着它不只是销售 Claude 的访问权限,而是帮助公司围绕 LLM 重建工作流程,从客户支持和财务到编码、法律审查和内部研究。 私募股权公司是目标,因为它们拥有许多公司,严格衡量每一项成本,并且能够比行动迟缓的上市公司更快地推动软件变革。 Anthropic 获得分销渠道,华尔街获得 AI 服务层的股份,而投资组合公司则成为企业 AI 的大型试验场。 更深层的动作在于,AI 实验室不再仅仅在模型质量上竞争,而是在谁控制从模型到业务流程的路径上竞争。 --- wsj .com/business/deals/anthropic-nears-1-5-billion-joint-venture-with-wall-street-firms-8f5448ee

    推荐理由:OpenAI和Anthropic几乎同时拉上黑石、高盛成立合资公司,把模型部署包装成服务卖给数千家企业。模型竞争正在降级,谁能最快把AI塞进真实业务流程才是下一阶段的王。

  2. PromptArmor:Threat Intelligence68

    PromptArmor 发布 OpenAI Codex 全平台安全配置指南

    PromptArmor 发布 Codex 安全配置指南,核心风险是间接提示注入,其曾在 2026 年 4 月披露默认权限模式下无需用户交互即可窃取 Codex 完整敏感邮件的漏洞。

    推荐理由:原文系统拆解了 Codex Local 与 Cloud 的提示注入威胁面,并按用例给出 requirements.toml 和网络出口的具体配置,可迁移到企业部署。

  3. Claude Platform:开发者版本说明(RSS)67

    Claude Platform 正式推出 Workload Identity Federation

    Claude Platform 的 Workload Identity Federation 现已正式可用。该功能允许用户使用来自 AWS IAM、Google Cloud、GitHub Actions 等身份提供商的短期 OIDC 令牌认证 Claude API,替代长期静态 API 密钥。

    推荐理由:用 OIDC 短期令牌代替 API 密钥,对企业级部署是刚需级安全改进,做生产环境集成的可以告别密钥轮换脚本了。