跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 561–580 条 · 共 652 条
4月3日周五
  1. Meta Engineering Blog(RSS)82

    KernelEvolve:Meta的Ranking Engineer Agent如何优化AI基础设施

    Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。

    推荐理由:Meta 内部工具展示 AI 自动化优化基础设施,工程师可借鉴实践。

4月1日周三
  1. Google Developers Blog(RSS)71

    开发者指南:使用技能构建ADK智能体

    Agent Development Kit (ADK) SkillToolset 推出了“渐进式披露”架构,使AI智能体能够按需加载领域专业知识,与传统单体提示相比,可减少高达90%的令牌使用量。该系统通过四种模式——从简单的内联清单到智能体可自行编写代码的“技能工厂”——使智能体能在运行时利用通用的 agentskills.io 规范动态扩展其能力。这种模块化方法确保了复杂的指令和外部资源仅在相关时被访问,从而为现代AI开发构建了一个可扩展且能自我扩展的框架。

    推荐理由:开发者可借鉴此架构,构建更智能、更经济的AI代理。

  2. Hugging Face:Blog(RSS)83

    使用Gradio后端支持任意自定义前端

    Gradio推出的`gradio.Server`组件,允许开发者完全使用React、Svelte或原生HTML/JS等自定义前端框架构建应用,同时无缝继承Grio的后端基础设施优势。该组件基于FastAPI扩展,集成了Gradio的队列系统、并发控制、SSE流式传输及`gradio_client`兼容性。以“Text Behind Image”应用为例,其后端仅需约50行Python代码,通过`@app.api()`装饰器封装函数,即可自动管理请求队列与GPU并发,并能在Hugging Face Spaces上获得ZeroGPU支持,极大简化了复杂全栈Web应用在Spaces上的部署流程。

    推荐理由:开发者可自由选择前端框架,同时利用Gradio的队列和GPU管理,简化AI应用部署。

  3. Meta Engineering Blog(RSS)81

    Meta Adaptive Ranking Model:弯曲推理扩展曲线,为广告提供LLM规模模型服务

    Meta将其广告推荐系统的运行时模型扩展至LLM的规模和复杂度,旨在更深入理解用户兴趣与意图,以提升广告效果。这一举措通过自适应排序模型,优化了推理阶段的扩展曲线,使部署大规模模型服务成为可能,标志着推荐系统性能向新前沿迈进。

    推荐理由:Meta的工程实践展示了如何优化LLM规模模型的推理效率,对AI系统设计有参考价值。

3月31日周二
  1. Trail of Bits:AI安全研究72

    Trail of Bits 如何让公司走向 AI 原生:从 5% 接受到 94 个插件、201 个技能

    Trail of Bits 分享其一年内将 AI 采用率从约 5% 推到全公司落地的系统方法,目前已有 94 个插件、201 个技能、84 个专用智能体,部分审计项目每周发现的漏洞从约 15 个增至 200 个,约 20% 的客户报告漏洞最初由 AI 发现。

    推荐理由:Trail of Bits 以亲历者身份复盘内部 AI 化的完整系统,给出心理障碍分析和可复制的组织方法,适合参考落地路径。

  2. Google Developers Blog(RSS)81

    Boost Training Goodput: 连续检查点功能如何优化 Orbax 和 MaxText 的训练可靠性

    Orbax 和 MaxText 引入了连续检查点新功能,旨在优化模型训练中可靠性与性能的平衡。它改变了传统固定频率检查点的模式,通过在前一个保存操作成功完成后才异步启动新操作,最大化I/O带宽并降低故障风险。基准测试表明,该方法显著缩短了检查点间隔,并实现了可观的资源节约,这在平均故障间隔时间较短的大规模训练任务中效果尤为突出。

    推荐理由:大规模模型训练的可靠性和效率提升,开发者可优化资源使用。

  3. Meta Engineering Blog(RSS)71

    AI助力美国产水泥与混凝土

    Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。

    推荐理由:Meta 将 AI 应用于传统建筑行业,展示垂直领域落地案例,启发其他行业探索 AI 应用。

3月30日周一
  1. Claude Platform:开发者版本说明(RSS)68

    Claude Opus 4.6 与 Sonnet 4.6 的 Message Batches API 将 max_tokens 上限提升至 300k

    Claude 将 Message Batches API 中 Opus 4.6 和 Sonnet 4.6 的 max_tokens 上限提升至 300k,需添加 `output-300k-2026-03-24` beta header 以生成长篇内容、结构化数据和大规模代码。

    推荐理由:Claude把max_tokens提到30万,对需要生成长篇内容的开发者是个实打实的解放,之前被输出长度卡住的产品可以放开了。虽然旧版1M上下文窗口被淘汰,但迁移到新模型路径清晰,不算坏事。

3月27日周五
  1. Cursor Blog72

    Composer 2技术报告:面向智能体软件工程的代码模型训练

    本报告介绍了代码模型Composer 2的训练过程。该模型基于开源基础模型Kimi K2.5,通过两阶段训练:首先进行侧重代码的持续预训练以深化编码知识,随后在高度模拟真实Cursor环境的大规模强化学习中提升端到端智能体性能。在自建的真实任务评估集CursorBench上,Composer 2得分为61.3,较前代提升37%,与前沿模型性能相当。在公开基准SWE-bench Multilingual和Terminal-Bench上分别获得73.7和61.7分,并在保持高精度的同时实现了显著更低的推理成本。训练依托为Blackwell GPU定制的高效MoE训练内核、跨区域异步强化学习管道等大规模基础设施完成。

    推荐理由:Cursor 把 Composer 2 的训练全流程摊开讲了,从 Kimi K2.5 继续预训练到大规模 RL,关键是 RL 在真实 Cursor 会话里跑,不是玩具环境。做 coding agent 的团队,这份报告值得逐段拆。

  2. Andrej Karpathy

    构建现代应用的最大挑战并非代码本身,而是 DevOps 中繁琐的服务集成、API 密钥管理和部署配置。作者期待未来 AI 智能体能自动完成从文档阅读到生产环境部署的全流程,无需人工点击网页或手动配置。Stripe 推出的 Projects 正是朝此方向迈进:开发者可通过 CLI 命令自动配置 PostHog 等第三方服务,实现账户创建、密钥获取和计费设置的自动化,真正将基础设施生命周期转化为代码。

    引用Patrick Collison@patrickc

    当 @karpathy 构建 MenuGen(https://karpathy.bearblog.dev/vibe-coding-menugen/)时,他说: "Vibe coding menugen 作为本地演示是一段令人兴奋又有趣的冒险,但作为已部署的真实应用,就有点像是痛苦的苦差事了。构建一个现代应用有点像组装宜家的未来。有各种各样的服务、文档、API 密钥、配置、开发/生产部署、团队和安全功能、速率限制、定价层级。" 我们在用智能体构建时都遇到过这个问题:你必须匆匆忙忙地去创建账户,在浏览器里点来点去,仿佛回到了 2023 年那种上古时代,才能解除阻碍它那超级智能的进展。 所以我们决定构建 Stripe Projects,帮助智能体从 CLI 即时配置服务。 例如,只需运行: $ stripe projects add posthog/analytics 它就会创建一个 PostHog 账户、获取一个 API 密钥,并(在需要时)设置计费。 Projects 今天作为开发者预览版发布。你可以在 http://projects.dev 注册获取访问权限(我们很快就会向所有人开放)。我们还将在未来几周内推出对许多新提供商的支持。(如果你想让你的服务可用,请联系我们。) https://projects.dev

    推荐理由:Karpathy指出Vibe Coding最大痛点是DevOps集成,Stripe Projects让Agent直接CLI配置服务免人工点击

3月24日周二
  1. PromptArmor:Threat Intelligence70

    PromptArmor 披露 Snowflake Cortex Code CLI 沙箱逃逸与恶意代码执行漏洞

    PromptArmor 披露 Snowflake Cortex Code CLI 存在漏洞,间接提示词注入可绕过人工审批和沙箱,下载并执行恶意脚本。漏洞源于进程替换 <() 表达式未被命令校验系统检查,且智能体可设置 dangerously_disable_sandbox 标志在沙箱外执行命令;攻击者可利用缓存的 Snowflake 凭证窃取数据、删表或加后门用户。

    推荐理由:原文完整披露了攻击链、绕过机制和修复时间线,读者可以借此理解 Agent CLI 在沙箱和审批环节的失效路径。

3月18日周三
  1. Hao AI Lab65

    FastVideo团队发布Dreamverse原型界面,引入创新的“氛围导演”工作流。该模式允许用户通过自然语言实时、迭代地引导视频生成,如更换背景或调整运镜,无需编写复杂的长提示词。其核心是全新的实时推理栈,能在单GPU上以约4.55秒生成5秒1080p视频,速度快于观看时间,从而将生成过程从被动等待转变为实时导演体验。团队认为,视频生成的未来在于让创作速度跟上想象速度,快速的反馈循环比单纯追求模型性能更能催生优质作品。

    推荐理由:视频生成从「等一分钟看结果」变成「边看边改」,这个交互范式转变比模型本身更值得关注。做内容创作工具的产品人,这个 demo 值得花五分钟体验一下实时迭代的手感。

3月17日周二
3月16日周一
  1. Mistral AI:News(网页)72

    Mistral 发布 Mistral Small 4:统一推理、多模态与编码能力并开源

    Mistral 发布 Mistral Small 4,首次将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力统一到单一模型,采用 Apache 2.0 许可开源。

    推荐理由:原文给出完整的架构参数、推理档位设置和与 GPT-OSS 120B 的输出长度对比,读者可以据此评估部署成本和适用场景。

3月14日周六
  1. Dwarkesh Patel:Podcast & Blog(RSS)

    Dylan Patel — 深度剖析 AI 算力扩展的三大瓶颈

    Dylan Patel 深度解析了制约 AI 算力规模扩张的三大核心瓶颈:电力基础设施限制、先进制程芯片产能不足以及网络互联带宽瓶颈。尽管 NVIDIA H100 已发布三年,受供需严重失衡及新一代芯片交付延迟影响,其市场价格与战略价值持续攀升,当前实际价值甚至超过发布初期。文章指出,这些结构性约束正重塑 AI 基础设施的投资逻辑与部署节奏。

    推荐理由:顶尖硬件分析师拆解AI算力扩张的三大瓶颈,揭示H100为何比三年前更值钱

3月13日周五
  1. Claude Platform:开发者版本说明(RSS)69

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口正式可用

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口现已正式可用,按标准定价计费,超过 200k token 的请求无需 beta header 即可自动生效。同时,所有支持模型的专用 1M 速率限制已移除,改用标准账户限制;使用 1M 上下文窗口时,每请求的媒体上限从 100 提升至 600 张图片或 PDF 页面。

    推荐理由:Claude 的百万 token 上下文终于从 beta 转正,200k token 以上请求不再需要 beta 头,媒体文件限制一口气提到 600 页,做长文档处理的开发者可以直接切生产。

3月10日周二
  1. Hugging Face:Blog(RSS)83

    保持令牌流动:16个开源强化学习库的教训

    同步强化学习训练中,数据生成是主要瓶颈,如在320亿参数模型上生成3.2万令牌样本需数小时,导致训练GPU闲置。业界主流解决方案是将推理与训练解耦到不同GPU池,通过rollout缓冲区连接并异步传输权重。本文调研了16个实现此模式的开源库,从编排原语、缓冲区设计、权重同步协议、陈旧数据处理、部分rollout支持、LoRA支持及分布式训练后端七个维度比较。关键发现:Ray在编排层占主导(8/16库使用),NCCL广播是默认权重传输方式,LoRA训练支持普遍不足,而分布式MoE支持正成为新差异化特性。

    推荐理由:异步RL训练架构对比,助开发者优化训练效率与库选型。

  2. Hugging Face:Blog(RSS)83

    Hugging Face Hub 正式推出 Storage Buckets 存储服务

    Hugging Face Hub 发布 Storage Buckets,这是一种为机器学习工作流设计的可变、类 S3 的对象存储服务。它基于 Xet 存储后端,能对跨文件共享内容的 ML 工件进行高效去重,从而节省带宽、加速传输并降低存储成本。该服务还提供“预暖”功能,可将数据预先迁移至靠近计算资源的云区域,以提升分布式训练等场景的效率。目前支持 AWS 和 GCP,用户可通过 CLI 或 Python 库在 2 分钟内快速创建和同步存储桶。

    推荐理由:ML 开发者可高效管理训练数据和检查点,节省存储成本并加速工作流。