跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 41–60 条 · 共 652 条
9月10日周四
  1. Hugging Face:Blog(RSS)65

    Hugging Face 用 Gradio Workflow 重建 Workflow1111,复刻 AUTOMATIC1111 主要功能

    Hugging Face 发布 Workflow1111,用 gr.Workflow 以 73 个节点、11 条媒体管线重建 AUTOMATIC1111 的大部分功能,覆盖文本生成图像、高清修复、图生图、prompt matrix、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 式预处理器、背景移除、PNG Info 和图生视频。

    推荐理由:原文展示用 Gradio Workflow 重建 AUTOMATIC1111 主要功能的具体做法,并给出 REST 与 MCP 入口,读者可评估它与 ComfyUI 的取舍。

  2. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  3. Hugging Face:Blog(RSS)61

    Hugging Face 用 LoRA 与 Storage Bucket 在 HF Jobs 上跑异步 GRPO,免 NCCL 并提速 3.9 倍

    Hugging Face 在 TRL v1.14 的 AsyncGRPOTrainer 中支持只训练和同步 LoRA adapter,配合 Storage Bucket 挂载与代理路由,让训练 Job 和 vLLM 推理 Job 在不同机器上运行而无需 NCCL。

    推荐理由:Hugging Face 官方用五个实验展示了如何在 Jobs 上分离训练与推理跑异步 GRPO,并通过逐项定位瓶颈把运行提速 3.9 倍,方法可迁移。

9月9日周三
  1. OpenRouter:Announcements(RSS)73

    OpenRouter 推出 shell 沙箱工具与 Files API,任何模型可在托管 Linux 容器中执行命令

    OpenRouter 发布 openrouter:shell 服务端工具和 Files API,OpenRouter 上任何支持工具调用的模型都可在托管 Linux 容器中运行命令,两者现已在 beta 阶段开放。

    推荐理由:原文给出定价、容器网络策略和文件生命周期等落地细节,读者可以据此评估在自己的 Agent 工作流中怎么用这套沙箱。

  2. OpenRouter:Announcements(RSS)62

    OpenRouter 推出美国区域路由,与去年上线的 EU 路由配套保障数据驻留

    OpenRouter 推出 US In-Region Routing,请求经 us.openrouter.ai 在美国境内解密并只路由到美国 provider 端点,eu.openrouter.ai 同理服务欧盟。

    推荐理由:原文区分了端到端与仅推理的区域路由,并给出具体接入方式,读者可以据此评估各家网关的数据驻留承诺。

  3. Claude:Blog(网页)67

    Anthropic 发布 Claude Platform 降本指南并更新 claude-api 技能

    Anthropic 介绍用 Claude Platform 降低成本、保持性能的三种方法:提高提示词缓存命中率、升级到前沿模型时清除提示词反模式、按任务校准 effort。

    推荐理由:官方给出了提示词缓存、反模式清理和 effort 校准三类降本方法及实测数字,可直接迁移到自己的 Claude API 应用。

9月8日周二
  1. Epoch AI:研究、数据与评测69

    Epoch AI 实测 GPT-5.6 与 Claude 5 长上下文延迟缩放差异

    Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。

    推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。

  2. vLLM 官方博客(RSS)63

    vLLM x AgentX:面向真实世界智能体推理服务的全栈优化

    vLLM 团队发布针对智能体负载优化的博客,基于 SemiAnalysis 的公开 AgentX 基准展示成果:DeepSeek V4 Pro 在 GB300 上达到 83K total tokens/GPU-秒。

    推荐理由:vLLM 团队结合 AgentX 实测数据讲解智能体负载的全栈优化方法与失败教训,读者可以借此理解并行策略如何跟随模型架构调整。

  3. The Decoder:AI News(RSS)77

    Anthropic 据报道签约高达 5170 亿美元算力协议,锁定至少 14.8 GW 算力

    据 The Information 报道,Anthropic 在十一个月内签署了价值高达 5170 亿美元的算力合同,自 2025 年 10 月以来锁定至少 14.8 GW 算力,并计划自建数据中心。

    推荐理由:两家公司在算力扩张上的表态与实际动作形成对照,读者可以借此审视巨额算力承诺与收入规模之间的差距。

9月5日周六
  1. xAI:News(网页)62

    xAI 用 Grok Bot 搭建采购智能体 Haggle Bot,找出超 10 万美元直接节省

    xAI 给 Grok Bot 开放供应商支出、合同和使用数据,搭建了名为 Haggle Bot 的采购智能体,已找出超过 10 万美元直接节省。SaaS 审计中发现一个产品有 43 个付费席位 90 天无活跃,节省 $14,220,另一个产品每年有 $85,662 未使用 SKU;办公用品比价一次将 $14,629 的订单压到 $6,143,降幅 58%。

    推荐理由:原文公开了完整系统提示词与具体省钱数字,读者可以直接参考其意图表达和权限边界的搭建方式。

  2. Tomer Tunguz 博客(VC 分析)61

    Tom Tunguz 分析 4 万亿美元 AI 数据中心债务浪潮

    Tom Tunguz 分析称,未来五年美国数据中心容量将从 25 吉瓦增至 70 吉瓦,全球建设成本约 5 万亿美元,其中约 4 万亿美元需靠债务融资,相当于美国公司债市场扩容 34%,并超过全球私募信贷市场。

    推荐理由:作者把 4 万亿美元 AI 数据中心债务放到主要信贷市场规模中对比,并测算出 2030 年前需要的 AI 收入门槛,提供了一个宏观信用视角。

9月4日周五
  1. Google AI:DEV 作者专属(RSS)71

    Google Cloud 教你用 Cloud Run instances 以每月 $5.70 搭建常驻 Agent

    Shir Meir Lador 在 Google AI 开发者博客介绍如何用 Cloud Run instances 以每月 $5.70(1 vCPU、1Gi 内存、共享 CPU)在云端 24/7 运行常驻 Agent。

    推荐理由:原文给出在 Cloud Run instances 上以每月 $5.70 常驻运行 Agent 的完整部署步骤和适用边界,方法可直接迁移到其他后台 Agent 场景。

9月3日周四
  1. GitHub Blog62

    GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

    GitHub 工程师 Erik Kristensen 分享了 Copilot 降本的四项改动:选择性压缩工具输出、移除 view 工具行号前缀(线下推理成本降约 5%,线上用户日均推理成本降约 3%)、压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%)、后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。

    推荐理由:GitHub 用四项改动说明压缩 token 为何要看整个任务而非单次调用,并给出可复用的评估方法与踩坑教训。

  2. Cursor Blog68

    Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

    Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。

    推荐理由:官方介绍了让智能体工具执行迁入企业自有基础设施的方案与适用场景, teams 可据此判断何时值得自托管以及如何按需扩容。

  3. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  4. Google AI:DEV 作者专属(RSS)66

    Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

    Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。

    推荐理由:作者来自 Google 团队,把写作 LLM-as-a-judge 评分标准的经验整理成四条可迁移规则,附带校准流程,适合自己搭建评测时参考。