跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 161–180 条 · 共 652 条
7月30日周四
  1. LMSYS:Blog(Chatbot Arena 团队)69

    Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

    Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。

    推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。

  2. Hacker News 热门(buzzing.cc 中文翻译)74

    开源引擎可在任何 M 系列 Mac 上以 2 GB 内存运行 Gemma 4 26B

    一个开源引擎让 Gemma 4 26B 模型能在任何 M 系列 Mac 上运行,仅需 2 GB 内存。该项目已发布在 GitHub 上,大幅降低了本地运行大语言模型的硬件门槛。

    推荐理由:这是我见过最极端的端侧优化,把 26B 参数塞进 2GB 内存,意味着所有 M 系 Mac 都能本地跑大模型了,开发者值得马上 clone 试试。

  3. Dwarkesh Patel:Podcast & Blog(RSS)70

    算力价格未来可能上涨 10 倍以上

    AI 算力现货价格自 2 月低点已上涨 40% 以上,Google 和 Anthropic 从 SpaceX 租用 11 万块 GPU 的月租金达 9 亿美元,约为现货价格的 2 倍。若 AI 达到人类水平软件工程师能力,单块 H100 等效算力年租金可达 25 万美元,是当前现货价格的 15 倍。

    推荐理由:这是一次对 AI 军备竞赛中算力定价的冷静推演,核心是收入增速远超供给增速,算力会越来越贵,赢家通吃可能固化成铁幕,追赶者必须想清楚如何支付天价入场券。

  4. Tessl:产品与工程博客66

    Docker 工程师在 AI DevCon London 谈编码智能体为何需要真正的沙箱

    Docker 从事 AI 开发者工具工作的 Oleg Šelajev 在 AI DevCon London 演讲中提出,本地编码智能体需要基于 microVM 的真正沙箱,因为提示词级防护无法强制执行文件系统和网络边界。

    推荐理由:作者用现场演示说明提示词防护可在换上下文后失效,并给出微VM沙箱、密钥代理和 sandbox kits 的可落地隔离思路。

7月29日周三
  1. Tencent Hy74

    腾讯混元开源端到端投机解码框架 AngelSpec,支持训练与部署。在 Hy3-A21B 模型上,其 DFly 方案相比自回归解码实现 1.98–2.40 倍端到端加速,吞吐量比 DFlash 高 10.5–11.8%。训练代码及 Hy3-A21B MTP/DFly 草稿模型权重已开源。

    推荐理由:做推理加速的可以试试这个端到端推测解码框架,腾讯开源了完整代码和权重,在 Hy3 上提速近 2.4 倍且吞吐更高,拿来即用。

  2. Hacker News 热门(buzzing.cc 中文翻译)76

    在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

    Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。

    推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。

  3. OpenRouter:Announcements(RSS)66

    OpenRouter 推出专用 LangChain 集成包,支持 400+ 模型与自动故障切换

    OpenRouter 发布了 langchain-openrouter(Python)和 @langchain/openrouter(TypeScript)专用包,让 LangChain 应用无需改造即可调用 400+ 模型和 70+ 提供商。ChatOpenRouter 自动处理负载均衡与故障切换,切换模型只需修改 `provider/model` 格式的字符串。

    推荐理由:OpenRouter官方的LangChain专用包,替换掉了用ChatOpenAI加base_url的老路子,但从零折腾一次安装配置的必要性,只对已绑定OpenRouter的团队成立。

  4. Modal 官方工程博客(RSS)64

    Modal 回应 Hugging Face 智能体入侵事件:平台未被攻破

    Hugging Face 公布近期智能体入侵的技术时间线,其中将 Modal 列为智能体利用的第三方基础设施。Modal 回应称其平台与隔离机制未被攻破,攻击者获得的代码执行发生在客户自己部署的无鉴权公开端点容器内,处于 Modal 标准沙箱隔离边界中,其他客户工作负载未受影响。Modal 建议公网暴露的服务启用身份验证、IP 白名单、限制出站网络,并将用户提交的代码视为不可信。

    推荐理由:当事方 Modal 直接说明平台未被攻破、攻击发生在客户容器的沙箱边界内,并给出公网暴露负载的防护建议。

7月28日周二
  1. OpenRouter:Announcements(RSS)65

    如何评估不同 LLM 提供商在延迟、吞吐量和正常运行时间上的性能

    同一模型在不同提供商端点上的表现因基础设施、量化、负载处理和路由默认设置而异。评估需测量延迟、吞吐量、正常运行时间和精度,并将测量结果转化为路由策略。

    推荐理由:做 LLM 路由的开发者必读,OpenRouter 给出了衡量延迟、吞吐和精度的实操框架,把选型从 benchmark 转向真实性能,生产环境可以直接落地试。

  2. Tomer Tunguz 博客(VC 分析)67

    AI Harness 对性能的影响超过模型本身:GPT-5.5 与 Opus 4.7 在第三方工具中得分更高

    Endor Labs 测试显示,同一模型在不同 harness 中性能差异巨大:GPT-5.5 在 Cursor 中功能正确率 87.2%,远超其在 Codex 原生环境中的 61.5%;Opus 4.7 在 Cursor 中得分 91.1%,高于 Claude Code 的 87.2%。Harness 决定发送的上下文与缓存策略,智能缓存可节省 40-80% 成本并提速 13-31%。

    推荐理由:作者引用同一模型在不同 harness 下的分数差与缓存研究,说明 harness 而非模型决定成本和表现,读者可借此审视自己的工具链选择。

  3. Liquid AI 模型与工程博客(网页)65

    Liquid AI 发布 LFM2.5-Encoder-230M 与 350M 双向编码器,长上下文下 CPU 推理最快

    Liquid AI 发布 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M 两个基于 LFM2 混合架构的双向编码器,支持 8,192 token 上下文,已在 Hugging Face 开放下载。

    推荐理由:原文给出双向编码器的架构改动、17 项任务微调评测和长上下文 CPU 吞吐对比,读者可以据此评估其在边缘和本地部署中的适用性。

7月27日周一
  1. Kimi.ai69

    我们与 kvcache-ai 合作开源了 AgentENV。 AgentENV 是一个用于大规模运行智能体环境的分布式系统。其组件为 Kimi K3 的智能体强化学习训练提供支持,具备快速快照、恢复和分支功能,适用于大规模并行智能体工作流。 在 GitHub 上探索:http://github.com/kvcache-ai/AgentEnv

    推荐理由:月之暗面开源了自家训练Kimi K3用的智能体环境,带快照和分叉,做agent训练的人可以直接上手抄作业,比看论文实在。

  2. Berkeley RDI:Blog(AI 安全与评测)64

    当编码不再是瓶颈:Berkeley RDI 提出软件自主开发三级框架

    Berkeley RDI等机构提出三级软件自主开发框架:代码自主(AI完成设计与实现,人类决定构建内容并审核PR)、流水线自主(AI运行从设计到部署的全流程,人类仅评估结果)、需求自主(AI自主决定构建内容)。该框架旨在为能力声明、部署选择与问责提供清晰分类。

    推荐理由:Berkeley团队提出软件自主开发三层框架,把模糊的“自主编程”拆成清晰阶梯,关键不在能力而在责任转移,开发团队该看看自己到了哪一级。

  3. vLLM 官方博客(RSS)75

    vLLM 发布 Kimi K3 Day-0 支持:2.8T 混合 MoE 的部署指南与性能数据

    vLLM 官方宣布 Day-0 支持 Kimi K3,这是一个 2.8 万亿参数的 MoE 模型(每 token 激活 896 专家中的 16 个),基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口和原生视觉。

    推荐理由:vLLM 团队亲述 Day-0 支持 Kimi K3 的工程细节与部署配方,读者可以据此判断混合线性注意力模型在实际服务中的可行路径。

7月26日周日
  1. Google AI:DEV 作者专属(RSS)68

    Gemini 3.6 Flash 登陆 Google Cloud 数据库:更快更便宜

    Google Cloud 数据库现已支持 Gemini 3.6 Flash,该模型知识截止日期约为今年 3 月底,且成本更低。在 Cloud SQL for Postgres 的基准测试中,Gemini 3.6 Flash 平均延迟 3694.53ms,快于 Gemini 3.5 Flash 的 4918.86ms;在 AlloyDB 中两者响应时间几乎相同。

    推荐理由:在Cloud SQL和AlloyDB环境中的实测表明,Gemini 3.5 Flash Lite以7倍速度与接近满分质量,为简单任务提供了更经济的选项,但样本量小且评判模型自带偏好,结论需谨慎采纳。

  2. Fireworks AI(网页)61

    Fireworks 发布 Fireworks Nexus:为工程团队提供可路由的开源模型智能层

    Fireworks 发布 Fireworks Nexus,将开发者现有 AI 工具接入由开源权重模型(如 Kimi-K3、GLM-5.2)组成的托管层,提供企业级成本管控、FireConnect 一行安装接入和基于难度的智能路由。

    推荐理由:原文给出具体组件、开源入口和第三方评测数字,读者可对照自己的工程负载估算替换成本收益。

7月25日周六
  1. Claude:Blog(网页)65

    Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

    Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。

    推荐理由:Anthropic 官方首次分享他们为 Claude 5 代模型移除了 Claude Code 80% 系统提示的实践,五条新规则颠覆了旧有的提示工程常识,每个用 Claude Code 或自建 agent 的开发者都该对照看看自己的系统提示是否在「过度约束」模型。

7月24日周五
  1. OpenRouter:Announcements(RSS)62

    OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

    OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

    推荐理由:OpenRouter推出分类器功能,允许按任务类型、部门等维度对API调用自动打标并归因成本,适合需要审计agent开销的团队。模板和采样率设计让落地门槛很低。

  2. Hacker News 热门(buzzing.cc 中文翻译)79

    Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

    Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

    推荐理由:一个小工具解决了一个被忽视的成本黑洞,Claude Code 的缓存过期,作者自己测了 185 个会话,省下 22% 费用,对于把 Claude 当开发助手的团队来说是个必装工具。