跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 81–100 条 · 共 652 条
8月26日周三
  1. 公众号:腾讯混元67

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 压缩至 440MB,已落地哔哩哔哩直播弹幕翻译

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 量化方案压缩至 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 等商业 API。该模型已联合英特尔完成 x86 适配,并在哔哩哔哩直播弹幕实时翻译中落地,单条弹幕翻译耗时 500~800ms。

    推荐理由:相比精度数字,这套量化给出 x86 优化和直播弹幕实测数据,让端侧替代云翻译 API 的成本与隐私权衡有了可对照的工程基线。

  2. Fireworks AI(网页)68

    DeepSeek V4 Pro 0813 上线 Fireworks:SWE-Bench Verified 达 95.2%,单任务成本约为 Fable 5 的三分之一

    Fireworks 上线 DeepSeek V4 Pro 0813,提供 serverless、专属部署及 SFT/DPO/RFT 训练支持,模型具备 1M token 上下文窗口和原生工具调用。

    推荐理由:原文用四组基准和逐任务成本数据对比 V4 Pro 与 Fable 5、Kimi K3,并指出 Java 弱项与路由空间,读者可据此选型。

  3. Tomer Tunguz 博客(VC 分析)61

    AI 智能体应该活多久?

    长期运行的 AI 智能体会因上下文累积而注意力衰减、临时指令残留成永久规则,并带来安全风险。建议给日常助手 24 小时生命周期,午夜重置会话,将具体任务委派给只存活 30 秒的单一用途子智能体,并在重置前将持久偏好存入磁盘。

    推荐理由:文中把解决问题的方式拆成两层,短命协作者处理当日上下文,偏好则离线写盘,让长期记忆不随会话累积而劣化,也收窄了权限暴露窗口。

  4. OpenRouter:Announcements(RSS)68

    如何在编辑器里实时挑选最佳 AI 模型

    OpenRouter 提出一套模型选型框架:先定义任务,从实时用量和第三方基准中筛选候选,再对比各提供商的定价与延迟,最后用自有提示词测试。判断标准是“每完成任务的成本”而非“每 token 成本”。其 MCP 服务器可直接在 Claude Code、Cursor 等编辑器中查询实时排名、价格和基准,并用 openrouter/auto-beta 按请求路由。

    推荐理由:比 token 价格更实际的是成本按完成任务的次数计算,把重试与失败率纳入对比,这让团队评估模型经济学时有了可量化指标。

  5. OpenRouter:Announcements(RSS)66

    OpenRouter 视频生成 API:一份代码优先的接入指南

    OpenRouter 推出统一的异步视频生成 API,通过 POST /api/v1/videos 提交任务、轮询状态并下载 MP4,支持 Seedance、Veo、Wan 等模型,切换模型只需更改 model 标识符。

    推荐理由:将视频生成抽象为提交、轮询、下载的异步作业,模型切换只改标识符,同时覆盖幂等、webhook 与并发控制,可迁移到其他异步生成 API 的集成。

  6. Dwarkesh Patel:Podcast & Blog(RSS)64

    Dylan Patel:Anthropic 与 OpenAI 到 2028 年将控制全球大部分算力

    在最新一期播客中,SemiAnalysis 创始人 Dylan Patel 与 Dwarkesh Patel 讨论实验室经济学,预计 Anthropic 和 OpenAI 到 2028 年将控制全球大部分可用 FLOPs,因其能更好变现算力并出价高于其他方。

    推荐理由:六亿美元晶圆厂资本开支最终可能对应超一万亿美元终端AI收入,这个数量级差距能解释实验室愿高价竞购算力并推高市场利率的一种机制。

8月25日周二
  1. Meta Engineering Blog(RSS)62

    MetaRoCE:为 AI 规模以太网打造的全新 RDMA 传输协议

    Meta 设计并开源了 MetaRoCE,一个专为 AI 工作负载在通用以太网上打造的 RDMA 传输协议,已通过 Open Compute Project(OCP)发布规范、参考软件实现和合规测试套件。该协议将智能移至端点,原生支持乱序交付、多路径、无损容忍和双向拥塞控制,无需 PFC,可在百万 GPU 规模下提供高吞吐、低尾延迟。现有 RDMA Verbs API 和软件栈无需修改即可运行。

    推荐理由:MetaRoCE 把拥塞控制与路径选择交给端点,AI 集群无需 PFC 也能在有损以太网上维持吞吐,实测 1% 丢包下保持 86% 吞吐,为大规模组网去掉无损约束提供了依据。

8月24日周一
  1. TechCrunch:AI(RSS)70

    OpenAI 正为一切构建 AI 智能体,但用户会愿意交出控制权吗?

    OpenAI 推出 ChatGPT Work,将 Codex 改造为面向非工程师的智能体产品,最低订阅档每月 20 美元即可使用,旨在让白领通过 LLM 自主完成多步骤工作。OpenAI 内部 6 月有 98% 员工使用 Codex,但组织订阅者仅 17%、个人订阅者不足 1%。公司正通过简化界面扩大采用,以支撑其巨额训练投入。

    推荐理由:内部 98% 使用对组织 17%、个人不足 1% 的落差,把智能体无法走出编程群体的障碍从模型能力转移到产品交互与可发现性上。

  2. NVIDIA Blog(RSS)63

    NVIDIA Vera Rubin NVL72 树立 AI 智能体效率新标准:每瓦特工作量提升至 30 倍

    NVIDIA 实测数据显示,Vera Rubin NVL72 在智能体工作负载下每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍,每百万 token 成本降低至 35 倍。

    推荐理由:对电力受限的 AI 工厂,每兆瓦吞吐量 30 倍提升与 token 成本同步下降,意味着同等能源预算下可承载的 agentic 负载量级不同,部署决策中的成本模型可能改写。

  3. Tomer Tunguz 博客(VC 分析)60

    AI 基础设施的牛鞭效应:从 GPU 到存储的连锁瓶颈

    AI 基础设施瓶颈正沿供应链依次传导,形成典型的牛鞭效应。2023 年初 GPU 短缺使 H100 租赁价超 $9/小时,随后压力转移至内存,企业级 SSD 合约价单季上涨 80%;到 2025 年底智能体推高 CPU 需求,2026 年存储短缺导致西数和希捷 2026 全年 nearline 产能售罄。数据中心建设成本已超 $20b/GW,变压器交期近三年,涡轮机订单排至 2031 年。

    推荐理由:把牛鞭效应用在 AI 硬件供应链上,解释了瓶颈逐段迁移的滞后期,可为判断 2027-2028 年哪些长期资本开支会先承压提供框架。

  4. Tomer Tunguz 博客(VC 分析)62

    AI 智能体应该活多久?

    长期运行的 AI 智能体会因上下文累积而注意力衰减、临时指令变成永久规则,并带来安全风险。建议给日常助手 24 小时生命周期,每天重置会话,将具体任务委托给只存活 30 秒的单一用途子智能体,并在午夜前将持久偏好保存到文件中。

    推荐理由:作者提出24小时生命周期加短命子代理的架构模式,并给出可直接复用的调度与执行提示词。

8月23日周日
  1. Tomer Tunguz 博客(VC 分析)63

    AI 基础设施的“牛鞭效应”:从 GPU 到存储的瓶颈接力

    AI 基础设施瓶颈正沿供应链依次传导:2023 年 GPU 短缺推高 H100 租赁价超 9 美元/小时,2025 年智能体工作负载将 CPU 与 GPU 配比推向 1:1,2026 年存储告急,企业级 SSD 合约价单季上涨 80%。数据中心建设成本已超 200 亿美元/吉瓦,变压器交付周期近三年,涡轮机订单排至 2031 年。

    推荐理由:作者用各环节价格与产能数据梳理AI基础设施瓶颈的传导路径,读者可以借此理解牛鞭效应如何放大上游过剩风险。

8月22日周六
  1. Ant Ling53

    今天,我们为 SGLang 推出 Weight Cache Daemon。🚀 在 Ling-2.6-1T FP8 上,它将权重加载时间缩短至约 0.63 秒,比磁盘加载快约 780 倍,并将引擎总启动时间从 8.8 分钟缩短至约 0.53 分钟。其工作原理如下。

    推荐理由:把权重加载从磁盘瓶颈改为缓存复用,对需要频繁扩缩容或重启推理服务的团队,启动耗时从分钟级降到秒级可能改变运维节奏。

  2. LMSYS:Blog(Chatbot Arena 团队)63

    Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

    蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

    推荐理由:对做单请求低延迟推理的团队,可迁移的是先把主机从 GPU 进度上解绑再优化 GPU 关键路径,否则主机的同步等待会变成每步的 GPU 气泡,这与具体模型无关。

8月21日周五
  1. Claude:Blog(网页)73

    AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期

    Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。

    推荐理由:把各阶段产物固化为可版本化 markdown 并让下一阶段读取,人工审查就从逐行看代码转向在关卡看代理标记,对改造研发流程的团队有直接参考价值。

  2. Hugging Face:Blog(RSS)61

    Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

    Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

    推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

  3. Mistral AI:News(网页)68

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,为 AI 系统提供多步检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供,支持云端与本地部署。

    推荐理由:官方给出 FinanceBench 与 OfficeQA Pro 上的具体数字和五工具设计,读者可评估其对现有 RAG 流水线的替代价值。