跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 601–620 条 · 共 652 条
12月30日周二
  1. xAI:News(网页)

    xAI推出Grok Business与Enterprise企业版

    xAI发布Grok Business和Grok Enterprise企业版。Business版定价30美元/座位/月,支持自助开通,提供团队管理、统一账单及Google Drive集成(保留原文件权限),并承诺用户数据永不用于模型训练。Enterprise版面向大型组织,提供Custom SSO、Directory Sync及高级审计控制;可选的Enterprise Vault插件提供独立数据平面与客户自管加密密钥(CMEK),实现应用级加密隔离。平台支持实时使用监控、安全对话共享及Projects功能。

    推荐理由:xAI 推出 Grok 企业版,主打隐私保护与 Agent 能力,月费 30 美元起

12月22日周一
  1. xAI:News(网页)

    以 AI 支持 DOW 的使命

    xAI 被美国战争部(DOW)选中,为其 GenAI.Mil 套件提供 Frontier AI 系统。基于 Grok 模型的解决方案将覆盖 DOW 旗下 300 万军事和文职人员,支持 Impact Level 5(IL5)级别的企业 AI 和关键任务用例,可嵌入从五角大楼到战术边缘的日常工作流,并支持机密作战工作负载。DOW 用户还可独家获取 X 平台实时全球洞察。

    推荐理由:xAI获美国国防部大单,Grok将覆盖300万军事人员并提供实时情报支持

12月18日周四
  1. OpenRouter:Announcements(RSS)57

    OpenRouter 推出 Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出 Response Healing 新功能,可在响应到达应用前自动修复大语言模型产生的格式错误的 JSON,从而将 JSON 缺陷减少 80% 以上。

    推荐理由:如果你无数次被 LLM 返回的残缺 JSON 搞到崩溃,OpenRouter 这个 response healing 能自动修复 80% 的缺陷,以后 debug 可以少肝半小时。

  2. OpenRouter:Announcements(RSS)61

    Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。

    推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月17日周三
  1. Google DeepMind:Blog(RSS)

    Gemini 3 Flash:专为速度打造的前沿智能

    Gemini 3 Flash 正式发布,在大幅降低使用成本的同时提供前沿级智能,主打极速推理性能,为需要快速响应的 AI 应用提供高性价比选择。

    推荐理由:Google发布Gemini 3 Flash轻量模型,兼顾前沿性能与推理速度

12月15日周一
  1. 通义 QwenAudio:原创语音项目60

    通义实验室开源 Fun-ASR 系列语音识别模型,含方言与 31 语言版本

    通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。

    推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。

12月11日周四
  1. Hugging Face:Blog(RSS)76

    llama.cpp 服务器新增多模型管理功能

    llama.cpp 服务器新增了类似 Ollama 的多模型管理功能。该功能采用多进程架构,每个模型独立运行,确保单个模型崩溃不影响其他服务。系统支持自动发现本地 GGUF 模型文件、按需加载,并默认采用 LRU 机制管理最多同时加载4个模型。用户可通过请求中的模型字段路由到特定模型,并可使用 API 进行加载、卸载和列表查看。所有加载的模型可继承路由器的统一设置,也支持通过预设文件为每个模型单独配置参数。内置 Web UI 同样支持模型切换。

    推荐理由:本地跑模型终于能像 Ollama 一样热切换,开发调试效率大幅提升

12月5日周五
  1. Hugging Face:Blog(RSS)76

    介绍 swift-huggingface:完整的 Hugging Face Swift 客户端

    swift-huggingface 是一个全新的 Swift 客户端,旨在彻底解决旧库下载模型缓慢、不可靠且不支持断点续传的问题。它提供完整的 Hub API 覆盖,核心改进包括具备进度跟踪和断点续传的可靠下载、与 Python 生态共享缓存以避免重复下载,以及通过灵活的 TokenProvider 模式简化身份验证。该库现已独立发布,并将很快集成到 swift-transformers 中取代原有实现,未来还将支持 Xet 存储后端以实现更快的下载。

    推荐理由:Swift 开发者可无缝集成 Hugging Face 模型,下载更可靠且与 Python 共享缓存。

12月3日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

    蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。

    推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。

12月1日周一
  1. Hugging Face:Blog(RSS)93

    Transformers v5:以简化模型定义驱动AI生态

    Transformers v5正式发布,其每日pip安装量从v4的2万次大幅提升至300万次以上,总安装量突破12亿次。模型架构数量从40个扩展至超400个,Hub上兼容的模型检查点从约1,000个增至75万个。新版本聚焦于简化模型定义、训练、推理与生产部署,通过引入AttentionInterface等模块化设计,显著降低了代码贡献与维护成本。此外,库将明确以PyTorch为唯一后端,逐步淘汰Flax/TensorFlow支持,并简化分词处理,以推动标准化与生态兼容性。

    推荐理由:Transformers v5 大幅简化模型集成,提升训练推理效率,开发者可快速上手最新 AI 模型。

11月27日周四
  1. Saining Xie

    Meta研究人员透露,Facebook自2020年起使用TPU训练AI,由Kaiming He领导开发TF和JAX代码库,MAE、DiT等模型完全基于TPU构建。因内部采用有限,Meta于2023年取消GCP协议。推文指出,Google、Anthropic等实验室长期使用TPU训练大模型,Nvidia的CUDA护城河并非不可逾越,OpenAI亦投资Triton寻求替代。TPU与GPU的效率差异并非关键,系统工程人才才是决定性因素。

    引用Clive Chan@itsclivetime

    我不断看到关于 TPU 的东西,有什么实质性的新进展吗? 没有证据表明 Google 曾在非 TPU 硬件上训练过 Gemini,这可以追溯到多年前 GPT 之前的模型,比如 BERT。TPU 比 Nvidia 自己的张量核心还要早。 Anthropic(以及 Character、SSI 和 Midjourney……)长期以来一直在使用 TPU,如果 Meta *没有* 在考虑它们,我会感到惊讶。 Nvidia 的护城河对大型实验室来说从来都不深——看看 OpenAI 决定它可以做得比 CUDA 更好,转而投资 Triton,在基准测试中经常胜过 CUDNN。这一切都没有什么神奇或结构性的东西,只是优秀的工程师在做优秀的工作。 TPU 并不比 GPU 高效多少,而微小的性能/功耗差异与 Meta 是否拥有正确的内核/系统工程人才来做到这一点相比,简直微不足道。Nvidia 和 Google 的护城河都很小,我们仍然处于个别优秀工程师就能扭转整个平衡的阶段。见下面的旧帖。 这难道……没有被定价进去吗?这些都是超级古老的公开信息。

    推荐理由:何恺明团队2020年起用TPU训练MAE/DiT,Nvidia护城河比想象更浅

11月25日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 上线 Black Forest Labs 的 FLUX.2 多参考图生图模型

    Together AI 将 Black Forest Labs 的 FLUX.2 图像模型接入 Model Library,面向 100 万以上开发者提供多参考输入、hex 色号颜色匹配和文本渲染能力。

    推荐理由:原文列出了多参考输入、hex 色号匹配和三个型号的具体参数,读者可据此判断是否接入现有生成工作流。

  2. Hugging Face:Blog(RSS)76

    从第一性原理看连续批处理

    连续批处理是优化大型语言模型推理吞吐量的核心技术,通过并行处理多个对话并在生成完成后动态交换任务,以最大化硬件利用率。从注意力机制和KV缓存的基础原理出发,文章推导了如何通过优化批处理提升性能。注意力层具有二次复杂度,但连续批处理允许查询、键和值张量容纳不同长度的令牌序列,从而同时处理预填充和解码阶段。该技术能显著降低生成每个令牌的计算成本,适用于高负载服务场景,提升响应速度。

    推荐理由:深入理解LLM推理优化原理,助力高效模型部署。

  3. Hugging Face:Blog(RSS)83

    构建深度研究智能体:实现顶尖水平的经验

    Tavily团队因模型迭代重建了深度研究系统,核心是从工作流转向智能体架构,并聚焦上下文工程。通过Tavily Advanced Search进行上下文管理的网络检索,高效获取高相关度内容,避免信息过载。智能体设计模仿人类研究模式:收集信息、提炼要点、决策下一步,仅在生成最终交付物时引用原始资料,大幅减少令牌消耗,实现线性增长而非传统二次方增长。团队遵循简化编排逻辑、关注模型与工具优化方向、强化上下文工程等原则,以构建能随模型进化而持续改进的智能体系统。

    推荐理由:分享构建高效 AI 代理的实战技巧,优化上下文工程以提升性能。

  4. Hugging Face:Blog(RSS)73

    OVHcloud 成为 Hugging Face 官方推理服务提供商

    OVHcloud 现已正式加入 Hugging Face Hub 的推理服务提供商生态。用户可直接在模型页面使用其全托管、无服务器化的 AI 端点服务,便捷调用 gpt-oss、Qwen3 等热门开源模型。该服务基于欧洲数据中心,保障数据主权与低延迟,首 token 响应时间低于 200 毫秒,并支持结构化输出等高级功能。定价为每百万 token 0.04 欧元起,用户可选择使用自定义 API 密钥或通过 Hugging Face 账户路由请求并计费。

    推荐理由:欧洲开发者可低成本合规访问前沿AI模型,推理选项更丰富。

11月21日周五
  1. Hugging Face:Blog(RSS)80

    RapidFire AI 实现20倍更快的 TRL 微调

    RapidFire AI 发布了一套加速 TRL 微调的工具,通过自适应分块调度方案,允许在单个或多个 GPU 上并发启动多个训练配置并实时比较。内部基准测试显示,实验吞吐量比顺序执行高出约 16 至 24 倍。该工具提供即插即用的 TRL 配置包装器、分块并发训练、支持实时停止/恢复/克隆修改的交互式控制操作、自动多 GPU 编排以及 MLflow 仪表板,使用户能快速筛选最优配置,极大提升微调效率。

    推荐理由:开发者可并发测试多个微调配置,大幅提升实验效率。

11月20日周四
  1. Hugging Face:Blog(RSS)83

    介绍 AnyLanguageModel:为苹果平台提供本地与云端大语言模型的统一 API

    AnyLanguageModel 是一个 Swift 包,旨在为苹果平台上的大语言模型集成提供统一解决方案。它作为苹果原生 Foundation Models 框架的替代品,允许开发者通过相同的 API 接口,灵活调用本地模型(如通过 Core ML、MLX、llama.cpp 运行)与云端服务(如 OpenAI、Anthropic)。该方案复用苹果精心设计的 API 作为基础,大幅降低了在不同模型提供商之间切换的代码修改成本,并利用 Swift 的包特性功能避免依赖膨胀,从而简化开发流程,鼓励对本地开源模型的探索。

    推荐理由:Apple开发者可一键切换本地与云端模型,大幅降低AI应用开发门槛。

11月19日周三
  1. xAI:News(网页)

    Grok 与沙特阿拉伯达成全国性部署合作

    xAI 与沙特阿拉伯及 PIF 旗下 HUMAIN 签署框架协议,将在沙特建设超大规模 GPU 数据中心,并全国范围内部署 Grok 至 HUMAIN ONE 平台,为政府和企业提供实时智能与自主工作流。这是 Grok 首次在国家层面全面落地。

    推荐理由:xAI与沙特达成国家级合作,将全国部署Grok并建设超大规模AI算力基础设施

11月17日周一
  1. Hugging Face:Blog(RSS)73

    使用Hugging Face轻松构建和共享ROCm内核

    Hugging Face的kernels库简化了高性能深度学习内核的构建与共享,支持CUDA、ROCm等多种后端。本文以ROCm兼容内核为例,展示如何利用kernel-builder工具构建、测试并共享内核。以RadeonFlow的GEMM内核为具体案例,该内核是针对AMD Instinct MI300X GPU优化的FP8块状矩阵乘法实现,采用e4m3fnuz浮点格式和每块缩放因子以保持低精度计算准确性,并在2025年AMD开发者挑战赛中获最高奖。指南涵盖项目设置、构建配置及通过kernels社区分享的完整步骤。

    推荐理由:AMD GPU开发者可快速上手构建高性能AI内核,提升部署效率。

11月13日周四
  1. Hugging Face:Blog(RSS)88

    共建开放未来:Hugging Face与Google Cloud达成新合作

    Hugging Face与Google Cloud宣布建立深度战略合作,旨在将Google Cloud打造为使用开放模型的最佳平台。双方将合作构建CDN网关,把Hugging Face上的模型和数据集直接缓存在Google Cloud上,显著提升下载速度并增强供应链稳定性。Google Cloud客户在Vertex AI、GKE等服务中部署模型时将获得更快的首次响应。同时,Hugging Face的1000万开发者将受益于更多新型计算实例、价格下降以及通过Google安全技术强化的模型安全性。此次合作还将推动TPU在开放模型开发中的普及应用。

    推荐理由:开发者将享受更快的模型下载、TPU 原生支持和增强安全,简化 AI 部署流程。