跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 641–652 条 · 共 652 条
7月10日周四
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B/0.7B/1.2B 三个规格

    Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。

    推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。

7月2日周三
  1. Modal 官方工程博客(RSS)62

    Modal 如何用 evals 和推理时算力扩展生成既美观又可扫的 QArt 二维码

    Modal 团队复盘其 QArt codes 服务的工程过程,通过 evals 和推理时算力扩展将二维码扫描率提升到 95% 的 SLO,同时改善美观度并将 p95 端到端延迟控制在 20 秒内。

    推荐理由:Modal 团队复盘 QArt codes 从不可扫到 95% 扫描率的工程路径,evals 构建与推理时并行扩展的方法可迁移到其他生成模型应用。

6月23日周一
  1. Prime Intellect(网页)61

    Prime Intellect 发布 SYNTHETIC-2 开源推理数据集与行星尺度流水线并行推理运行

    Prime Intellect 发布 SYNTHETIC-2,一个开源推理数据集,基于 DeepSeek-R1-0528 生成经过验证的推理轨迹,并启动行星尺度的流水线并行分布式推理运行。

    推荐理由:原文给出流水线并行推理与 TOPLOC v2 验证机制的细节,开源社区可据此了解如何用消费级 GPU 参与大规模推理贡献。

5月30日周五
  1. Modal 官方工程博客(RSS)62

    Modal 上线 B200 和 H200 GPU

    Modal 宣布 B200 和 H200 GPU 开放给所有账户使用,无需联系销售,B200 定价 $6.25/hour,H200 定价 $4.54/hour,一行代码即可在 Function 中指定。

    推荐理由:原文给出 B200 与 H200 的价格、规格对比和实测延迟数据,读者可据此评估迁移到新 GPU 的收益。

5月28日周三
  1. OpenRouter:Announcements(RSS)56

    OpenRouter 推出推理流摘要、加密货币发票等多项新功能

    OpenRouter 上线了推理流摘要(Reasoning Streams)功能,支持流式推理过程摘要,同时新增加密货币发票支付、最终用户 ID(End-User IDs)、速率限制保护以及密钥锁定等特性。

    推荐理由:如果你在用 OpenRouter 做应用,这几个更新挺实用,推理流输出让代理开发更可控,加密支付和端用户 ID 也降低了商业化门槛。

2月18日周二
  1. DeepSeek

    NSA是一种硬件对齐且原生可训练的稀疏注意力机制,专为超快速长上下文训练与推理设计。其核心采用动态分层稀疏策略,结合粗粒度token压缩与细粒度token选择。通过针对现代硬件的优化,NSA在加速推理、降低预训练成本的同时不损失性能,在通用基准、长上下文任务及指令推理中匹配或超越Full Attention模型。

    推荐理由:DeepSeek 推出硬件对齐稀疏注意力 NSA,长上下文训练推理双提速,预训练成本显著降低

11月29日周五
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

    Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。

    推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。

9月30日周一
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布首批 Liquid Foundation Models:LFM-1B/3B/40B

    Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。

    推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。

9月19日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    引入上下文检索:大幅提升RAG系统准确性的新方法

    传统RAG系统在编码时易丢失上下文,导致检索失败。新方法“上下文检索”通过“上下文嵌入”和“上下文BM25”两项子技术,在检索前为文本块添加解释性上下文,能将检索失败次数减少49%,结合重排序后降幅可达67%,显著提升了下游任务性能。对于小于20万token的小型知识库,可直接将其完整内容放入提示词,结合Claude的提示词缓存功能,能降低超过2倍的延迟和高达90%的成本。对于大型知识库,上下文检索则提供了可扩展的解决方案。

    推荐理由:Anthropic 把 RAG 检索失败率砍了 67%,方法不复杂但数据扎实,做知识库的开发者可以直接抄 cookbook 上手,是那种读完当天就能改进生产环境的实用帖。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

8月9日周三
  1. LangChain:Blog(RSS)61

    LangChain 与 Airbyte 集成:让数据摄取达到生产级就绪

    LangChain 与 Airbyte 的集成方案旨在将检索应用扩展至生产环境。该方案通过调度、文本拆分和 50 多种嵌入模型实现数据摄取自动化,帮助开发者构建可规模化的生产级数据管道。

    推荐理由:Airbyte 目标端把调度、切分与嵌入选项接入 LangChain,让数据源到 RAG 索引的更新由手动脚本转为可配置流程。