跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 221–240 条 · 共 652 条
7月14日周二
  1. Google AI Developers70

    Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。

    推荐理由:Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。

  2. 公众号:小红书技术(dots.llm)64

    小红书企业级 AI 个人助理:从 0 到全员覆盖的架构实践

    小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。

    推荐理由:从物理隔离到三层记忆,这套方案把 OpenClaw 定制为企业个人助理,沙箱和成本控制细节对同类实践有直接参考价值。

  3. 公众号:腾讯混元78

    腾讯混元将Hy3旗舰模型量化至1bit与4bit,单卡即可部署

    腾讯混元将295B参数的Hy3旗舰模型权重量化至1bit与4bit并打包成GGUF,配合llama.cpp生态,使原本需多卡集群部署的模型最少一张96GB推理显卡即可运行。1bit版将权重从598GB压缩至85.5GiB,4bit版体积169.9GiB,两张显卡可承载;量化版在长文理解、Agent与代码任务上贴近满血效果,开启MTP后解码速度提升约50%-60%。

    推荐理由:将 295B 旗舰模型量化至单卡部署,1bit 版本在长文理解上仍接近满血,且提供 MTP 加速,改变了本地运行大模型的门槛与成本考量。

  4. Google AI:DEV 作者专属(RSS)67

    合成随机向量数据会误导 PostgreSQL 和 AlloyDB 的向量搜索性能测试

    Google AI 工程师指出,使用合成随机向量数据测试向量搜索性能可能导致误导性结果。对于 HNSW 索引,合成数据构建耗时 6,601,789 毫秒,而真实数据仅需 4,174,196 毫秒,速度快 1.5 倍,因为随机向量缺乏自然聚类结构,使图索引的节点连接更难建立。

    推荐理由:玩pgvector或AlloyDB向量搜索的开发者应该看看这篇,用合成数据测HNSW索引召回率可能只有3%,而真实数据超90%,附带完整SQL复现脚本。

7月13日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)70

    Ploy 将 AI 智能体默认模型从 Claude Opus 4.8 切换至 GPT-5.6 Sol

    Ploy 将其 AI 智能体默认模型从 Claude Opus 4.8 切换至 OpenAI 今晨发布的 GPT-5.6 Sol。在真实营销网站构建测试中,GPT-5.6 Sol 完成页面平均耗时 3 分 42 秒,较 Opus 4.8 的 8 分钟快 2.2 倍;每次构建成本从 3.06 美元降至 2.22 美元,降低 27%;输出 token 从 33.0K 降至 17.1K,视觉评分从 0.936 提升至 0.970。迁移过程发现,GPT-5.6 会为所有 25 个工具参数填充默认值,导致 52%-64% 的文件读取返回空结果;提示词指令和 OpenAI strict 模式均无法修复此行为。此外,评估框架中约三分之一的原始失败源于针对旧模型的假设,而非模型本身问题。

    推荐理由:这篇 Ploy 的迁移手记把 GPT-5.6 生产中踩的坑都摊开了,工具调用参数膨胀和缓存键设计两个问题,做 agent 的团队不看可能会付昂贵学费。

7月12日周日
  1. Hacker News 热门(buzzing.cc 中文翻译)77

    Mesh LLM:在 iroh 上进行分布式人工智能计算

    Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 `localhost:9337/v1` 提供服务。

    推荐理由:Mesh LLM 把多台机器的 GPU 拼成一个推理集群,让大模型在自建网络上运行。对想省钱且需隐私的开发者来说,这是一个值得尝试的实用工具。

7月11日周六
  1. 蚂蚁 inclusionAI:GitHub 新仓库65

    蚂蚁集团开源 AKernel:面向 AI 智能体的可编程数据中心基础设施

    蚂蚁集团开源 AKernel(Agent Kernel),一个将整个数据中心视为 AI 智能体可编程扩展的分布式内核。它通过统一 Python SDK 实现计算、网络和存储的编程控制,支持单机、私有 K8s 及多云(阿里云、华为云)一键部署,冷启动仅需 40 毫秒。AKernel 代码由 AI 大量贡献,并内置基于 OpenTelemetry 的全栈可观测性。

    推荐理由:蚂蚁把数据中心变成 Agent 的可编程扩展,对于需要大规模弹性编排 Agent 的团队来说,比用 Kubernetes 手写 YAML 直接得多,不过目前严重依赖阿里云和华为云,通用性还差一截。

  2. 蚂蚁 inclusionAI:GitHub 新仓库60

    蚂蚁 inclusionAI 开源沙箱生命周期服务 sandboxd

    蚂蚁集团 inclusionAI 在 GitHub 开源 sandboxd,这是 AKernel 使用的 Linux 沙箱生命周期服务,通过 gRPC API 管理沙箱资源,当前基于 gVisor 运行沙箱,并计划近期开源 Kata Containers 支持。

    推荐理由:蚂蚁把 AKernel 用的沙箱生命周期管理开源了,对需要安全执行代码的 AI 推理/评测场景有参考价值,但仅限底层基础设施人员,非目标受众不必深究。

  3. LMSYS:Blog(Chatbot Arena 团队)61

    DeepSeek-V4 Flash 强化学习训练登陆 AMD Instinct MI355X GPU,由 Miles 框架支持

    DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)需 SGLang 进行 rollout 生成、Megatron 进行策略更新,Miles 负责异步循环与权重同步。团队解决了 SGLang 与 Megatron 间模型对齐、量化状态在线更新及多节点并行稳定性三大挑战,最终在四个八 GPU 节点上完成端到端验证:超过 100 个优化器步骤中训练-rollout 对数概率差可控,在线奖励持续提升,离线 AIME-2024 基准分数同步上涨。

    推荐理由:把 DeepSeek-V4 Flash 的 RL 训练完整搬到 AMD MI355X 上,不是画饼,而是给了实测数据和可跑的配置。想用非 NVIDIA 卡做 RL 训练的,可以照着踩坑。

7月10日周五
  1. 公众号:小红书技术(dots.llm)70

    小红书发布大模型新架构 PIPO

    小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone,在 AIME 2025 等基准上最高带来 +7.15 pass@4 提升。部署测评中,TTFT 加速约 1.23×,TPOT 加速约 1.86×。训练采用 SFT 和 On-Policy Distillation 两阶段,将 verifier 校验能力蒸馏进轻量 confidence head。

    推荐理由:PIPO把输入压缩和输出多token预测统一起来,并且用蒸馏把验证成本前置,长推理的场景下这可能是下一代推理引擎的样子,做模型加速的应该认真看看。

  2. IT之家(RSS)75

    扎克伯格首度回应 Meta“算力过剩”:没人会嫌算力太多,但租出去更赚钱

    Meta CEO 扎克伯格首次正面回应公司筹划云基础设施业务一事,否认“算力过剩”猜测,称内部算力需求依然旺盛、满负荷运转。但他同时表示,当前市场对算力出价极高,将部分 AI 基础设施对外出租在财务上更划算。Meta 正制定代号“Meta Compute”的云计算计划,包括开放模型访问权限和直接出租裸算力两条路线。扎克伯格还提及 SpaceX 以每月 12.5 亿美元将数据中心租给 Anthropic 的模式。Meta 2026 年资本支出指引达 1250 亿至 1450 亿美元,计划 2026 年 9 月量产自研 AI 芯片,目标 2027 年部署算力提升至 14 吉瓦。

    推荐理由:扎克伯格首次确认 Meta 要做云业务,从‘自用’到‘出租’的转变很关键,这可能是 AI 基础设施从军备竞赛转向平台化的信号,做底层算力和云服务的团队有必要盯着。

  3. 公众号:龙猫LongCat(美团)74

    美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

    推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。

  4. Hacker News 热门(buzzing.cc 中文翻译)70

    Show HN: 如何在我的低配置电脑上运行 GLM-5.2

    colibrì v1.0 引擎以纯 C 实现、零运行时依赖,可在约 25 GB RAM 的消费级电脑上运行 744B 参数的 GLM-5.2 MoE 模型。模型经 int4 量化后磁盘占用约 370 GB,常驻内存仅 9.9 GB,通过流式加载磁盘专家实现推理。冷解码速度约

    推荐理由:这个单C文件项目让744B的MoE模型在25GB内存的笔记本上跑了起来,虽然慢,但证明了消费级硬件也能把前沿模型‘盘活’,做本地推理的极客值得看看。

  5. TechCrunch:AI(RSS)73

    AI 能否回答 3 万亿美元的问题?

    Sequoia 合伙人 David Cahn 更新 AI 基础设施支出估算:2026 年全球投入达 1.5 万亿美元,行业需产生 3 万亿美元收入才能回本。Anthropic 年化收入(ARR)达 600 亿美元,OpenAI 2025 年收入 130 亿美元(11 月称 ARR 200 亿美元),但缺口仍大。Apollo 首席经济学家指出,谷歌、Meta、微软、亚马逊均预测 2028 年自由现金流加速,但风险在于更多组织转向更便宜的开放权重模型(尤其中国模型),且 OpenAI 最新模型编码任务 token 效率提升 54%,导致 token 价格持续下降。若超大规模厂商现金流目标落空,可能引发经济衰退和标普 500 回调。

    推荐理由:Sequoia和Apollo的经济学家同时拉响警报,AI基建支出今年1.5万亿美元,需要3万亿收入才回本。这不是唱衰,是给产品人一个倒计时,开源模型和掉价的token让这账更难算。

  6. OpenAI Developers68

    将一个想法变成可发布和分享的实时网站 以下是OpenAI团队的一些成员用Sites构建的示例👇 @prd_008 用Sites将一个想法变成了个人专注应用:

    引用pranav@prd_008

    ChatGPT Sites 现已面向 Plus、Pro、Business 和 Enterprise 用户开放。支持网页、移动端和桌面端。 我利用新版 ChatGPT 中的 Sites 插件,把一个想法变成了一个个人待办事项应用。 以下是我构建它的过程。

    推荐理由:ChatGPT Sites 把建站门槛拉到一句话描述,我觉得这是 ChatGPT 从「聊完就忘」到「留下东西」的关键一步,但现阶段模板和分发都太简陋,产品人可以先尝鲜别急着押注。

  7. Prime Intellect(网页)61

    Prime Intellect 发布 verifiers 0.2.0 预览版,将智能体 RL 环境解耦为 Taskset、Harness 与 Runtime

    Prime Intellect 发布 verifiers 0.2.0,预览重写后的 v1 核心,将环境解耦为 taskset、harness 和 runtime,任意 taskset 可在任意兼容 harness 下运行。

    推荐理由:原文给出任务集、执行框架与运行时三层解耦的设计细节和训练案例,读者可以据此评估这套抽象是否适配自己的智能体训练流程。

7月9日周四
  1. MarkTechPost(RSS)70

    NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍

    NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。

    推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。

  2. Tomer Tunguz 博客(VC 分析)57

    AI预检检查:智能体工作记忆架构

    一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。

    推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)58

    OpenAI发布政府与国家安全合作伙伴关系方针

    OpenAI近日公布国家安全原则,阐明在政府及国家安全领域部署前沿AI系统的方针。原则强调在保护公民、防御关键基础设施、提供公共服务及应对新兴威胁(网络防御和生物安全)中发挥AI优势,同时确保民主问责、人类判断和法治。过去一个月,OpenAI通过Daybreak网络防御计划与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰及欧盟ENISA等机构建立网络安全信任访问合作,并与英国政府开展网络安全测试评估。上月,OpenAI向部分美国政府及盟友合作伙伴开放GPT‑Rosalind模型用于公共卫生和生物防御。原则适用于现有及未来合作,包括与Department of War的协议,明确禁止大规模国内监控、自主武器系统及高风险自动化决策。OpenAI支持立法对高风险军事用途(如国内监控、自主武器)建立保障措施。

    推荐理由:OpenAI 首次公开发布国家安全合作原则,同时宣布与多国建立网络和生物防御伙伴关系。我觉得这是头部 AI 公司在军事合作上的一次主动透明化尝试,值得看看他们如何设限。

  4. Hugging Face:Blog(RSS)66

    原生速度的 vLLM transformers 建模后端

    Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torch.compile。用户仅需添加 `--model-impl transformers` 标志。目前不支持线性注意力模型但即将支持。

    推荐理由:用 transformers 写的模型,现在不用改一行代码就能在 vLLM 里跑到手写实现的水平,模型作者最大的集成痛被抹平了。虽然主要是工程黑魔法,但生态意义不小。