跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 501–520 条 · 共 652 条
5月3日周日
  1. OpenRouter65

    新功能:"-latest" 模型别名 🔀 将请求路由至 "~anthropic/claude-opus-latest"、"~openai/gpt-latest" 等,以获取各主要模型的最新版本。(灵感来自语义化版本。)https://openrouter.ai/models?q=latest

    引用Wes Winder@weswinder

    @levelsio openrouter 在模型名称里有一个很酷的“nitro”标志,用来使用最快的提供商 所以就像“gpt-5.5:nitro” 如果实验室们能让你直接用“latest”之类的就好了

    推荐理由:OpenRouter 这个 -latest 别名很实用,不用每次都改模型版本号,对大量调用 API 的团队是个省心更新,痛点精准。

5月2日周六
  1. Rohan Paul79

    美国国防部已与七至八家领先AI公司达成协议,将其AI技术整合进机密网络系统。合作方包括谷歌、微软、AWS、英伟达、OpenAI、Reflection和SpaceX,而Anthropic被明确排除在外。五角大楼将AI定位为核心基础设施,允许其用于任何“合法的作战用途”。官方平台GenAI.mil上线五个月内,已有超130万国防部人员使用,生成了数千万次提示并部署了数十万个AI智能体,展现了该计划的规模与影响力。

    推荐理由:美军把AI正式拉进机密作战系统,排除Anthropic是个强烈信号——AI军事化已不可逆,安全派的克制在真实战场需求面前不堪一击。

5月1日周五
  1. Claude:Blog(网页)64

    Claude Code 构建经验:提示缓存的优化实践

    Claude Code 团队分享了大规模优化提示缓存的核心策略。提示缓存基于前缀匹配工作,能显著降低延迟与成本,高命中率还能支持更宽松的订阅速率限制。关键实践包括:将静态系统提示和工具定义置于提示词前端以最大化共享前缀;通过消息而非修改提示词来传递更新信息,避免缓存失效;在会话中不切换模型、不增删工具,以维持缓存前缀稳定。此外,针对工具过多或“计划模式”等场景,可通过发送轻量存根或设计专用工具来规避缓存失效,从而在复杂功能中持续利用缓存优势。

    推荐理由:Claude Code团队把提示缓存的坑和优化方法全盘托出,从提示顺序、工具加载到压缩技巧,每一个经验都是钱和延迟换来的,做agent的同行可以直接拿去做架构参考。

  2. Ant Ling76

    AntLingAGI团队宣布Ling-2.6-1T模型正式开源,已登陆Hugging Face平台,并通过Novita Labs提供官方推理体验。该模型采用混合专家架构,总参数1万亿、激活参数630亿,核心优化方向为“令牌效率”以满足真实生产需求。具体表现为:低令牌开销,能在无需冗长推理链的情况下保持强大智能;可靠的多步执行能力,提升指令、工具、上下文和工作流的控制水平;生产就绪的部署特性,覆盖从代码生成到错误修复的任务,并广泛兼容各类智能体框架。团队旨在通过降低测试、部署、定制和构建的难度,为开发者创造价值。

    引用Ant Ling@AntLingAGI

    上周,我们发布了 Ling-2.6-1T。今天,Ling-2.6-1T 正式成为开源模型~ 🤗 总参数 1T · 激活参数 63B 我们通过让测试、部署、定制和构建变得更简单,为开发者带来价值。 这款模型针对实际生产需求进行了“模型 token 效率”优化: • 更低的 token 开销:无需长推理链即可实现强大的智能 • 可靠的多步执行:更好的指令、工具、上下文和工作流控制 • 生产级部署:从代码生成到 bug 修复,兼容广泛的 Agent 框架 提前一瞥 @opencode 中的智能体能力

    推荐理由:1T参数开源模型不是天天有,蚂蚁这个Ling-2.6-1T强调token效率和Agent能力,做Agent的可以直接去Hugging Face上跑一下,看看是不是真的在生产环境省token。

  3. OpenRouter:Announcements(RSS)58

    OpenRouter 推出 Response Caching:相同请求零成本缓存

    OpenRouter 新增 Response Caching 头部,用于缓存完全相同的 API 请求,使后续请求的响应时间大幅缩短,且缓存调用完全免费。

    推荐理由:OpenRouter 这波缓存功能很实在,相同请求零费用,对频繁调用的开发者是省钱利器。可惜 42 天前的东西,现在只能当文档翻翻。

  4. OpenRouter:Announcements(RSS)59

    Response Caching:相同请求零成本

    新推出的 Response Caching 头部实现了 API 请求的缓存机制,完全相同的请求可获得缓存响应,响应时间大幅缩短至微乎其微的水平,且不会产生额外成本。该功能通过自动识别并复用已生成的响应,显著提升了重复请求的处理效率。

    推荐理由:OpenRouter 这次更新的响应缓存,直接让相同请求免费用,对频繁调用的场景是个省钱加速的好功能,用过 API 的人都能立刻明白它的价值。

4月30日周四
  1. Cursor Blog55

    持续优化智能体工具链:上下文演进与效果评估

    Cursor团队以构建软件产品的方式迭代优化其智能体工具链,核心围绕上下文窗口的演进。早期模型能力有限,工具链依赖大量静态上下文和防护机制;随着模型能力提升,团队已转向提供更多动态上下文获取方式并移除限制。评估改进效果采用线上线下结合:通过CursorBench等基准测试进行标准化质量评估,同时进行线上A/B测试,使用“代码保留率”和用户反馈语义分析衡量真实场景表现。团队持续监控并修复工具调用错误,以应对日益复杂的工具链状态。

    推荐理由:Cursor 这篇 agent harness 复盘是今年聊 agent 基础设施最好的文章之一,从上下文管理到多 agent 调度,全是实战迭代的血泪经验,做 agent 的团队该逐字读。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)74

    为智能时代构建计算基础设施:OpenAI 扩展 Stargate 以支撑 AGI 发展

    OpenAI 正在扩展其代号为“Stargate”的计算基础设施项目,旨在为通用人工智能(AGI)的研发提供核心算力支持。该项目通过增加新的数据中心容量,以应对全球范围内持续增长的 AI 算力需求。这一举措标志着 OpenAI 在构建下一代大规模计算集群方面进入实质性推进阶段,旨在为未来 AGI 系统所需的巨大计算资源打下硬件基础。

    推荐理由:这不是模型发布,但算力扩张才是 AGI 竞赛的真正底层,数据中心扩容直接关系到下一代模型能不能训出来,做基础设施的可以盯一下供应链。

  3. OpenAI Developers63

    你完全可以构建网络应用

    引用dominik kundel@dkundel

    http://x.com/i/article/2049579443216338944

    推荐理由:OpenAI开发者官方转发了这篇‘直接构建web应用’的文章,说明这可能是他们认可的实践路径,对想用AI快速搭应用的开发者算是个值得收藏的参考。

  4. LMSYS:Blog(Chatbot Arena 团队)74

    秒级更新万亿参数——大规模分布式强化学习中的点对点权重传输技术

    LMSYS团队针对SGLang中的强化学习工作负载,提出了一种基于RDMA的点对点权重更新机制,作为传统NCCL广播方法的补充。该设计利用源端CPU引擎副本和Mooncake TransferEngine进行P2P RDMA传输,将拥有1T参数的Kimi-K2模型的权重传输时间从53秒大幅缩短至7.2秒,提速7倍。其代价是每个训练等级需在CPU内存中额外占用一个32G的推理引擎副本。此优化最大限度地减少了网络冗余,允许推理服务器更快恢复rollout过程,且兼容所有主流开源模型。

    推荐理由:LMSYS 把分布式 RL 训练的权重同步从 NCCL 广播改成 RDMA P2P,1T 参数模型传输快了 7 倍,做大规模 RL infra 的团队该认真看看这个工程方案。

  5. Google Developers Blog(RSS)57

    加速AI:通过GCSFS和Rapid Bucket将Google Colossus引入PyTorch

    Google Cloud推出了一项高性能集成方案,通过fsspec接口将Rapid Storage直接连接至PyTorch,以消除AI训练瓶颈。该方案利用Google的Colossus架构和双向gRPC流技术,可提供高达15 TiB/s的聚合吞吐量,并显著降低延迟。开发者仅需更新存储桶类型而无需修改代码,即可将总训练时间缩短23%。

    推荐理由:Google 把自家 Colossus 存储架构直接接进 PyTorch,号称零代码改动提速 23%,做大规模训练的团队值得评估一下,但对大多数人来说这更像 GCP 的护城河加固。

4月29日周三
  1. Ant Ling71

    AntLingAGI正式开源其万亿参数旗舰模型Ling-2.6-1T。该模型采用总参数1万亿、激活参数630亿的架构,核心设计理念是“令牌高效”,旨在以极低的令牌开销实现顶尖智能。它通过“快速思考”机制优化,具备可靠的多步骤执行能力,在指令遵循、工具使用和上下文控制方面表现优异。模型为实际生产需求优化,部署便捷,兼容广泛的智能体框架,适用于从代码生成到错误修复等多种任务。

    引用Ant Ling@AntLingAGI

    🚀 今天,我们推出 Ling-2.6-1T,一款专为精确执行指令任务而设计的万亿参数旗舰模型。通过优先采用“快速思考”机制,它以超低 token 开销实现 SOTA 智能,让 token 效率成为一等公民。

    推荐理由:蚂蚁把万亿参数模型开源了,但强调的不是大,而是省 token,这对成本敏感的生产环境是真正的性价比之选,做 agent 的可以上手测测。

  2. The Decoder:AI News(RSS)72

    OpenAI 在与微软重组协议次日登陆 AWS

    微软与 OpenAI 解除了独家合作协议。次日,亚马逊云科技(AWS)便在其 Bedrock 平台上推出了三项新的 OpenAI 服务,其中包括一项双方共同构建的智能体服务。此举标志着 OpenAI 模型正式结束了在微软 Azure 云上的独家托管状态,开始通过 AWS 向更广泛的客户提供。

    推荐理由:微软独家协议刚解除,OpenAI就立马登陆AWS并合作推出Agent服务,云AI的阵营格局这下真的松动了,创业公司选平台不再被单一绑定。

  3. OpenRouter:Announcements(RSS)60

    OpenRouter 推出 CLI 创建账户功能,集成 Stripe 计费

    运行 `stripe projects add openrouter/api` 即可从命令行创建 OpenRouter 账户、获取 API 密钥并配置 Stripe 计费。AI 智能体同样可自动化完成该操作,无需手动注册。

    推荐理由:OpenRouter 把注册和计费全塞进一条 CLI 命令,Stripe Projects 加持,agent 都能自己开户了,重度 API 玩家可以省点事,不过就一工具链缝合,不打开也知道。

  4. OpenRouter:Announcements(RSS)65

    通过 Stripe Projects 命令行创建 OpenRouter 账户

    运行 `stripe projects add openrouter/api` 命令,即可直接从命令行创建 OpenRouter 账户、获取 API 密钥并开通 Stripe 计费功能。该操作支持自动化代理执行,实现了账户开通与支付配置的一站式集成。

    推荐理由:OpenRouter 把账户创建搬到了 CLI,你的 agent 也可以直接开号了,这对于需要自动化计费流程的开发者是个便利小更新,但普通用户几乎感受不到变化。

  5. SiliconFlow63

    👀 🚀 🙌 [引用 @SiliconFlowAI]:开发者们正在用他们的 token 投票 🔥 SiliconFlow 现已成为日 token 使用量排名第一的第三方模型提供商 在 @OpenRouter 上, • 每日约 280B token • 每月约 1.9T token • 33 个前沿模型:DeepSeek V4 系列、GLM 5.1、Kimi K2.6 等 衷心感谢每一位与我们共同构建的开发者 更多精彩即将到来🚀

    引用SiliconFlow@SiliconFlowAI

    开发者们正在用他们的 token 投票 🔥 SiliconFlow 现已成为按每日 token 使用量计算的第一大第三方模型提供商 在 @OpenRouter 上, • 约 280B tokens/天 • 约 1.9T tokens/月 • 33 个前沿模型:DeepSeek V4 系列、GLM 5.1、Kimi K2.6 等 非常感谢每一位使用我们进行开发的开发者 还有更多即将到来🚀

    推荐理由:如果你在选模型API,这个数据比任何benchmark都有说服力。每天280B token的真金白银投票,国产模型厂商里硅基流动已经跑出来了。

  6. Together AI 研究与产品博客(RSS)73

    Together AI 上线 DeepSeek-V4 Pro,支持 512K 上下文

    Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。

    推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。

  7. OpenAI:官网动态(RSS · 排除企业/客户案例)71

    OpenAI模型、Codex与托管智能体登陆AWS平台

    OpenAI的GPT系列模型、代码生成模型Codex以及托管智能体现已正式上线亚马逊云科技。企业用户可直接在AWS环境中集成并调用这些AI服务,基于自身云基础设施构建安全、可控的定制化人工智能应用。此次合作将OpenAI的前沿模型能力与企业级云环境的安全性和可扩展性相结合,为企业部署生成式AI与自动化智能体提供了新的平台选择。

    推荐理由:OpenAI 终于上了 AWS,这意味着大量被云锁定的企业不用再绕道 API,直接在自家环境里跑 GPT 和 Codex,对做企业级 AI 产品的人来说是个真信号。