推荐理由:OpenRouter 用自家平台数据实测 Opus 4.7 的真实成本变化,不是官方 PR 而是第三方视角,做成本预算的产品人和开发者值得看一眼再决定要不要迁移。
部署工程
全部主题把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
最新精选
第 521–540 条 · 共 652 条
OpenRouter@OpenRouter精选AI 评分6161
Ant Ling@AntLingAGI精选AI 评分6262引用LMSYS Org@lmsysorg🎉 认识来自 @AntLingAGI 的 Ling-2.6-flash,一个即时指令模型,总参数 104B(激活 7.4B)。SGLang 现已提供 Day-0 支持! 1️⃣ 即时响应:针对低延迟智能体工作流进行调优 2️⃣ 以远更少的激活参数达到与 SOTA 相当的质量 3️⃣ 高 token 效率:在编码、文档处理和智能体任务中显著使用更少 token 4️⃣ 生产就绪,适用于需要速度 + 强大执行的智能体 立即用 SGLang 运行它!
推荐理由:104B 总参但只激活 7.4B,蚂蚁这步棋是冲着 Agent 场景的低延迟去的,做 Agent 产品的人值得跑一下看看实际体感。
Qwen:Blog Retrieval(API)精选AI 评分5757 FlashQLA: 面向GDN的CP-/Bwd友好型融合线性注意力内核
FlashQLA 发布了一组专为梯度下降网络优化的融合线性注意力内核。新内核在设计上对计算模式和后向传播更加友好,旨在提升训练效率。该技术通过优化内核融合策略,改进了注意力机制的计算性能,是提升大规模模型训练速度的关键底层优化。
推荐理由:Qwen 团队发了一篇 fused linear attention 内核的工程论文,目标是把 GDN 架构的推理和反向传播都跑快。做底层优化的工程师值得看一眼,普通开发者可以略过。
Tomer Tunguz 博客(VC 分析)精选AI 评分6464 GPU现货价格六周内暴涨114%
根据Ornn Compute Price Index数据,NVIDIA B200 GPU的现货租赁价格在六周内飙升114%,从三月初的2.31美元涨至本周的4.95美元/小时。此次价格暴涨与GPT-5.5等前沿模型发布带来的需求冲击紧密相关,这些模型需要Blackwell架构提供的内存支持。与此同时,B200与上一代H200的价差从0.28美元大幅扩大至1.80美元,不同云服务商之间的报价差距也扩大了一倍以上,反映出市场供应紧张。预计夏季B200价格将维持在5美元以上,云端推理成本持续上升。
推荐理由:Tomer Tunguz 用 Ornn 真实价格指数拆出 B200 六周涨 114% 的供需逻辑,做 AI infra 选型或算力采购的人该把这张图存下来,夏天 B200 破 5 刀基本板上钉钉。
Runway:News(网页)精选AI 评分5858 无闲置GPU:Runway的研究计算管理
Runway通过采用Kueue作为Kubernetes准入控制器,将GPU利用率提升超过20%,同时保障团队容量。其核心机制是为关键工作预留配额,并设立共享队列借用闲置容量,当配额所有者需要时通过抢占回收资源。该系统运行于昂贵的多租户GPU集群,支持多节点训练的拓扑感知调度和弹性工作负载。具体实现中,团队拥有专用预留队列,而默认队列作为共享机会池,可借用闲置配额运行可中断工作负载。当预留队列需资源时,Kueue基于优先级和运行时间抢占默认队列中的任务,实现资源高效管理。
推荐理由:Runway 把 Kueue + Kubernetes 的 GPU 调度实战写成了保姆级工程笔记,利用率翻倍的方案和踩坑细节都有,做大规模训练集群调度的团队可以直接抄作业。
Hugging Face:Blog(RSS)精选AI 评分5858 Adaptive Ultrasound Imaging with Physics-Informed NV-Raw2Insights-US AI
NVIDIA 在 Hugging Face 上发布了一款名为 NV-Raw2Insights-US 的物理信息人工智能模型,专门用于自适应超声成像。该模型能够直接处理原始超声射频数据,实时生成高质量的诊断图像。它通过结合物理定律与深度学习,显著提升了图像分辨率和对比度,同时将传统处理流程中的多个步骤整合为单一前向传播,大幅提高了计算效率。这一进展有望推动超声设备向更便携、智能和精准的方向发展。
推荐理由:NVIDIA 把物理先验塞进超声成像管线,从原始射频数据直接出诊断结果,跳过传统重建步骤。做医疗 AI 的值得拆一下这个端到端思路,但离通用场景太远。
TestingCatalog News 🗞@testingcatalog精选AI 评分7575
引用Andy Jassy@ajassy今天早上 OpenAI 的公告非常有趣。我们很高兴能在未来几周内,让客户可以直接在 Bedrock 上使用 OpenAI 的模型,同时还有即将推出的 Stateful Runtime Environment。这样一来,构建者将拥有更多选择,为合适的任务挑选合适的模型。更多详情将在我们明天于旧金山举行的 AWS 活动上公布。
推荐理由:OpenAI 模型上 AWS Bedrock,意味着企业级部署多了一条官方直连通道,做 ToB 产品选型的人该把这条放进下周的 checklist 里。
CMU:Machine Learning Blog精选AI 评分5858 介绍ARFBench:基于真实事件的时间序列问答基准
每年系统故障导致损失超万亿美元,工程师需通过分析时间序列数据快速定位问题。时间序列问答(TSQA)是关键运维任务,对AI模型构成挑战。为此,研究团队推出ARFBench基准,基于Datadog真实内部事件及遥测数据构建。测试显示,当前领先的大型语言模型、视觉语言模型和时间序列基础模型在ARFBench上表现均有较大改进空间。团队提出混合TSFM-VLM模型,其整体性能接近前沿水平,为TSQA任务提供了新评估框架和改进方向。
推荐理由:CMU 和 Datadog 联手搞了个基于真实事故的时序问答基准,结论很诚实,现有模型全拉胯。做 SRE Agent 的团队该看看,这比合成数据的 benchmark 有说服力得多。
GitHub Blog精选AI 评分7979 GitHub Copilot 将转向基于使用量的计费模式
自6月1日起,GitHub Copilot 的使用将开始消耗 GitHub AI Credits,计费模式正式从固定订阅制转变为基于实际使用量的计费。这一变化意味着用户的费用将与 AI 助手的具体调用量直接挂钩,而非统一的月费或年费。
推荐理由:GitHub Copilot 从订阅制转向按量计费,这是 AI 编程工具定价范式的标志性拐点,所有重度用户和竞品都得重新算账。
OpenRouter:Announcements(RSS)精选AI 评分5757 Opus 4.7新分词器对成本的实际影响
Anthropic在Claude Opus 4.7版本中更新了分词器。通过对比4.6到4.7版本的实际使用数据,分析发现这一技术调整改变了文本转换为令牌的方式,直接影响API计价。相同的文本输入可能产生不同数量的令牌,从而导致用户的实际使用成本发生可量化的变化。这一调整虽不改变模型能力,但关乎运营开销,是开发者和企业用户需评估的关键因素。
推荐理由:Opus 4.7 换了 tokenizer,大多数人只知道模型变强了,不知道计费逻辑也变了。OpenRouter 用真实流量数据算了一笔账,做成本预算的产品人值得扫一眼。
DeepSeek@deepseek_ai精选AI 评分6262
推荐理由:输入缓存命中价格直接打一折,对高频调用 API 的开发者来说是实打实的成本减负,配合 V4-Pro 的七五折促销,DeepSeek 在用价格战抢开发者心智。
Cognition 模型 / Devin 博客(网页)精选AI 评分6969 Cognition 发布 Devin CLI:本地启动、可交接云端继续跑
Cognition 发布 Devin CLI,一个可在本地终端运行、完整访问代码库和工具的编码 Agent,可选 Opus 4.7、GPT-5.5 和自家 SWE-1.6 等模型,并用 Rust 编写终端渲染库提升 UI 速度。
推荐理由:官方介绍了本地终端 Agent 与云端会话交接的组合玩法,多智能体并行、沙箱隔离等差异点对编码工作流有直接参考。
DeepSeek@deepseek_ai精选AI 评分6060
推荐理由:DeepSeek-V4-Pro 限时 75% off,配合 Claude Code 1M 上下文接入,对正在跑 coding agent 的开发者来说是真金白银的省钱窗口,错过这波下次不知道什么时候。
PromptArmor:Threat Intelligence精选AI 评分6969 PromptArmor 解析 AI 应用连接器的间接提示词注入风险与审计方法
PromptArmor 提出评估 AI 应用连接器风险的三支柱模型,不可信外部数据、敏感内部数据和下游动作,并呼应 Simon Willison 的 Lethal Trifecta,举例说明 Confluence 与 Zendesk 连接器组合可将内部文档经工单回复外泄。
推荐理由:原文给出连接器风险的三支柱威胁模型和主流企业 AI 应用的具体配置路径,读者可据此审计自己环境中的连接器组合。
Claude:Blog(网页)精选AI 评分7777 Claude Managed Agents 的内置记忆功能
Claude Managed Agents 推出内置记忆功能,现已进入公测阶段。该功能基于文件系统的记忆层,允许代理从每个会话中学习,优化跨会话性能。记忆以文件形式存储,开发者可通过API导出和管理,并拥有完全控制权,支持权限范围、审计日志和并发访问。实际应用中,Rakuten的代理减少97%首过错误;Wisedocs的文档验证流程加快30%;整体上,代理实现97%首过错误减少、成本降低27%和延迟降低34%。Netflix、Ando等团队利用该功能实现上下文跨会话传递和基础设施简化,提升代理的持续学习能力。
推荐理由:Claude Managed Agents 的记忆功能把跨会话持续学习变为内置能力,Rakuten 等客户已实现 97% 错误减少,对做长期代理的团队是基础设施级更新。
Claude Platform:开发者版本说明(RSS)精选AI 评分6363 Claude Managed Agents 记忆功能进入公开 Beta 测试
Claude Managed Agents 的记忆功能现已进入公开 Beta 测试,可通过标准 `managed-agents-2026-04-01` 请求头使用。该功能允许智能体在对话间保持上下文,具体集成指南见官方文档。
推荐理由:Claude托管Agent的记忆功能进入公测,这步让Agent从一问一答走向有上下文记忆的长期助手,做复杂任务的开发者可以试试。
Google Developers Blog(RSS)精选AI 评分5959 使用 LiteRT 与 NPU 构建现实世界中的设备端人工智能
LiteRT 是一个生产就绪的框架,旨在帮助移动开发者充分发挥神经处理单元(NPU)的效能,以突破传统 CPU 或 GPU 在性能与电池续航上的瓶颈。该框架通过提供统一的 API 来屏蔽底层硬件复杂性,已成功助力 Google Meet、Epic Games 等行业领先者高效部署复杂的 AI 模型,实现实时视频处理、动画生成与语音识别等高级功能。此外,平台还提供基准测试工具并具备跨平台兼容性,能够支持 AI 应用无缝部署于移动设备、AI PC 及工业物联网硬件等多种终端。
推荐理由:Google 把 LiteRT 从实验品推到生产级,统一 NPU 调用 API,做端侧 AI 的开发者终于不用逐家适配芯片了。虽然不是新概念,但 Google Meet 和 Epic Games 已经在用,说明不是 PPT。
蚂蚁百灵:Developer Blog(网页)精选AI 评分6767 Ling-2.6-flash 发布:更快响应、更强执行、更高 Token Efficiency
针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。
推荐理由:蚂蚁百灵这次打的是「省 token」这张牌,104B 总参但只激活 7.4B,Agent 场景评测对齐同尺寸 SOTA,输出 token 消耗只有竞品的 1/10。做 Agent 产品、被推理成本卡脖子的团队值得认真看看这个路线。
Cognition 模型 / Devin 博客(网页)精选AI 评分6363 Cognition 复盘两年构建 Devin 云智能体基础设施的经验
Cognition 基于两年 Devin 开发经验复盘构建云智能体的两大投入:基础设施与组织变革。文章指出容器共享内核存在逃逸风险、无法在异步间隙可靠保存状态,其方案是 microVM 隔离和 hypervisor 级整机状态快照;编排层花了超过三个季度才能管理数千并发 VM。
推荐理由:Cognition 以两年 Devin 建设经验拆解云智能体在隔离、状态快照和编排上的真实投入,并给出组织落地的具体路径。
Google Developers Blog(RSS)精选AI 评分6161 Agent Platform 中的 Agents CLI:从创建到生产,一栈式实现
Google Cloud 推出 Agents CLI 工具,专为连接本地开发与生产级 AI 智能体部署而设计。该 CLI 为编码助手提供对完整 Google Cloud 技术栈的机器可读访问,显著减少脚手架过程中的上下文过载与 token 消耗。通过将评估、基础设施配置和部署流程整合至统一的程序化主干,开发者能够将项目从初始概念推进至实时服务的时间从数周缩短至数小时。
推荐理由:对用 Google Cloud 搭智能体的开发者,这个 CLI 把碎片化的本地到云端流程压进一条命令,能省掉大量翻文档的 token,值得试试。