跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 461–480 条 · 共 652 条
5月14日周四
  1. Hugging Face:Blog(RSS)59

    解锁连续批处理中的异步性

    在连续批处理中,同步方式导致CPU与GPU交替工作,造成闲置浪费。测试显示,使用8B模型生成8K令牌时,GPU有24%的时间处于空闲状态。异步批处理通过分离工作负载,让CPU准备下一批次(N+1)的同时,GPU计算当前批次(N),从而消除闲置间隙。这可通过CUDA流实现操作并发,无需更改内核或模型,仅需协调硬件执行顺序。理论上,该方法可将总生成时间从300.6秒减少至228秒,实现24%的免费加速。相关技术已集成到transformers库的连续批处理中,显著提升推理性能。

    推荐理由:文章手把手拆解了异步批处理如何用CUDA流和事件消除CPU与GPU的互相等待,把推理吞吐提升22%,搞推理优化的工程师值得细读。

  2. Cursor Blog67

    为智能体配置开发环境

    Cursor发布新工具,用于配置云端智能体开发环境。核心更新包括:支持多仓库环境,使智能体可跨代码库协同工作;提供基于Dockerfile的代码化配置,支持构建密钥并优化缓存,命中缓存后构建速度提升70%;增强由智能体主导的环境设置流程,提供验证与故障回退机制。同时新增环境治理与安全功能,如版本历史、审计日志,以及可在环境级别独立管控的网络出口和密钥权限。这些改进旨在帮助团队在受控环境中更高效地运行能端到端处理任务的并行智能体集群。

    推荐理由:Cursor 云代理这次把多仓库、环境即代码和审计控制打包补齐,让开发团队可以真正放养一队 agent 跑端到端任务,企业落地门槛降了一大截。

  3. Claude:Blog(网页)73

    Claude 电脑与浏览器使用的最佳实践

    Claude 最新模型在电脑与浏览器使用能力上显著提升,支持构建复杂智能体系统。本文针对Claude 4.6系列和Opus 4.7提供实践指南,重点优化截图分辨率:Claude 4.6系列API限制最大长边1568像素、总像素115万;Opus 4.7提升至最大长边2576像素、总像素375万。发送前将截图缩放到限制内是提升点击准确性的最有效方法。推荐起始分辨率为1280x720,Opus 4.7用户可优先使用1080p,并避免发送未经缩放的原始截图或过低分辨率图像。

    推荐理由:如果你正在让 Claude 操作桌面或浏览器,这篇官方指南把分辨率、token 压缩和缓存策略一次讲透了,附带代码和踩坑表,是那种"读完就能少写一堆 bug"的硬核文档。

  4. Anthropic:Newsroom(网页)80

    Anthropic推出面向小型企业的Claude服务包

    Anthropic推出“Claude for Small Business”服务包,旨在帮助小型企业弥补在AI应用资源上与大型公司的差距。该产品包含一系列连接器和15个开箱即用的自动化工作流,能将Claude深度集成到QuickBooks、PayPal、HubSpot等企业日常工具中。其核心功能是自动化处理财务、运营、销售等领域的重复性任务,如规划薪资、月末结算、追踪发票和分析营销活动等。用户通过Claude Cowork界面操作并手动批准关键步骤,所有任务均由用户发起和控制,Anthropic承诺保障数据安全。

    推荐理由:Anthropic 把 Claude 装进 QuickBooks、PayPal、HubSpot,直接帮小老板跑 payroll、关账、催发票,这是 AI 第一次真正为那些「深夜还在忙杂务」的人减负,小企业主和做 SaaS 的朋友值得细看。

  5. Google Cloud:Databases(RSS)71

    Google Cloud 用代理模型加速数据库 AI 函数

    Google Cloud 在 SIGMOD 发表论文,提出用代理模型(proxy model)加速 BigQuery 和 AlloyDB 中的 AI 函数。代理模型是面向特定查询和数据微调的轻量级模型,在 10 个基准测试中 F1 分数达到 LLM 的 90%-116%。该优化已默认集成在 BigQuery 和 AlloyDB 的优化模式下。

    推荐理由:Google 把数据库里的 LLM 调用换成了超轻量代理模型,成本降了两个数量级且准确度几乎无损,做数据分析和 SQL 的同行该认真看了。

5月13日周三
  1. Satya Nadella68

    微软推出新型多模型智能体安全系统,整合了超过100个基于前沿和定制模型的专用智能体,用于发现可利用的安全漏洞。该系统在CyberGym基准测试中取得了顶级性能。在最近的Patch Tuesday之前,该系统已帮助发现并修复了16个漏洞。微软宣布客户现可申请加入该系统的私有预览测试。

    推荐理由:微软把多模型代理系统用到安全漏洞挖掘上,100多个专业代理协作,在CyberGym基准拿了第一,做安全的朋友值得看看实际效果。

  2. Claude Code:GitHub Releases(RSS)70

    v2.1.140 版本更新

    本次更新包含多项错误修复与体验优化。核心改进包括:增强了Agent工具的`subagent_type`匹配逻辑,现对大小写和分隔符不敏感;修复了`/goal`命令在特定钩子设置下无响应的问题,现会显示明确提示;解决了Windows系统上因缺失可执行文件导致的周期性事件循环停滞。此外,还修正了后台服务启动、远程设置认证重试、托管市场更新策略持久化、`/loop`命令调度冗余以及`Read`工具参数验证等多个问题。插件系统现会对因配置冲突而被静默忽略的默认组件文件夹发出警告。

    推荐理由:Claude Code 这次修了一批烦人小 bug,尤其是 /goal 不再装死、/loop 不再空转,用着难受的开发者可以立刻更新试试。

  3. Google Developers Blog(RSS)73

    使用ADK构建可暂停、恢复且永不丢失上下文的长时运行AI智能体

    本文探讨了如何从无状态聊天机器人升级为生产级AI智能体,以管理长达数天或数周的企业工作流程(如HR入职)。通过引入Agent Development Kit(ADK),其架构核心采用持久状态机和持久化会话存储,确保智能体在“空闲时间”或服务器重启时永不丢失上下文。系统利用事件驱动的Webhook和多智能体委托机制,实现在暂停期间“休眠”,并在唤醒后以高推理准确性恢复复杂任务,从而构建出具备韧性和可靠性的长时运行智能体系统。

    推荐理由:Google 官方手把手教你把无状态 chatbot 升级成能跨天跨周的持久化 agent,状态机和持久会话是两个关键切入点,做过生产环境 agent 的都懂这东西有多刚需。

5月12日周二
  1. Hugging Face:Blog(RSS)58

    在AWS上进行基础模型训练与推理的核心构建模块

    本文面向使用开源框架的机器学习工程师,阐述了AWS如何为大规模基础模型的全生命周期提供核心基础设施。其核心是三大紧密集成的组件:配备多代NVIDIA GPU(如H100、H200及新一代Blackwell B200/B300)的大显存加速计算实例;用于集体通信的高带宽、低延迟网络(节点内NVLink与节点间EFA);以及可扩展的分布式存储。这些基础设施与Slurm/Kubernetes等资源编排系统、PyTorch/JAX等ML框架协同,共同支撑预训练、后训练和推理工作负载,并可通过Prometheus/Grafana实现全栈可观测性。

    推荐理由:这篇把AWS上训大模型的全套基础设施串了一遍,从GPU选型到网络存储再到Slurm/K8s编排,是做云端大规模训练的工程师的必读参考。

  2. Claude:Blog(网页)70

    Anthropic在AWS上正式推出Claude平台

    Anthropic公司正式在AWS上推出Claude平台,为AWS客户提供了通过其现有身份验证、账单及承诺消费抵扣使用完整Claude功能的新途径。该平台首次将全套Claude API功能引入AWS生态,新功能与原生API同日上线。平台包含Claude托管智能体、代码执行、文件API等多项核心功能,并支持最新模型。与Amazon Bedrock上的服务不同,此平台由Anthropic直接运营,数据在AWS边界外处理,适合需要完整平台体验的企业客户。服务将在多数AWS商业区域提供。

    推荐理由:Anthropic 第一次把完整 Claude 平台功能全量搬到 AWS 上,用 AWS 账号就能直接拿原生 API 最新特性,对于 AWS 生态里的开发者是个省心的一站式选择,不用再纠结该走 Bedrock 还是原生。

  3. LlamaIndex:产品、工程与评测63

    LlamaIndex 发布 LiteParse Server 可自托管文档解析服务

    LlamaIndex 发布 liteparse-server,将 LiteParse 封装为可自托管的 HTTP 文档解析服务,支持 PDF、Word、PowerPoint、表格和图片,输出带 bounding box 的空间布局文本。

    推荐理由:原文给出了接口、格式支持和两种部署模式的具体细节,读者可以据此评估自托管文档解析在隐私和成本上的取舍。

5月11日周一
  1. Runway:News(网页)68

    告别编写YAML:使用confingy配置机器学习系统

    Runway开源了Python库confingy,旨在解决机器学习系统配置的长期痛点。该库允许开发者用纯Python代码(支持懒加载、类型检查和序列化)替代传统YAML配置文件,从而摆脱YAML作为图灵完备领域特定语言所带来的维护困境。confingy无需重构现有代码,即可满足跟踪构造函数参数、避免实例化昂贵对象(如大语言模型)等核心需求,有效改善了因复杂YAML配置导致的无法跳转定义、类型提示失效和重构困难等开发体验问题。

    推荐理由:Runway把自家ML训练的YAML坑填平了,开源了confingy。如果你还在用YAML管实验参数,这可能是今年最该装的pip包。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)78

    OpenAI 推出 DeployCo 以协助企业围绕智能构建业务

    OpenAI 正式推出全新企业部署公司 DeployCo,旨在帮助各类组织将前沿人工智能技术投入实际生产,并转化为可衡量的商业影响。该举措标志着 OpenAI 进一步深入企业服务领域,专注于解决 AI 模型从测试到规模化部署的落地挑战,助力企业通过定制化部署方案提升运营效率与业务成果。

    推荐理由:OpenAI 把部署单独拆成一家公司,说明企业落地不再是副业,而是和模型研发并列的支柱,做 toB 生意的同行可以重新想想自己的定位了。

  3. SenseTime72

    SenseNova U1图像生成模型现已在ComfyUI上可运行,并获得包括REBEL AI在内的评测者高度认可。REBEL AI发布的实践教程展示了该模型的部署工作流,并对其图像生成能力进行了真实场景测试。模型支持8步快速推理,生成速度极快,应用场景涵盖人像、超现实艺术、文字标志和生物设计等。相关资源已在Hugging Face、GitHub和Discord平台开放。

    推荐理由:商汤把新模型U1的ComfyUI部署流程完整放出,还有实测视频,想在自己机器上跑国产图像模型的开发者可以直接抄作业了。

  4. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4:百万 token 上下文为何是推理系统工程问题

    Together AI 发布文章解析 DeepSeek-V4 服务方案,认为其关键变化是架构层面将 1M token 上下文压缩问题转化为推理系统工程问题。

    推荐理由:Together 基于自家 B200 布署经验,把 DeepSeek-V4 百万 token 上下文拆解为缓存管理与调度策略问题,给出了可迁移的评测与调优思路。

  5. Claude Platform:开发者版本说明(RSS)73

    Claude Platform on AWS 发布

    Anthropic 推出 Claude Platform on AWS,将 Claude API 部署在由 Anthropic 管理、可通过 AWS 访问的基础设施上,支持 AWS 账单和 IAM 身份验证。

    推荐理由:Anthropic 把 Claude API 搬上 AWS 了,用 AWS 计费和原生 IAM,对于已经在 AWS 上的团队这就像打开了自家水龙头,延迟更低,账单还统一。

  6. Hugging Face:Blog(RSS)74

    MachinaCheck:基于AMD MI300X构建多智能体CNC可制造性分析系统

    MachinaCheck是一款基于多智能体AI的系统,旨在革新小型CNC机加工车间的报价分析流程。传统上,车间经理需花费30-60分钟手动分析图纸,而该系统在上传STEP文件及材料、公差等简单输入后,能在30秒内生成完整的可制造性报告,明确指出零件能否制造、所需工具及生产前需采取的行动。其核心在AMD MI300X加速卡上本地运行Qwen 2.5 7B模型,利用192GB HBM3显存确保客户设计数据无需离开本地,满足了制造业对数据隐私的严格要求。系统采用五组件流水线,结合精确的几何特征提取与LLM的制造知识推理,最终输出结构化报告。

    推荐理由:虽然是hackathon项目,但用多Agent做CNC可行性分析,把推理全压在本地AMD显卡上保护图纸隐私,还给了可跑的代码和Space,制造业AI落地就该这么直接。

5月9日周六
  1. BAIR:Berkeley AI Research Blog64

    自适应并行推理:高效推理扩展的新范式

    自适应并行推理是一种新范式,它让大语言模型能够自主决定何时分解任务、并行处理多少子任务以及如何协调结果,以应对序列推理中因探索路径增长而导致的延迟增加和“上下文腐化”问题。近期研究如ThreadWeaver和Multiverse通过动态控制并行线程,在数学与代码推理基准上取得了显著性能提升,同时大幅降低了延迟。这标志着从固定并行策略到自适应智能控制的转变,为复杂任务的推理提供了高效且可扩展的解决方案。

    推荐理由:模型自己决定何时并行、开几个线程,这篇BAIR博客把Multiverse和ThreadWeaver的系统设计掰开了讲,做推理系统和RL的同学应该看看。

5月8日周五
  1. GitHub Blog72

    提升 GitHub Agentic Workflows 的 Token 使用效率

    GitHub 发现运行于每个拉取请求的智能体工作流会累积高昂的 API 成本。团队通过监测自身生产工作流,定位了效率低下的环节,并构建了专门的智能体进行优化。这一举措旨在显著降低由大语言模型调用产生的 Token 消耗与相关费用,直接提升了工作流的经济性与运行效率。

    推荐理由:GitHub 把自己生产环境的 agentic workflow 扒了一遍,从 token 消耗里找浪费,再让 agent 自动修。不是 paper,是真踩过的坑,做 Copilot 集成的团队可以抄作业。

  2. Simon Willison 博客78

    GitHub Repo Stats

    作者开发了一个名为“GitHub Repo Stats”的在线工具,用于解决GitHub移动端网站不显示仓库提交次数的问题。用户只需输入GitHub仓库的URL或“foo/bar”格式的仓库ID,该工具便会通过REST或GraphQL API获取并展示仓库的关键统计数据,其中首要指标就是提交总数。工具已提供实际示例,如查看simonw/datasette和simonw/llm这两个仓库的详细数据。

    推荐理由:Simon 这个 GitHub Repo Stats 工具虽小,但直接解决了移动端看不了 commit 数这个真实痛点,做开源评估的开发者可以立刻用起来。