跳到正文
北京时间

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

652条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 201–220 条 · 共 652 条
7月20日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)73

    Ollama 获 8800 万美元融资,加速开放模型生态发展

    Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。

    推荐理由:Ollama 拿到 8800 万美元融资,同时透露 85% 财富 500 强在用,月 token 量翻倍。开放模型从玩具变成企业标配的信号越来越明显,想本地跑模型的开发者都绕不开它。

  2. Johann Rehberger / Embrace The Red(RSS)82

    Hugging Face 遭自主 AI 智能体入侵后的防御启示

    Hugging Face 披露一起由自主 AI 智能体端到端驱动的入侵,攻击者借恶意数据集和两条代码执行路径获得主机权限,窃取云和集群凭据并横向移动,留下超过 17000 条操作日志,由 LLM 异常检测管线率先发现。

    推荐理由:作者基于事件披露提炼防御者可用的应对思路,包括在事发前预置本地可部署开源权重模型作取证兜底。

  3. 公众号:数字生命卡兹克76

    不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程

    本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。

    推荐理由:我觉得这是目前最适合非技术人的中文实操指南,把从买服务器到上线的坑都填平了,独家skill也开源了,跟着做能少走很多弯路。

7月19日周日
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族

    transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。

    推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月17日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

    AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

    推荐理由:大西洋月刊这组调查揭示了AI繁荣的隐藏成本,硬件涨价会直接冲击普通消费者的钱包,这个信号比任何模型发布都更值得关注。

  2. HuggingFace Daily Papers(社区热门论文)81

    RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

    淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在“猜你喜欢”信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

    推荐理由:淘宝首页推荐搬上大模型做推理引擎,记忆+混合模态+潜在推理三件套,带来 +1.28% IPV 同时节省 52.4% 算力,推荐系统真的开始重写成本公式了。

  3. Claude:Blog(网页)65

    Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

    Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

    推荐理由:Anthropic 用自家 Claude Code 把百万行 Zig 代码迁到 Rust,两周搞定,这不仅是案例展示,更是开发者如何用 AI 重构代码库的实操指南,尤其适合那些被遗留代码拖累的团队。

7月16日周四
  1. 公众号:百度智能云(文心)67

    秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

    百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。

    推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。

  2. 公众号:小红书技术(dots.llm)77

    HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

    HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

    推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。

  3. 公众号:小红书技术(dots.llm)75

    小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

    小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。

    推荐理由:此前位置无关缓存无法用于混合注意力模型,HYPIC 通过缓存转移算子与缝合窗口首次实现,RAG 场景 TTFT 降低 3.25 倍,开源代码为推理系统提供了可复用的加速路径。

  4. IT之家(RSS)78

    台积电上调2026年资本支出预测至600~640亿美元,A14制程进展顺利

    台积电在2026Q2财报说明会上将2026年资本支出预测上调至600~640亿美元,此前预测接近560亿美元。董事长魏哲家表示,预计2028年量产的A14制程(1.4nm)开发进展顺利,移动和HPC客户兴趣强烈,将成为比2nm更大、更持久的工艺。台积电预计2026Q3合并营收446~458亿美元,2026全年美元收入增幅将超过40%。

    推荐理由:台积电这次资本支出上调不是财务数字游戏,而是直接宣告了AI算力在未来三年的供给曲线,做AI硬件的同行和投资人必须正视这轮扩产。

  5. 公众号:数字生命卡兹克68

    远程操控Agent干活方案:Codex主力 + UU远程兜底

    作者分享了一套远程使用Agent的组合方案:以Codex的远程控制功能作为主力,通过ChatGPT App连接家中24小时开机的Mac Mini,同步所有开发任务、规则和Agent记忆;遇到扫码登录、图形界面操作等Codex难以处理的场景时,用网易UU远程在手机上直接操控电脑完整桌面。UU远程完全免费,支持多设备协同,无需局域网或公网配置。

    推荐理由:卡兹克这套 Codex 加 UU 远程的组合,从工作流上解决了多设备协同的痛点,远程扫码的兜底用法尤其巧妙,适合不想被绑在办公桌前的 Agent 使用者。

  6. Modal 官方工程博客(RSS)63

    Modal 重写沙箱平台,1 分钟内启动 100 万个并发沙箱

    Modal 宣布从零重写核心沙箱平台,新系统可并发运行数百万个沙箱,并演示了在 1 分钟内创建全部 100 万个沙箱,平均每秒创建约 1.85 万个。

    推荐理由:原文由 Modal 工程团队亲述架构重写思路与实测数据,读者可以了解大规模沙箱系统如何绕开中心化协调的瓶颈。

7月15日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)77

    Telegram 无服务器架构

    Telegram Serverless 允许开发者直接在 Telegram 基础设施上运行 Bot 和 Mini App 的后端代码,无需配置服务器或容器。开发者编写普通 JavaScript 模块,通过 `npx tgcloud push` 单命令部署,代码在靠近 Bot API 和内建数据库的轻量级 V8 隔离沙箱中执行。

    推荐理由:Telegram 给机器人开发搭了一套完整的无服务器后端,内置数据库和 CLI,从写代码到部署都在一个文件夹里完成。做 Telegram 机器人的开发者可以彻底扔掉 VPS 和云函数了。

  2. 公众号:京东JoyAI67

    全国首个“模型券”即时补贴平台上线京东云

    北京经开区在全国率先试点运行“模型券”即时补贴平台,由京东科技集团提供技术支持。企业购买模型服务时可在京东云优惠价基础上叠加补贴,以1000元券包为例实际支付最低可降至350元,补贴比例最高达65%。平台支持多模型调用,企业完成四项线上流程即可即时抵扣,算力券补贴功能也将加快上线。

    推荐理由:补贴从事后申报变为消费时自动抵扣,对现金流敏感的中小企业,降低初次调用门槛的意义大于折扣比例本身。

  3. Tencent Hy69

    找不到基准测试和下载链接?看这里👇https://huggingface.co/AngelSlim/Hy3-GGUF 我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一个旗舰级 295B 模型,可在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,在显著更低的硬件上体验强大的智能。🚀🚀🚀 迫不及待想看到你们的作品。 #Hy3 #Hy #GGUF #llamacpp

    引用Tencent Hy@TencentHunyuan

    我们刚刚发布了 Hy3 的 1-bit 与 4-bit 版本,这是一款旗舰级规模的 295B 模型,可在单张 GPU 上运行。👌 使用 llama.cpp 运行 Hy3,启用 MTP,即可在显著降低的硬件配置上体验强大的智能能力。🚀🚀🚀 迫不及待想看看你们会用它构建什么。 #Hy3 #Hy #GGUF #llamacpp

    推荐理由:混元把295B旗舰模型压进单GPU,1-bit和4-bit版本对本地部署是个大礼包,开源社区可以动起来了。

  4. Hacker News 热门(buzzing.cc 中文翻译)72

    数据中心已使美国公众电费增加230亿美元,回收成本困难重重

    数据中心对电力的需求已导致美国公众电费增加230亿美元,这一涨价将持续至2028年底。由于电价由州公用事业委员会根据复杂的成本分摊规则设定,数据中心可利用其用电灵活性(如避开系统峰值负荷)规避部分成本分摊,而普通居民难以效仿。监管机构正面临如何公平分配电网基础设施投资成本的挑战。

    推荐理由:文章拆开了美国电力市场成本分配的规则漏洞,原来数据中心能靠预测高峰期降载来逃掉电费,普通住户根本没法复制,最后账单还是落在我们头上。

  5. vLLM 官方博客(RSS)74

    vLLM 实现 TML Inkling Day-0 支持并完成推理性能优化

    vLLM 宣布对 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,覆盖 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本,支持文本、图像、音频输入和最长 1M token 上下文。

    推荐理由:原文给出 Day-0 支持的具体性能数字、架构优化细节和精度对比,读者可以评估该模型在自己的推理工作流中的可用性。