AI 周报 · 2026 年第 32 周 · 08.03 — 08.09
由来科技
开源模型与智能体基建加速
本周AI行业主线是开源模型的密集发布与智能体基础设施的快速演进。Qwen3.8-Max以2.4T参数开源最强编码模型,商汤、蚂蚁、腾讯混元等也相继推出开源模型,推动前沿能力平民化。与此同时,Cloudflare Agents Week、微软Orchard、Google Agent Skills等事件标志着智能体开发与部署的底层工具链日趋成熟。欧盟AI法案透明度规则生效,为行业划定了合规红线。此外,Anthropic与Volta的百亿算力协议、Palantir CEO对前沿实验室的批评,折射出算力军备竞赛与产业话语权争夺的加剧。
开源模型密集发布,前沿能力走向平民化
本版导读本周多家机构发布开源模型,显著降低前沿AI的使用门槛。Qwen3.8-Max以2.4T参数成为Qwen家族最强模型,并首次开源Max级权重;商汤SenseNova U1及U1.5-Lite-Preview实现统一推理与图像生成;蚂蚁百灵Ling-3.0-flash、NVIDIA Alpamayo 2 Super等也开放商用。这些发布意味着开源模型在编码、多模态等领域的性能已逼近闭源,推动AI能力民主化。
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
商汤 SenseNova U1 开源:统一推理与图像生成
商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。
商汤发布 SenseNova U1.5-Lite-Preview 开源模型
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
蚂蚁百灵发布Ling-3.0-flash开源权重
今天,我们发布了 Ling-3.0-flash 的开源权重。🎉 官方 BF16 和 FP8 量化版本现已可用,您可以根据自己的硬件、性能要求和部署需求选择最合适的版本。
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
智能体基础设施爆发,开发与部署工具链成型
本版导读Cloudflare开启Agents Week,推出面向智能体的运行时、入站TCP支持及本地追踪调试;微软开源Orchard训练框架;Google发布Agent Skills治理流程;OpenRouter推出ori CLI简化配置。这些进展表明智能体开发正从零散实践走向标准化、平台化,为大规模部署奠定基础。
Cloudflare 开启 Agents Week:探讨面向智能体的 Agent Cloud 形态
Cloudflare 启动为期五天的 Agents Week,核心议题是“Agent Cloud”应具备何种形态。其认为现有云和网络皆为人设计,而智能体有速度、结构与访问上的独特需求,因此 Agent Cloud 需同时构建面向智能体原生的底层能力,并充当现有网络与智能体网络之间的转换层。本周将围绕执行层、智能体开发生命周期、安全控制及智能体网络等主题展开。
Cloudflare 推出 @cloudflare/computer 预览版:为智能体提供虚拟文件系统与多执行环境
Cloudflare 发布 @cloudflare/computer 早期预览版,这是一个开源智能体运行时,为每个智能体提供虚拟文件系统,并支持在 isolate、容器沙箱或浏览器中执行代码。
Cloudflare Workers 与 Containers 现已支持入站 TCP 连接和 gRPC
Cloudflare 在 Agents Week 期间推出 Workers 运行时新处理器 connect(socket),可直接接受 Spectrum 提供的入站 TCP 套接字,并支持将套接字转发至 Durable Objects 或 Containers,实现全双工通信。
Cloudflare 让智能体通过本地追踪调试 Workers
Cloudflare 即日起在 wrangler dev 和 vite dev 中自动为本地 Worker 调用捕获 OpenTelemetry 追踪,无需安装 SDK 或配置智能体。智能体可通过 Local Explorer API 查询追踪数据,定位失败操作、修复本地环境并验证结果。开发者也可在浏览器界面 Local Explorer 中可视化查看 spans、时序、错误及关联控制台日志。
微软开源 Orchard 智能体训练框架
Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP
Google Agent Skills 幕后:如何构建、测试与规模化
Google Agent Skills 团队详解其开源技能库的构建与治理流程:项目始于 Google Cloud Next 2026 前的“swarm”冲刺,发布后 GitHub 星标超 15,000。为保证规模化下的质量,每个技能须通过标准化目录结构、CI/CD 流水线(含 linter、链接检查、AI 辅助清单)及提交时与每周的持续评估,并优先引用远程 MCP 工具。
OpenRouter 推出 ori CLI:为 Claude Code 等 Harness 提供开箱即用的优化配置
OpenRouter 发布 ori CLI,用户安装并登录后即可获得针对 Claude Code、Codex、OpenCode、Hermes 等 harness 的优化配置,省去手动设置大量环境变量的麻烦。
模型效率与端侧部署成为竞争焦点
本版导读多款模型通过架构创新或量化技术实现在消费级硬件上运行:Swiftlet在Mac上运行80B模型、AirLLM在4GB GPU上运行70B模型、Soup在4GB显存微调8B模型、DeepSeek V4 Flash在单颗MI300X上高效推理。同时,GPT-5.6 Luna降价80%永久生效,反映效率提升带来的成本下降。这些进展意味着AI推理成本正快速降低,端侧部署成为现实。
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版
Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
AirLLM 实现单块 4GB GPU 运行 70B 模型推理
AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。
Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型
Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。
在单颗 AMD MI300X 上运行 DeepSeek V4 Flash
一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。
GPT-5.6 Luna降价80%永久生效
有些人显然误解了,但 GPT-5.6 Luna 降价 80% 不是临时噱头,而是永久的。效率提升不会消失。幸运的是。
AI安全与合规:监管落地与产业自律并行
本版导读欧盟《人工智能法案》透明度规则正式生效,违规最高罚1500万欧元,为AI披露设定强制性标准;工信部发布L3/L4自动驾驶安全强制性国标,2027年实施;OpenAI公布第三方评估新保障措施;Linux基金会发布SAFE指南强化智能体网络安全。这些事件表明,AI治理正从原则讨论走向具体法规与工程实践。
欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元
欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。
工信部发布首部L3/L4自动驾驶系统安全要求强制性国标,2027年7月实施
工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对L3级有条件自动驾驶和L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标GB/T 44721—2024升级而来,为自动驾驶产品明确了统一的安全准入基线。
OpenAI 说明第三方网络安全评估事件并公布新保障措施
OpenAI 就近期第三方网络安全评估事件作出说明,并公布新的保障措施以强化 AI 模型测试与评估流程。相关措施旨在提升模型评估的安全性与可靠性,确保第三方测试在受控环境下进行。
AI 领袖提出 SAFE 指南,强化智能体网络安全透明度
Linux 基金会发布共享 AI 事件交换(SAFE)指南征求意见稿,旨在将智能体网络安全事件转化为全生态共享防护。
算力军备竞赛与产业话语权争夺
本版导读Anthropic与成立仅数月的Volta签署100亿美元算力协议,凸显算力需求紧迫与交易对手风险;Palantir CEO批评前沿实验室“马克思主义”,主张企业掌控数据;EA与Paramount高管则强调AI在游戏与媒体中的务实应用。这些动态反映AI产业链上下游在算力、数据与价值分配上的博弈加剧。
Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议
Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议,约合每年 17 亿美元。Volta 估值 24 亿美元,硬件几乎全为租用:算力来自比特币矿商 Bitdeer 挪威 121MW 站点,芯片由 Nvidia 供应、Dell 组装。Anthropic 买的是交付速度,代价是承担超大规模云厂商合同从未有过的交易对手风险。
Palantir 强劲季度后,CEO Alex Karp 称 AI 行业“马克思主义”
Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图“占有所谓合作伙伴的生产资料”,带有“马克思主义色彩”。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI“废气”(提示词、编排、上下文)。
EA 首席战略官谈生成式 AI 如何进入可游玩的实时游戏世界
EA 首席战略官 Mihir Vaidya 认为,游戏是 AI 的试验场,但生成式 AI 进入游戏面临 60 帧/秒、数千玩家同步和低延迟等严苛约束,不能只追求“看起来真实”,而必须“行为正确”。他主张采用神经符号架构,在生成能力之外保留确定性与可控性,并称“控制是下一个前沿”。EA 将 AI 影响分为效率、扩展和转型三个层面,其中《模拟人生》已服务超 5 亿玩家,拥有近万亿种游玩排列组合。
Paramount CTO Phil Wiser:AI 属于史上最伟大技术趋势,但“iPhone 时刻”尚未到来
Paramount 首席技术官 Phil Wiser 认为 AI 应跻身人类史上最伟大技术趋势前五,其影响堪比火的使用。他主张等待依赖条件成熟、以“aha 时刻”引导采用,而非以技术为先导;并警告行业巨头过度分析将错失窗口期,这一窗口可能仅 5 至 10 年。Paramount 两年前已通过 Runway 向全员开放 AI 工具,并以业务成果而非 token 消耗量衡量成效。
- 2026-W39Claude Opus 5.5 发布并双榜登顶
- 2026-W38Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
- 2026-W37OpenAI 发布 GPT-6 Astra,面向专业工作场景
- 2026-W36OpenAI 发布 GPT-6 Astra:1.05M 上下文的计算机操作模型,因触及 Critical 网络安全阈值而限制访问
- 2026-W35AI安全与算力竞赛
- 2026-W34AI 基础设施与安全并进
- 2026-W33智能体走向主流
- 2026-W31AI安全与开源之争
- 2026-W30开源模型逼近前沿,安全事件引发关注
- 2026-W29智能体化加速与安全隐忧并存
- 2026-W28模型开源与部署加速,AI安全与就业分化加剧
- 2026-W27模型军备竞赛与智能体落地