跳到正文
北京时间
2026 年第 27 周 · 06.29 — 07.05每周一出刊

AI 周报 · 2026 年第 27 周 · 06.29 — 07.05

由来科技

第 9 期272026 年第 27 周06.29 — 07.05
26件大事121条精选7期日报约 15 分钟读完
本期导读

模型军备竞赛与智能体落地

本周AI行业主线是模型能力的快速迭代与智能体应用的大规模落地。美团LongCat的Owl Alpha和LongCat-2.0以1.6万亿参数MoE和国产ASIC训练成为焦点,性能对标顶级模型;Anthropic发布Claude Sonnet 5,定价更低且智能体能力大幅提升。同时,智能体工具链全面扩展:Cursor推出iOS版,OpenClaw发布移动应用,Claude Desktop支持Linux,Claude Science科研工作台上线。安全与伦理事件引发关注:美军AI误炸学校、Claude Code被利用执行恶意代码。此外,国务院推进AI全学段教育,三星、SK海力士巨资扩产,黑石在日本投建AI数据中心,显示AI基础设施投资持续升温。

01

模型竞赛:国产大模型崛起与开源生态多元化

本版导读本周最引人注目的是美团LongCat系列模型的强势表现。Owl Alpha以1.6万亿参数MoE成为OpenRouter最流行模型,性能达Gemini/Opus 4.6级别,且完全在国产ASIC上训练;随后发布的LongCat-2.0进一步专为Agentic Coding设计,支持1M上下文,定价极具竞争力。与此同时,开源生态从少数中国公司扩展到全球:新浪开源3B参数的VibeThinker-3B,在数学编程基准上媲美大200倍模型;NVIDIA发布Nemotron-3-Ultra-550B;Cohere开源旗舰模型。模型小型化与专业化趋势明显,Qwen 3.6 27B被推荐为本地开发理想选择。

硅基流动 SiliconFlow一手06.30

美团 LongCat 发布旗舰模型 LongCat-2.0

美团 LongCat 推出旗舰模型 LongCat-2.0,采用 1.6T 参数 MoE 架构(约 48B 活跃参数),原生支持 1M 上下文窗口。定价为 Input Cache $0.015/1M tokens、Input $0.75/1M tokens、Output $2.95/1M tokens。模型专为 Agentic Coding 设计,包含三大技术:LSA 稀疏注意力实现高效 1M 扩展;Zero-Compute Experts 动态激活 33B–56B 参数/token,无算力浪费;MOPD 将专家分为 Agent / Reasoning / Interaction 三组,按任务门控路由。在 SWE-bench Pro 上取得 59.5 分,性能接近主流闭源模型。现已上线 SiliconFlow Day 0 服务。

The Decoder:AI News06.28

新浪开源VibeThinker-3B:推理可压缩,事实知识不能

新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200–333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型已开源。

Nathan Lambert:Interconnects一手06.29

Artifacts 22:Zyphra、Cohere 和 Poolside 正在扩展生态系统广度

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea、Photoroom 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证。Cohere 以 Apache 2.0 开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B MoE 模型,具备多模态、多语言和智能体能力。

Hacker News 热门(buzzing.cc 中文翻译)06.30

Qwen 3.6 27B 是本地开发的理想选择

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 Macbook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。另有一个 MoE 变体 35B A3B,但作者推荐 27B 版本。

02

智能体工具链全面爆发:从桌面到移动端

本版导读智能体应用进入全平台时代。Cursor推出iOS公测版,支持云端智能体远程操控;OpenClaw发布原生iOS与Android应用,将智能体装进口袋;Claude Desktop推出Linux公测版,覆盖更多开发者。Anthropic推出Claude apps gateway,让企业在Bedrock和Google Cloud上运行Claude Code,并发布Claude Science科研工作台,提供60余项预配置技能。此外,X推出hosted X MCP,AI智能体可直接调用X API;Google发布ADK Go 2.0,支持多智能体编排。这些产品表明智能体正从单一工具演变为跨平台、跨领域的操作系统级能力。

Cursor Blog一手06.29

从任何地点构建——Cursor for iOS 公测版发布

Cursor 推出 iOS 原生公测版,所有付费计划可用。开发者可在手机上启动始终在线的云端智能体,或远程操控电脑端智能体。支持语音输入、斜杠命令和选择前沿模型。智能体运行后,锁屏 Live Activities 和推送通知实时更新状态,完成或需要输入时提醒。云端智能体在隔离虚拟机中运行,可自动迭代生成合并就绪的 PR,并输出演示、截图和日志。本地与云端智能体支持双向切换。移动端 Composer 2.5 享受 75% 折扣,优惠至 2026 年 7 月 5 日。

OpenClaw一手06.30

OpenClaw 发布原生 iOS 与 Android 应用

OpenClaw 现已登陆 iOS 和 Android 🦞 📱 原生移动应用,终于来了 💬 智能体装进口袋 🔔 频道、任务、回复,随时处理 用你的大拇指,在任何地方运行智能体。 iOS: https://apps.apple.com/us/app/openclaw-ai-that-does-things/id6780396132 Android: https://play.google.com/store/apps/details?id=ai.openclaw.app

Claude Devs一手07.01

Claude Desktop 推出 Linux 公测版

Claude Desktop 现已在 Linux(Ubuntu 和 Debian)上推出测试版。 除了浏览器和终端,你现在可以在所有付费计划中获得一流的桌面体验,包括 Claude Code、Claude Cowork 和聊天。

Claude:Blog一手06.29

为 Amazon Bedrock 和 Google Cloud 推出的 Claude apps gateway

Anthropic 今日推出 Claude apps gateway,一个自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。它作为单个无状态容器部署于 Linux,后端使用 PostgreSQL,提供企业级 SSO 登录(通过 OIDC 对接 Google Workspace、Microsoft Entra ID、Okta 等)、集中策略管理、角色权限、路由(支持故障转移)以及按日/周/月、按组织/群组/用户的消费上限。遥测数据通过 OTLP 发送至用户配置的收集器。gateway 不会向 Anthropic 发送推理流量或使用数据(除非配置使用 Claude API)。即日起可用。

Anthropic:Newsroom一手06.30

Claude Science 科研工作台正式上线

Anthropic 推出 AI 科研工作台 Claude Science,整合常用工具与计算资源,支持从文献分析到多步骤研究的全流程。提供超 60 项预配置技能与连接器,覆盖基因组学、单细胞、蛋白质组学、结构生物学、化学信息学等领域;可在macOS/Linux本地运行,或通过SSH/HPC远程使用。生成含代码和环境的可审计成果(3D蛋白质结构、基因组浏览器轨迹等),内置reviewer agent自动检查引用与计算错误。通过NVIDIA BioNeMo接入Evo 2、Boltz-2等模型,也支持连接自有模型与管道。今日以beta版面向Claude Pro、Max、Team和Enterprise用户开放。

X(Twitter)发布 hosted X MCP,AI 智能体可直连 X API · 该内容已按来源方要求下架或调整展示方式。

Google Developers Blog一手07.01

ADK Go 2.0 发布:构建可靠的多智能体应用,新增基于图的工作流引擎、人工参与循环与动态编排

Agent Development Kit (ADK) for Go 2.0 发布,引入了一类基于图的工作流引擎,用于组合复杂多智能体应用。新版本内置人工参与循环(HITL)编排、使用纯 Go 代码的动态执行、以及指数退避重试等自动弹性特性。统一执行模型后,单智能体应用与复杂图均运行在同一运行时上,简化了遥测与状态持久化。

03

安全与伦理:AI误炸、恶意代码与隐私争议

本版导读本周多起事件凸显AI安全与伦理的紧迫性。美军首次大规模使用AI选择目标,却因情报系统脱节误炸伊朗学校,导致约120名儿童死亡,暴露AI在军事决策中的致命风险。安全研究发现,Claude Code打开GitHub仓库时可能执行隐藏恶意代码,攻击者可获完全控制,提示AI编码工具的安全设计缺陷。Meta秘密测试竞品AI安全性的方式引发争议:承包商假扮未成年向ChatGPT等发送数万条危机提示,被测试公司不知情。这些事件表明,AI的部署需要更严格的验证、透明度和伦理审查。

The Decoder:AI News06.29

美军用AI选目标却误炸伊朗学校,Anthropic Claude嵌入Palantir系统首日建议约1000目标

美军在打击伊朗时首次大规模使用AI选择目标(Anthropic的Claude模型嵌入Palantir的Maven Smart System,首日建议约1000个目标),但对一所学校的导弹袭击导致约120名儿童死亡。调查发现,情报分析师早在2019年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库MIDB,信息从未送达指挥官。MIDB建于1980年代,依赖手动输入,替代系统MARS多年延迟。五角大楼事后宣布推出agentic AI initiative。Project Maven创建人Jack Shanahan批评目标验证不力不可原谅。

The Decoder:AI News06.29

Claude Code 打开 GitHub 仓库即执行隐藏恶意代码,攻击者可获完全控制

安全研究人员在 Mozilla 的 GenAI 漏洞赏金平台 0DIN 发现新攻击向量。一个看似正常的 GitHub 仓库包含 setup 脚本,该脚本运行时从 DNS 条目拉取命令并执行,恶意代码从未存在于仓库中,对扫描器、代码审查和 AI 智能体不可见。开发者使用 Claude Code 等 AI 编码工具打开该仓库时,Claude Code 在设置过程中遇到常规错误消息后自动运行该脚本,打开反向 shell,攻击者可窃取 API 密钥和登录凭据并维持持久访问。研究人员建议 AI 智能体应在运行前显示 setup 脚本内容,开发者应将第三方仓库的 setup 说明视为不受信任代码。

The Decoder:AI News06.30

Meta秘密测试ChatGPT等竞品:承包商假扮未成年发送数万条危机提示

Meta通过承包商Covelen发起代号“Cannes”的项目,雇佣数百人假扮未成年人,向ChatGPT、Gemini和Character.AI发送关于自杀、自残、饮食障碍和毒品的敏感提示,并将回复录入表格。2025年8月一轮测试中发送了超过4.5万条提示。Meta称这是行业标准安全测试,未将数据用于训练自家模型。被测试公司不知情——Character.AI表示违反其服务条款,OpenAI已调查,Google称未批准。青少年使用AI聊天机器人引发的担忧持续,此前已有用户自杀事件。

04

基础设施投资:芯片扩产与数据中心建设

本版导读AI需求持续推动基础设施投资。三星和SK海力士计划投资5900亿美元扩产芯片,控制全球近80%高带宽内存市场,内存价格预计持续上涨。SK集团宣布到2035年建设15GW AI数据中心,总投资1000万亿韩元。黑石计划未来3-5年在日本投资300亿美元建设AI数据中心,并联合成立AI XPV平台。然而,NVIDIA的Rubin Ultra因制造问题被取消,显示硬件迭代的挑战。这些投资表明,AI算力需求远未见顶,但供应链瓶颈和成本压力正在显现。

The Decoder:AI News06.29

三星和SK海力士计划投资5900亿美元扩产芯片,AI需求推高内存价格

在韩国政府支持下,三星和SK海力士计划投入5900亿美元扩大芯片产能,包括800万亿韩元新建四座工厂、81万亿韩元建封装中心,以及未来15年30万亿韩元用于研发下一代芯片。AI数据中心需求是主要驱动力。Jefferies预测,2026年Q3内存价格将上涨40%至50%,Q4再涨30%至40%,2027年继续上涨40%至45%,到2028年新产能仅上线15%至20%才可能缓解。两家公司合计控制全球近80%的高带宽内存芯片市场。内存涨价已推高消费电子产品成本,苹果已上调Mac和MacBook售价。

IT之家06.29

SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元

SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外,SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达 1100 万亿韩元(约 4.84 万亿元人民币)。

IT之家06.30

黑石未来3~5年拟投300亿美元在日本建AI数据中心,联合成立AI XPV平台

黑石计划未来3~5年在日本AI数据中心领域投资300亿美元,此前的500MW基础上新增超1GW容量。黑石总裁认为AI投资仍处早期,真正风险是算力短缺而非基建泡沫;谷歌、亚马逊是英伟达潜在挑战者。此外,黑石、阿波罗、博通本月9日成立AI XPV平台,目标2028年向OpenAI、Anthropic等提供超20GW算力,首期350亿美元支持Anthropic在Fluidstack数据中心部署1GW基础设施。

SemiAnalysis06.30

Rubin Ultra取消,新版尺寸性能减半

有意思:在GTC 2026宣布Rubin Ultra仅3个月后,原4-die Rubin Ultra因制造执行问题被取消。新的“Rubin Ultra”尺寸减半,实际性能约为原版的一半。1/4🧵

05

AI就业与技能:替代与创造并存

本版导读AI对就业的影响呈现复杂图景。截至2026年5月,AI相关裁员近9万个,但高AI投入企业总员工数增长10.2%,入门级岗位增长12%,表明AI在资源充裕的企业中成为扩张工具。英国职场AI采用率一年内从34%升至73%,但仅15%的深度用户获得晋升加薪优势。国务院印发规划推进AI全学段教育,目标2030年高质量教育体系基本建成。专业化趋势不可避免,通用模型在特定任务上不如专门系统。AI正重塑劳动力市场,但技能鸿沟和资源分配不均可能加剧不平等。

TechCrunch:AI06.30

AI就业争论变得更加混乱

截至2026年5月,AI相关裁员接近9万个,预计未来五年美国最多15%的岗位将被AI替代。但Ramp与Revelio Labs对近22,000家公司的报告发现,高AI投入企业(前三个月人均月均支出30美元)总员工数增长10.2%,入门级岗位增长12%。报告认为AI并非普遍导致岗位消失,而是在资源充裕的科技企业里成为扩张工具——降低工程、销售、客服等职能的生产成本,从而推动整体增员。但仅购买订阅而未持续投入的公司未见人头增长,可能加剧企业间的资源鸿沟。

Google Blog:AI一手06.30

英国职场AI采用率翻倍,仅15%“AI先锋”获得晋升加薪优势

Google UK与Public First研究发现,英国职场AI采用率一年内从34%升至73%,但呈不均衡曲线。仅15%的“AI Trailblazers”(深度用户)晋升概率高84%、绩效高88%、加薪概率高55%,每周节省近8小时。其余85%仍处于旁观、实验或实践阶段。阻碍因素包括:一次即弃的提示词习惯、搜索框思维、缺乏明确使用许可。Public First推出AI技能测验,Google的“AI Works for Britain”计划支持2030年前培训1000万工人AI技能的目标。

IT之家06.29

国务院印发《教育发展“十五五”规划》,推进人工智能全学段教育

国务院日前印发《教育发展“十五五”规划》,要求推进人工智能全学段教育,提升学生人工智能素养及提出问题、解决问题的能力。规划明确完善科学教育体系,强化科技教育与人文教育协同,加强青少年科学素养、批判性思维和创新能力培养。同时实施学生体质强健计划、心理健康促进行动,加大拔尖创新人才自主培养力度,推动学科交叉融合,扩大优质本科招生规模。目标到2030年高质量教育体系基本建成。

Hugging Face:Blog一手06.30

专业化为何不可避免

Dharma AI 团队引述 Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 于 2026 年发表的论文,从优化理论、生物学和竞争市场论证专业化的必然性。Wolpert-Macready 无免费午餐定理表明,通用优化算法在所有问题上平均表现相同,实际优势来自专门适配;有限资源下,集中资源于有限任务集的系统必然优于平均分配的通用系统。生物学中的特化权衡与市场竞争也指向同一结论:最大化适应性在于精确拟合特定环境,而非追求通用性。

06

前沿研究:脑机接口、数学证明与可解释性

本版导读本周多项研究突破值得关注。Meta发布Brain2Qwerty v2,实现非侵入式实时句子解码,有望帮助无法沟通的人群。AI用prover-verifier LLM循环攻克9个未解数学难题,展示AI在科学发现中的潜力。Anthropic提出回合平均稀疏自编码器,提升模型可解释性。OpenAI发布GeneBench-Pro,评估AI在计算生物学中的判断能力。这些研究推动AI从语言处理向更广泛的科学和认知领域扩展。

AI at Meta一手06.29

Meta发布Brain2Qwerty v2:非侵入式实时句子解码

Meta公布Brain2Qwerty v2,这是非侵入式脑电信号解码研究的最新里程碑。基于当天发表在《Nature》的v1,v2是性能最高的端到端管道,能从原始脑信号实时解码句子。其从字符级性能提升至解码单词和语义,提高整体沟通准确性。该研究有望帮助数百万因脑损伤或疾病无法沟通的人群。

AI 用 prover-verifier LLM 循环攻克 9 个未解数学难题 · 该内容已按来源方要求下架或调整展示方式。

Anthropic:Transformer Circuits(可解释性研究)一手07.01

Anthropic 提出回合平均稀疏自编码器 (Turn-Averaged SAE)

Anthropic 对每个对话回合所有 token 的残差流取平均后训练 SAE,大幅减少需解析的特征数量。实验使用 Qwen-2.5-7B-Instruct 和 LMSYS-Chat-1M 数据集,回合平均特征更关注模型行为的高层特性(如错误答案),每 token SAE 侧重数值推理等细节。Sonnet 4.6 评测显示:回合平均 SAE 在从 10 个回合中唯一识别目标(区分度)为 74%,低于每 token SAE 的 95%;但在全面描述回合(覆盖度)上以 77% 胜出。该方法可外推至训练平均长度 150 倍长的回合。

OpenAI:官网动态(RSS · 排除企业/客户案例)一手06.30

OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试

OpenAI 发布 GeneBench-Pro,用于评估 AI 智能体在计算生物学中处理模糊性和做出判断性分析的能力。该基准包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集和实验背景,要求模型探索数据、选择分析路径并迭代实验。采用合成数据构建,已知完整因果结构。82 个问题已由外部领域专家审核确认其现实性。

往期 AI 周报
(本期完)

由来科技 周报由编辑系统根据公开来源自动综合,每条均附原文 · 往期周报