DeepMind 研究副总裁 Raia Hadsell 演讲:智能不应止步于语言
The case for intelligence beyond language
Google DeepMind 研究副总裁 Raia Hadsell 在 RAAIS 2026 演讲中主张,语言只是可建模系统之一,世界、生物、天气和机器人同样适用基础模型方法。
DeepMind 研究副总裁在 RAAIS 演讲中把世界模型与机器人串成一条主线,为读者提供了语言之外看 AI 路线的完整框架。
在今年的 RAAIS 上,Raia Hadsell 提出,Google DeepMind 二十年来学到的最重要的一点是:一个在来自复杂系统的足够数据上训练的大型模型,能够学会该系统的底层模式。语言就是这样一个系统。天气、生物、合成世界和物理运动也是,而令她感到沮丧的是,这个领域一直把语言当作全部。
Hadsell 曾在 2017 年首届 Research and Applied AI Summit 上发言,此次回归为第十届揭幕。她现在是 DeepMind 的研究副总裁,与另一位负责人共同领导一个前沿 AI 部门,该部门约有千名研究人员和工程师,分布在大约一百个项目中。她并非机器学习出身:她的本科学位是哲学。她的演讲在某种程度上是一种纠偏。
反对一次一个 token 的理由
在她演讲前不到 48 小时,DeepMind 发布了 DiffusionGemma,这是 Gemma 4 家族中的新开放模型,采用 Apache 2.0 许可证。它是一个 260 亿参数的混合专家模型,生成文本的方式与大多数语言模型不同。它不是逐个生成 token,而是借用图像和视频生成背后的方法:取一个样本,加入噪声,再学习去噪。应用于文本时,这意味着一次性生成整个块,而不是按顺序确定每个词。
这一机制带来两点好处。推理更快,因为模型不是从左到右推进。而且由于它一次写入并修订整个块,它可以双向推理并自我纠正。Hadsell 展示了它一边解题一边展示过程:第一步去噪后它给出了错误答案,第二步时它重新考虑,第三步时整个块变得一致且正确。自回归模型一旦逐个锁定 token,就无法做到这一点。她说,这就是从左到右的模型在结构上不适合数独的原因,因为数独要求看到整个网格并同时对其进行推理。扩散还带来一个副作用:自适应计算。简单问题几步就收敛,更难的问题需要更多步。在实践中,它快到能实时跟上你,以你描述需求的速度编写、运行和测试代码。不过,DiffusionGemma 是实验性发布,而非标准自回归 Gemma 4 模型的替代品,文本扩散也有其自身的取舍。DeepMind 随模型一同发布了微调代码。
更好的智能体需要更好的世界
Hadsell 将 DeepMind 的世界模型工作追溯到一个简单的理念:通过构建更好的环境,就能得到更好的智能体,这些环境要足够丰富,能够不断生成新的情境供其学习。世界模型模拟环境的动态,DeepMind 认为它们对通往 AGI 的道路至关重要,因为它们为智能体提供了无限、丰富的训练世界。
这条发展脉络从 Genie-1 开始,它于 2023 年基于 2D 平台游戏训练,2024 年发布;接着是 Genie-2,转向潜在扩散,能生成可交互的 3D 环境,但仍是合成的、非实时的;再到 Genie-3,它具备高分辨率,可跨领域工作,并能实时运行数分钟且保持一致性。你输入一段文本提示,就能得到一个可以穿行其中的世界。提示“英格兰肯特郡的一条乡间小路”,再加上雨,模型便会补全行走的人、水坑,以及一双她相当确定自己并不拥有的黄色靴子。你可以在世界运行过程中输入新的提示来改变它。
上个月,团队将 Genie 与 Street View 结合。他们取一张 Street View 的静态全景图,将其转化为一段短视频,通过提示加入冬季天气或某个角色等变化,再将其作为 Genie 世界的起始帧输入,足以让你走过金门大桥,然后潜入水下,而模型会保持大桥的几何结构不变。Hadsell 最兴奋的是教育应用:亲临历史事件现场,而不是阅读相关记载,或者跟随一个红细胞穿过循环系统,同时将模型与教科书章节绑定,用她的话说,“如果我们不想,就不会有龙跑进来。”
机器人技术仍是难点
Hadsell 研究机器人已超过十年,她直言这一领域很难,是硬件、软件与理解能力的相互作用,目标是造出能胜任人类任何任务的通用机器。DeepMind 像人体一样把问题拆分为大脑和脊柱。脊柱负责快速、精细的运动控制,这些控制不必经由大脑;大脑负责理解与规划。两个模型承担了这一分工。Gemini Robotics-ER 1.6 是一个针对空间理解和工具使用调优的 Gemini 模型,能够从杂乱场景中挑出单个物体。另一个独立的视觉-语言-动作模型接收视觉输入和推理器的指令,并输出运动控制。在与 Boston Dynamics 合作时,他们发现了需要超越空间感知的任务:让 Spot 读取一个小仪表,需要调用工具放大表盘,并进行推理来解读它。
她说,前沿在于高效学习。收集机器人数据的方式从昂贵、狭窄的遥操作,到 MuJoCo 等物理模拟器,再到直接从互联网视频中学习这一终极目标。世界模型如今就位于这条链条之中。它们能以足够高的保真度生成新颖的交互数据来训练机器人模型,Hadsell 说,你无法分辨真实的机器人日志和模拟日志。将其与跨具身学习相结合——即在一个机器人上收集的数据能迁移到其他机器人——性能提升就“免费”而来。这正是这场演讲论点自我闭合之处:同一套基础模型配方,指向世界,便成为训练机器人的引擎。
别再盯着语言了
她的结束语回到了开场时的挫败感:该领域几乎所有的注意力都集中在语言上,她认为这是一种浪费。催生当今语言模型的同一套方法可以指向远为丰富的系统:世界、机器人、生物学、天气,以及行星尺度上地球生物圈的多样性。数据已经存在;模型却几乎尚未被构建。在她看来,下一个十年的进步将贯穿这些系统,而与把聊天机器人做得更大关系甚微。
来源:Air Street Press · press.airstreet.com