Odyssey 联合创始人 Jeff Hawke 谈世界模型:仍处 GPT-2 时代
From driving the world to dreaming it
Odyssey 联合创始人兼 CTO Jeff Hawke 在 RAAIS 演讲中阐述世界模型路线,主张直接从视觉和音频学习世界,目标是打造“世界模型的 GPT-3”。
访谈厘清了世界模型与空间智能等概念的边界,并给出四条研究路线和GPT-2阶段的行业定位,信息密度较高。
Jeff Hawke 认为 AI 缺少一种智能形式。在他看来,前沿研究建立在两大宏观赌注之上:AI 能否自我引导提升智能——这是那些追求递归自我改进的实验室所押的注——或者,用他的话说,能否“直接从世界学习”。Odyssey 选择了第二条路,Hawke 是这家公司的联合创始人兼 CTO。其目标是按照世界被看到和被作用的方式来建模——“一种比语言更丰富的表征”,由原始的视觉和声音构建,而非来自人类已经写下的概念。
这曾经很难推销。他说,当 Odyssey 进行种子轮融资时,“基本上没人理解世界模型”,说服别人是一场“艰苦的战斗”。此后,这一领域在他脚下发生了变化:论点在 2025 年 11 月前后翻转,资金和研究人员大量涌入,而据他统计,在 NeurIPS 2025 上,世界模型是该领域第一或第二大主题。Hawke 是从自动驾驶转向这个问题的,他曾是 Wayve 的创始工程师,教汽车进行端到端驾驶——他说,这是前沿 AI 真正接受现实检验的少数领域之一。
并非每个世界模型都是世界模型
这个术语足够宽泛,几乎可以指任何东西,所以 Hawke 谨慎地对其进行了界定。Odyssey 使用的是从基于模型的强化学习中继承来的精确含义:一个学习到的转移动力学模型,即 David Ha 和 Jürgen Schmidhuber 在 2018 年论文“World Models”中所命名的那种东西。通俗地说,就是一个学习世界如何演化,然后根据你输入的动作,一次一步地采样可能未来的模型。这不同于“空间智能”,后者对场景的外观和结构建模(World Labs 等公司所押注的方向);也不同于行为模型,即自动驾驶汽车或机器人的决策大脑,Hawke 认为后者更适合这样命名;也不同于一些研究者认为已经潜藏在 LLM 内部的“代理世界模型”。Odyssey 的版本是他所称的通用神经模拟器:一条可交互的像素流,对物理建模,你可以与它交谈,它也会回应你,而且你可以伸手进去改变它。“关于这对未来产品意味着什么,我有很多问题,”他承认道。“我几乎没有好的答案。”
通用性胜出
两条原则指导着 Odyssey 的构建方向,二者都来自自动驾驶。第一,端到端学习,一个仅从数据训练的简单模型,“几乎总是会赢”。这在 2018 年是不受欢迎的观点,如今在自动驾驶和语言领域都已成为默认做法。第二,“通用性胜出”:为单一垂直领域构建的狭窄模型很少能长期保持领先。例如,他无法指出持久存在的法律专用基础模型,因为“Claude 就是变得更强了”。由此而来的雄心毫不含蓄。Odyssey 想打造“世界模型中的 GPT-3”——即某个类别的模型不再只是研究演示、并开始产生真实商业需求的 InstructGPT 式时刻。Odyssey 的研究分为四个问题,每个问题都有一个已发布的模型与之对应。
持续运行的像素……还带声音!
基础是自回归交互式像素,体现在 Odyssey-2 中。标准视频模型返回一段固定片段;而它则实时逐帧流式生成,这要难得多,因为模型按序列生成时误差会不断累积。它还是交互式的,能在流式生成中途接收文本提示并据此调整。规模扩展以通常的方式带来帮助——从十亿参数跃升到一百五十亿参数提升了基准表现——但真正的难点在于让交互保持开放式,而不是将其收窄到单一领域。
2026 年 5 月,Odyssey 发布了 Starchild-1,名字取自《2001:太空漫游》,它在一个连贯的流中联合生成像素与音频,而不是把声音配到已完成的视频上。Hawke 说,这比预期更难;据他所知,还没有其他人公开展示过。障碍在于时间尺度的冲突——预测出的单个视频帧只覆盖音频的“半个音素”——因此要让两者保持连贯,需要一种在两种时钟上同时运行的自定义 KV 缓存设计。
共享状态,而非拼接视频
第三个问题是多人:跨世界模型的共享状态,这对在一处环境中协同工作的一队机器人来说,与对游戏同样重要。Odyssey 的 Agora-1 展示了这一点,Hawke 还进行了现场演示。观众把手机对准二维码,玩了一局完全生成的《黄金眼》,由“大概在西班牙”的 H100 上串流运行。在底层,它借用了游戏引擎中渲染与模拟的分离,只不过这两部分都是学习得到的——一个神经模拟器和一个神经渲染器,一起训练。他指出,人们曾说过多人世界模型“不可能”,“而我们觉得值得去证伪。”
通过被破坏来学习
第四条线索承载了演讲中最新的想法。几乎所有把智能体与世界模型配对的人,都是用智能体在模型内部变得更聪明。Odyssey 的 PROWL 则反其道而行:它用强化学习智能体来改进模型本身。其推理是“垃圾进,垃圾出”——“你的智能体永远不会真正优于你所学环境模型的质量”——然而 Hawke 认为,几乎没有人费心去修复模型,而不是修复智能体。PROWL 把一个智能体放进学习得到的 Minecraft 版本中,并奖励它寻找世界模型的失效模式,然后把这些失败纳入一个课程来修补它们。麻烦在于,强化学习非常擅长作弊:如果不加约束,智能体会“待在原地,以极高速度旋转镜头”来拖延模型的学习,因此团队加入了一个 KL“牵引绳”,让它贴近一个真正在玩游戏的智能体。回报是基础模型性能的明显提升——一个通过被系统性地破坏而变得更好的世界模型。
仍处于 GPT-2 时代
尽管如此,Hawke 对这项工作的定位始终保持着清醒的纪律。他说,世界模型正处于“GPT-2 时代”:即 ChatGPT 之前的阶段,输出已经看起来很有前景,第一批商业实验正在形成——他点名提到了 Jasper,那家早期的 GPT-3 文案初创公司——但大规模普及仍在前面。这就是今天与他想要构建的“世界模型的 GPT-3”之间的差距。这种诚实也延伸到了局限上。当被台下问及世界模型是否必须编码广义相对论和量子力学时,他拒绝了这个诱饵。视觉数据“在体量上遥遥领先”,也是正确的起点,而这些模型在传统模拟难以应对的地方证明了自己的价值:对于湍流的精确定义,“用 CFD”;对于人群、接触、场景的杂乱纹理,神经模拟器胜出。生物学和更难的物理学是需要的,但他承认,还很稚嫩。
经济账比硬件所暗示的要温和。多人演示运行在单块 H100 上,“我们就算它每小时 1.50 美元”——这已经接近 Netflix 订阅的价格,按他的估算,每月 30 美元可以买到十到十五小时的生成式游玩时间。
按他的说法,这件事的走向是融合:当视觉世界模型开始处理音频,并最终处理文本时,它会与从另一个方向通过 VLM 到来的语言模型相遇,而在某个时刻,两者会合并。这些都没有解决,他也坦率地承认,目前没有人知道该怎么做。但方向已经确定,市场也已经追上了这个曾经需要艰难种子轮路演的论点。2026 年 6 月 17 日,在 RAAIS 之后几天,Odyssey 以 14.5 亿美元估值完成了 3.1 亿美元的 B 轮融资,由 Natural Capital 领投,Amazon、AMD Ventures 和 GV 参投。Air Street 在 2024 年投资了该公司的种子轮,押注直接学习世界将成为一类独立的模型。GPT-2 时代不会持续太久。
来源:Air Street Press · press.airstreet.com