一句话总结
Runway 在 9 月 3 日发布 GWM Worlds 2(研究预览版):这不是又一个「文生视频」模型,而是一个交互式世界模拟器——它在你操作的同时,实时生成连续的 720p/24fps 视频 + 48kHz 音频。你定义环境、角色、物理规则与氛围,然后用文本动作直接操控世界:挥剑、对话、让海水涌入房间、让沙暴来袭,甚至把控制权交给 Agent 自主行动。世界没有预设时长,可以无限延续。
数据来源
- Runway 官方研究页《Introducing GWM Worlds 2》(2026-09-03 发布)
- Runway CEO Cristóbal Valenzuela 发布帖(LinkedIn / X,2026-09-03)
- Eyerys《Real-Time Worlds, Cached Frames: Architectural Evolution…》(2026-09-03 技术拆解)
- AICrier / PulseAugur 等第三方跟踪站的摘要与评论(2026-09-06)
- 本文场景描述与能力说明均基于上述资料整理
从「生成一段视频」到「生成一个世界」
过去两年 Runway 的公开形象是「视频生成公司」:Gen 系列模型把文字变成一段段精致的剪辑。但从 2025 年 12 月发布 GWM Worlds 开始,这家公司换了一个叙事——General World Models(通用世界模型),目标是模拟现实、实时可控、通用。
- 第一代 GWM Worlds 已经做到「实时环境模拟」:给定静态场景,你可以在其中自由移动,几何、光照、物理保持空间一致性——转身之后,背后的东西还在那里;
- 但它本质上是「会保持一致的探索空间」:没有声音,角色/场景级控制很弱;
- GWM Worlds 2 补上了这两块:生成音频(48kHz,含角色语音),并且支持对主体与场景的精细文本寻址。
一句话理解它的位置:GWM Worlds 1 是「能逛的世界」,GWM Worlds 2 是「能玩的世界」。

WorldPrompt:把一个世界拆成「持久层 + 事件流」
想让模型持续生成同一个连贯世界,第一步是把「什么是不变的」和「什么是变化的」分开。Runway 用 WorldPrompt 格式实现了这一点,它有两层:
- 持久层(Persistent):构成场景的可行动主体,以及它们遵循的规则——角色是谁、环境长什么样、物理怎么运作。世界由 Genesis 提示词 + 首帧奠定,之后持续运行;
- 事件流(Event Stream):带时间戳的文本动作序列。动作可以寻址到某个具体主体(「挥剑」),也可以作用于整个场景(「海水涌入房间」「沙暴来袭」);语音也是事件,角色要说的台词可以直接写进时间线;镜头运动则作为逐帧的独立输入持续给出。
这种「场景与事件分离」的设计,本质上是把交互式生成从「拼接片段」变成了「状态化模拟」:你输入的不是一句 prompt,而是一段持续发生的故事线。

模型架构:把双向模型「掰」成实时自回归
GWM Worlds 2 的技术路径相当直白:先拿基础音视频生成模型按 WorldPrompt 格式微调,让它学会理解这种双层结构——但微调后的双向模型太慢,而且无法自回归生成(一次只能出一整段)。
于是 Runway 做了关键一步:把双向模型后训练成实时自回归模型。后训练之后:
- 不再受固定时长限制,可以无限生成;
- 每一步自回归生成时,模型只看三类上下文:
- 全局上下文——Genesis 提示词 + 世界首帧;
- 当前帧输入——镜头运动 + 覆盖当前帧的文本动作;
- 过去已生成的帧——存放在滑动窗口缓存中,加速因果解码。
视频与音频解码器都是因果的、带缓存运行,这是它能在推理时维持 720p/24fps + 48kHz 的关键工程手段。第三方拆解(Eyerys)也指出:滑动窗口缓存是「当前帧」的加速器,但它不等于全场景地图——这正是长期一致性挑战的根源。

它能做什么?六个直观的交互能力
GWM Worlds 2 的演示全部来自单次连续会话的实时操控,没有预渲染片段:
- 实时操控:只要你持续输入,世界就持续运行和扩展,没有「剪辑结束」;
- 动作寻址:指令不必发给某个角色——直接对场景下命令,可以触发洪水、沙暴这类全局事件;
- 从视频继续玩:不一定要从静态图开始,可以喂一段输入视频,环境与音频无缝过渡,之后进入实时游玩;
- Agent 控制:把方向盘交给 Agent——给它一个目标(「依次抵达红旗和蓝旗」),它会自己选择动作序列,一气呵成完成;
- 多用户协作:不同用户可以在同一场会话里扮演不同角色;
- 一键预设:一行文字描述世界,直接得到可玩的初始环境;常用动作还能绑定到按键,实现快速操作。
「Build as you play」是 Runway 给它的定义——边玩边构建,而不是先搭好再播放。
四个潜在应用方向

- 交互式娱乐:游戏原型、可探索场景。输入文字即生成可游玩的世界,替代手工场景搭建的早期迭代;
- 虚拟角色:会说话、会行动的 NPC——语音是事件流的一等公民,角色可以实时对话;
- 机器人仿真:具身 Agent 的训练沙盒——给 Agent 一个目标,它在模拟环境里自己探索、犯错、学习;
- 内容制作:以输入视频为世界基底,继续实时扩展与响应,把「补拍」变成「续玩」。
现实的边界:它还不是「完整的模拟器」
Runway 自己把 GWM Worlds 2 定位为研究预览(Research Preview)——没有公开 API、定价与自助接入,申请要走企业表单。第三方评测也给出了更冷静的观察:
- 滑动窗口 ≠ 地图:模型靠最近帧缓存维持连贯,覆盖薄弱的区域(罕见动作、特殊材质、快速视角变化)容易出现「看起来最自信、其实正在偏离」的幻觉;
- 算力负载高:24fps/720p + 音频是持续的推理负载,任何额外的物理检查、传感器都会挤占帧预算;
- 长期一致性仍是开放问题:在「隐世界状态」被真正存储并按自己的时钟更新之前,这类世界模型会一直介于「可以进入的地方」和「可以剧透的录像」之间。
总结
- GWM Worlds 2 把视频生成从「产出剪辑」推进到「可实时操控的状态化模拟」,720p/24fps + 48kHz 音频首次同时实时生成;
- WorldPrompt(持久层 + 事件流)是它的控制核心,让文本动作可以寻址角色与场景,语音也成为事件的一部分;
- 技术上,它把一个按 WorldPrompt 微调的双向音视频模型后训练成无时长上限的自回归模型,配合滑动窗口缓存实现实时解码;
- 它仍是研究预览,且长期一致性、几何漂移、推理成本都是诚实的边界——但作为「Agent 训练沙盒」与「交互娱乐」的方向性验证,它已经足够让人兴奋。
Runway 想做的显然不只是视频工具:世界模型是通往机器人、科学发现这类「语言模型解决不了」问题的路径。GWM Worlds 2 是这条路上又一个坚实的脚印。