展开目录
#Runway#世界模型#AI视频#实时生成#多模态#GWM Worlds 2

Runway GWM Worlds 2:能「玩」的世界模型——实时生成 720p 画面与 48kHz 声音的可交互模拟器

Runway 于 9 月 3 日发布研究预览版 GWM Worlds 2:一个能在你眼前实时生成 720p/24fps 视频与 48kHz 音频的交互式世界模型。WorldPrompt 把「世界的持久规则」与「带时间戳的事件流」分开,文本动作可以直接作用于角色或整个场景——挥剑、说话、放水淹没房间都行,世界没有时长上限。

预计阅读 8 分钟

一句话总结

Runway 在 9 月 3 日发布 GWM Worlds 2(研究预览版):这不是又一个「文生视频」模型,而是一个交互式世界模拟器——它在你操作的同时,实时生成连续的 720p/24fps 视频 + 48kHz 音频。你定义环境、角色、物理规则与氛围,然后用文本动作直接操控世界:挥剑、对话、让海水涌入房间、让沙暴来袭,甚至把控制权交给 Agent 自主行动。世界没有预设时长,可以无限延续。

数据来源

  • Runway 官方研究页《Introducing GWM Worlds 2》(2026-09-03 发布)
  • Runway CEO Cristóbal Valenzuela 发布帖(LinkedIn / X,2026-09-03)
  • Eyerys《Real-Time Worlds, Cached Frames: Architectural Evolution…》(2026-09-03 技术拆解)
  • AICrier / PulseAugur 等第三方跟踪站的摘要与评论(2026-09-06)
  • 本文场景描述与能力说明均基于上述资料整理

从「生成一段视频」到「生成一个世界」

过去两年 Runway 的公开形象是「视频生成公司」:Gen 系列模型把文字变成一段段精致的剪辑。但从 2025 年 12 月发布 GWM Worlds 开始,这家公司换了一个叙事——General World Models(通用世界模型),目标是模拟现实、实时可控、通用。

  • 第一代 GWM Worlds 已经做到「实时环境模拟」:给定静态场景,你可以在其中自由移动,几何、光照、物理保持空间一致性——转身之后,背后的东西还在那里;
  • 但它本质上是「会保持一致的探索空间」:没有声音,角色/场景级控制很弱;
  • GWM Worlds 2 补上了这两块:生成音频(48kHz,含角色语音),并且支持对主体场景的精细文本寻址。

一句话理解它的位置:GWM Worlds 1 是「能逛的世界」,GWM Worlds 2 是「能玩的世界」。

三代演进:从「生成视频」到「生成可玩的世界」

WorldPrompt:把一个世界拆成「持久层 + 事件流」

想让模型持续生成同一个连贯世界,第一步是把「什么是不变的」和「什么是变化的」分开。Runway 用 WorldPrompt 格式实现了这一点,它有两层:

  • 持久层(Persistent):构成场景的可行动主体,以及它们遵循的规则——角色是谁、环境长什么样、物理怎么运作。世界由 Genesis 提示词 + 首帧奠定,之后持续运行;
  • 事件流(Event Stream):带时间戳的文本动作序列。动作可以寻址到某个具体主体(「挥剑」),也可以作用于整个场景(「海水涌入房间」「沙暴来袭」);语音也是事件,角色要说的台词可以直接写进时间线;镜头运动则作为逐帧的独立输入持续给出。

这种「场景与事件分离」的设计,本质上是把交互式生成从「拼接片段」变成了「状态化模拟」:你输入的不是一句 prompt,而是一段持续发生的故事线。

WorldPrompt:一个世界的「持久层」与「事件流」

模型架构:把双向模型「掰」成实时自回归

GWM Worlds 2 的技术路径相当直白:先拿基础音视频生成模型按 WorldPrompt 格式微调,让它学会理解这种双层结构——但微调后的双向模型太慢,而且无法自回归生成(一次只能出一整段)。

于是 Runway 做了关键一步:把双向模型后训练成实时自回归模型。后训练之后:

  • 不再受固定时长限制,可以无限生成
  • 每一步自回归生成时,模型只看三类上下文:
    1. 全局上下文——Genesis 提示词 + 世界首帧;
    2. 当前帧输入——镜头运动 + 覆盖当前帧的文本动作;
    3. 过去已生成的帧——存放在滑动窗口缓存中,加速因果解码。

视频与音频解码器都是因果的、带缓存运行,这是它能在推理时维持 720p/24fps + 48kHz 的关键工程手段。第三方拆解(Eyerys)也指出:滑动窗口缓存是「当前帧」的加速器,但它不等于全场景地图——这正是长期一致性挑战的根源。

自回归生成:每一步只看三类上下文

它能做什么?六个直观的交互能力

GWM Worlds 2 的演示全部来自单次连续会话的实时操控,没有预渲染片段:

  1. 实时操控:只要你持续输入,世界就持续运行和扩展,没有「剪辑结束」;
  2. 动作寻址:指令不必发给某个角色——直接对场景下命令,可以触发洪水、沙暴这类全局事件;
  3. 从视频继续玩:不一定要从静态图开始,可以喂一段输入视频,环境与音频无缝过渡,之后进入实时游玩;
  4. Agent 控制:把方向盘交给 Agent——给它一个目标(「依次抵达红旗和蓝旗」),它会自己选择动作序列,一气呵成完成;
  5. 多用户协作:不同用户可以在同一场会话里扮演不同角色;
  6. 一键预设:一行文字描述世界,直接得到可玩的初始环境;常用动作还能绑定到按键,实现快速操作。

「Build as you play」是 Runway 给它的定义——边玩边构建,而不是先搭好再播放。

四个潜在应用方向

谁在用「可玩的世界」:四个方向与现实的边界

  • 交互式娱乐:游戏原型、可探索场景。输入文字即生成可游玩的世界,替代手工场景搭建的早期迭代;
  • 虚拟角色:会说话、会行动的 NPC——语音是事件流的一等公民,角色可以实时对话;
  • 机器人仿真:具身 Agent 的训练沙盒——给 Agent 一个目标,它在模拟环境里自己探索、犯错、学习;
  • 内容制作:以输入视频为世界基底,继续实时扩展与响应,把「补拍」变成「续玩」。

现实的边界:它还不是「完整的模拟器」

Runway 自己把 GWM Worlds 2 定位为研究预览(Research Preview)——没有公开 API、定价与自助接入,申请要走企业表单。第三方评测也给出了更冷静的观察:

  • 滑动窗口 ≠ 地图:模型靠最近帧缓存维持连贯,覆盖薄弱的区域(罕见动作、特殊材质、快速视角变化)容易出现「看起来最自信、其实正在偏离」的幻觉;
  • 算力负载高:24fps/720p + 音频是持续的推理负载,任何额外的物理检查、传感器都会挤占帧预算;
  • 长期一致性仍是开放问题:在「隐世界状态」被真正存储并按自己的时钟更新之前,这类世界模型会一直介于「可以进入的地方」和「可以剧透的录像」之间。

总结

  • GWM Worlds 2 把视频生成从「产出剪辑」推进到「可实时操控的状态化模拟」,720p/24fps + 48kHz 音频首次同时实时生成;
  • WorldPrompt(持久层 + 事件流)是它的控制核心,让文本动作可以寻址角色与场景,语音也成为事件的一部分;
  • 技术上,它把一个按 WorldPrompt 微调的双向音视频模型后训练成无时长上限的自回归模型,配合滑动窗口缓存实现实时解码;
  • 它仍是研究预览,且长期一致性、几何漂移、推理成本都是诚实的边界——但作为「Agent 训练沙盒」与「交互娱乐」的方向性验证,它已经足够让人兴奋。

Runway 想做的显然不只是视频工具:世界模型是通往机器人、科学发现这类「语言模型解决不了」问题的路径。GWM Worlds 2 是这条路上又一个坚实的脚印。

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。