视频生成模型能造画面,但不懂世界规则?语言模型来补高层认知
近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。一个真正开放的生成世界,既需要视频模型的视觉想象力,也需要能够维护知识、目标、规则、关系与因果后果的执行机制。
过去几年之中, AI生成视频的技术跑得飞无比之快, 画面越来越清楚, 动作越来越得更加连贯, 连镜头各类运动皆可进行精准控制, 许多人自以为下一步就是有能力做出“能交互的视频世界”, 但实际很快就给了个冷水——只靠从像素那里预测出下一帧的动作, 根本拿不下搞不定复杂世界的底层固有逻辑。
目标、规则、因果关系这类高层语义, 一帧画面里没法直接明确看出来。真正的问题是: 我们一直在以错误的方式教授AI理解世界。
像素预测的根本缺陷
当下的视频生成模型大多基于下一个像素预测思路开展, 给定当前画面后, 模型猜测接下来将发生什么, 这种法子在简单场景中真的管用, 比如水流也好, 火焰也好, 或是趋于平缓的镜头移动也罢。
可一旦牵扯繁杂的物体交互还有规则系统, 这个模式就失去效力。你没能从一张游戏截图中看清楚角色需要遵循哪些物理规矩, 也没法看清某个按键被按下后会引发何种连锁反应。这样的规矩存续在程序代码之中, 而非像素矩阵里面。
最核心的是, 视频属于游戏表现的终端所出的系统。此类视频纯为表层, 绝非主体。将表层视成训练向标, 就如叫函数推演一个决计没法深入破解在其中的精密子体系。
职责分离的核心设计
编码世界模型, 提出了一种全新架构思路。这个系统把职责分成了三层: 智能体负责理解和决策, 编码器负责维护世界状态, 视觉模型负责渲染画面。每一层各司其职, 层间互不干扰。
这个agent的角色类似游戏设计师乃至玩家代理。它理解用户的意图, 判断当的前情境, 当的前情境会决定要调用或修改哪些规则:当遇上新目标或复杂的事件才会做出介入的决策。这样的一种设计会让agent不需要每帧都参与计算, 这就仅让它只需要在关键时刻提供出高层指导。
code层则运行, 以频率更高, 负责处理位置更新、碰撞检测、冷却计时这类确定性任务。这些逻辑被写成为可执行代码, 能够保证世界状态的一致性和可预测性。任何agent做出的决策会被转换成具体的规则变更, 并影响后续的状态演化, 且方式为持续。
Proxy接口如何工作
系统设计里最精妙的部分在于proxy接口, agent和code维护的是结构化状态数据, 而video model接收到的是文本或者图像token, 这两类信息格式完全各不相同, 得需要一种桥梁来加以沟通。
代理者就是这座信息传输桥梁, 它从世界状态里面采集当前观测所需的容量最小的信息集合项, 它还把这些数据内容转换成为具备内在组织形态的视觉层面的说明文字;它这里的说明文本载体既承载机位参数条件的参数内容也囊括存在实体的实际位置内容涵盖面朝方向内容以及位置移动轨迹内容之类的信息;代理者而非最终画面效果呈现成果, 它取而代之构建成画面的骨架约束条件框架结构约束体系。
研究人员把这套设计原则总结为”最小充分状态”。也就是说, proxy只保留当前观察真正需要的信息, 既不多一分余量也不少一分必要, 这样既能保证好控制精度绝不打折扣, 又绝对不会让编码成本过高到让人皱眉头。proxy可以表达空间关系可清晰界定前后左右远近远近的相互关系、精准呈现运动规律好匹配物体运行的轨迹速度方向、完美传达镜头语言能体现拍摄时的角度景别运镜节奏, 但绝不包含任何纹理光泽材质、光影明暗强弱色度等毫无作用的视觉细节。
训练数据的巧妙构造
得让video模型习得对proxy的理解, 得特意设计训练过程, 数据得同时有proxy视频、结构化语义文本描述、最终的目标RGB视频这类三种形式, 这三类内容, 都得在时间维度、相机点位、实体辨识度方面维持近乎精准的协同性。
团队从同一游戏运行记录里同步提取并记牢: RGB画面、相机状态、实体身份、位置朝向近似尺度和交互状态, 再利用已知的Code系统来把对应的Proxy离线加以编译出, 整个过程无需额外录制数据, 同一份运行时记录可反复取用。
这种设计的优势在于灵活性。同一份游戏记录可以被编译成不同粒度的proxy, 覆盖不同范围的信息。研究人员还在KITTI-360数据集上展示了真实视频proxy-pair的离线构造流程, 方法的扩展性不止可以应用游戏类场景, 还可拓展到非游戏场景的真实数据。
实验效果与应用前景
实验结果让人印象十分深刻。团队只用大约5.6小时的游戏视频展开LoRA适配的情况下, 其就能够生成高质量的交互视频。更重要的是, 即使是角色形象、环境背景乃至画风都和训练数据有着明显不同, 生成的视频还能精准遵循proxy所指定的位置、轨迹及镜头运动的各个要求。
这说明proxy提供的不是固定的视觉风格, 而正是时空骨架。video model负责填充丰富的纹理、光照与局部动态细节。此类分工令系统具备极强的灵活性以及扩展性。用户能凭借改动proxy来精确定位每一帧的内容布局, 绝无必要重新训练整个模型。
真正具备开放属性视频生成领域需视觉想象力类模型及维系规则层面因果执行机制两类核心基础, 代码驱动的AI结合视频生成相关技术更是朝着此方向实现关键技术跨越, 该混合架构相比于仅单纯依赖像素预测生成模式要更为具备持续演进潜力, 请问此“代码+视频”的组合架构是否有望成为下一代领域发展主要技术及相关方向?