视频生成只会装模作样?不懂因果的世界,全是假动作
- 时间:
- 浏览:94
- 来源:深圳市硝子荼弥网络科技有限公司
视频世界的新玩法来了
AI生成视频近来持续走红爆发, 但大伙可能极少忽略了一个潜藏关键问题——游戏载体完全能脱离和并非"可真正交互世界"的关联联结。前者只能是固定程序渲染完成后的表层像素薄投影, 后者才是真正的逻辑全面模拟体系。
最近一项研究提出了Code World Model的概念, 把世界运行的规则和视频生成的能力重新分工。简单说, 就是让代码决定发生什么, 让视频模型决定看起来怎么样。
从游戏数据中找答案
现阶段可以促使AI研习“世界如何运行”的十分丰沛数据素材源头, 依旧是电竞游戏以及程序模拟器。这类系统业已嵌入了物体力学规则、物体接触侦测和人机互动逻辑。
研究团队发现, 与其让视频模型从零开始反向猜测整个世界运行机制, 不如直接让它只负责针对人眼视觉直接呈现, 这样既能节省所需空间内的全部总算力, 也能大幅度甚至超大量级提高生成出来各种具体结果的精准管控可控性与合规安全性。
代码负责逻辑,模型负责画面
Code World Model的核心思路是做职责拆分。专门理解玩家意图处理规则推理执行世界状态更新的Coding agent, 它不需要关关心察图的画面长成什怎样么样。
Video model则专精于生成极致精细的视觉细节;它接收被称作proxy的这款特殊结构化条件输入, 涵盖相机位置、目标实体轨迹、完整场景布局等各类参数内容, 接着才渲染生成出最终的成片画面。
Proxy是关键的桥梁
让代码状态与视频模型对接非常不容易。这两者彼此间的接口就是借助proxy来实现的。proxy本质上归属于一个轻量级的编译器, 把世界状态转化成视频模型可理解的条件。
proxy这个包含了人物位置、朝向、尺度、轨迹、遮挡关系等时空信息的工具, 提供了骨架的确定性, 视频模型的血肉在这个骨架上被填充。
训练过程并不复杂
实际训练时, 研究团队从游戏录制里提取RGB视频, 还同时记录相机状态、实体身份信息、位置信息以及朝向信息之类的各类信息, 这些各类信息经由代码编译成为proxy视频后, 再与这段原始RGB视频配对使用。
使用MiniMax-H3的Ref2VA作为视频模型基础, 仅对全部50个注意力transformer块实行rank值为128的LoRA适配, 参与训练的参数量约为五点九六亿次训练, 全程兼具轻负高效两重特质。
效果出乎意料的好
实验结果显示, 只用约5.6小时的游戏视频予以后续适配模型就能在不同角色、环境与不同风格情况下, 严格遵循proxy指定的位置指定的轨迹和指定的相机运动。
这意味着proxy来提供的是时空骨架, 而视觉的想象尽由视频模型负质。相同的一套控制条件是可以对应完完全全不同的画风和各不相同的角色外表, 成功实现了灵活性和能被控的平衡。
你觉着未来“可交互视频世界”会抢先在游戏领域普及落地, 还是先一步在影视制作领域内部真正实现? 渴望在评论区看看你的各自观点!
猜你喜欢