查看作品文字内容
封面为 AI 生成的示意插图(内容由AI生成),非论文原图 不改一个参数,让视频世界模型「换个机位再看一遍」 World in World:把控制权从训练搬到推理期,西湖大学 AGI Lab 的免训练接口 论文:arXiv:2609.11548(cs.CV)· 2026-09-10 · AGI Lab, Westlake University · 项目页已公开 先问一个很朴素的问题:一段已经拍好的视频,你能不能「换个机位」再看一遍? 不是剪辑,不是补帧——而是让模型想象出:如果当时摄影机放在左侧三步、再高半米,这个画面该长什么样;街上那个人继续往前走,被墙挡住的招牌应该露出来,而之前生成过的画面,回头再看还得是同一副样子。 这个任务对视频世界模型来说几乎是「四项全能」:既要跟录制的事件保持同步,又要把内容放到指定视角,还要把新暴露的区域合理地补全,最后还得在回访旧视角时恢复曾经生成过的外观。 9 月 10 日发布在 arXiv、来自 西湖大学 AGI Lab 的 World in World(WiW) ,做了一件很「省」的事:它 不改模型、不加训练 ,只是在推理时给冻结的视频世界模型接了一个接口,就把上面四件事一起办成了。 论文速览 标题: World in World: Explore the World with World Models 作者: Chenxi Song*, Yanming Yang*, Chi Zhang(* 共同一作;通讯作者 Chi Zhang) 单位: AGI Lab, Westlake University(西湖大学) 编号: arXiv:2609.11548 (cs.CV)· 2026-09-10 项目页: chenxi-song.github.io/worldinworld 一、它押的注:控制力不一定来自训练 过去的思路是「缺什么能力就训什么模块」:要相机控制就训一个相机控制分支,要补全就训一个补全模块,要记忆就再加一套检索。模块越堆越多,每个都要数据、要算力、要单独对齐。 WiW 反过来问: 如果世界模型本身已经足够强,那缺的可能只是一个把「证据」喂给它的方式? 作者的做法是不训练任何新参数,直接在推理期构造四类 视觉证据 ,把它们统一转成「带相机标签和时间标签的干净视觉状态」,再通过冻结模型的原生自注意力读进去。 不是给模型加能力,而是给它补上下文。 二、四类证据,和两个关键零件 四类证据分别解决一个具体缺口: 源视频观测 :锚定「这个事件当时究竟发生了什么」; 目标视角场景投影 :把观测内容摆到新视角该在的位置; 几何渲染 :专治新暴露出来的主体区域——原来没拍到的地方该长什么样; 检索到的历史生成状态 :把滚动缓存之外、更早生成过的画面捞回来,用于回访时保持一致。 每一类证据都自带 token 级支撑度 和 可用时间表 ——什么时候有、能支撑到哪些 token,都是明确的,而不是一股脑塞进去。 两个关键零件负责把证据「送对地方」: 对应关系路由(correspondence router) :把持久点标识和几何结合起来,建立 token 级对应关系,把「有支撑」的查询导向匹配的源视频 token; EWA(evidence-wise attention CFG) :在同一次去噪前向里,用注意力响应独立调节每路辅助证据的额外贡献——注意,是 同一次前向 ,不需要为引导多跑几遍去噪网络。 源视频(含已录制的事件) 源视频观测 目标视角场景投影 几何渲染 检索的历史生成状态 四类证据都带 token 级支撑度与可用时间表 对应关系路由:持久点标识 + 几何 → token 对应 冻结的因果视频模型 通过原生自注意力读取视觉证据 全部预训练参数保持不动 EWA:在同一次去噪前向里调节各路证据贡献 新视角画面 / 长时程回访 / 动作迁移 图 1 WiW 的推理期接口:四类视觉证据 → 对应关系路由 → 冻结模型自注意力 → EWA 调节(示意图由 AI 生成,内容由AI生成) 三、实验:在 6 个基线上拿下「平均分最高 + 相机误差最低」 实现上,WiW 直接挂在公开的 LingBot-World 2.0 (causal-fast 检查点)上, 所有预训练参数冻结 ,视觉证据全部在推理期构造,没有任何控制专用适配器。评测集是 DAVIS 与 OpenVid-1M,对手包括 ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything 六个方法,各自用官方实现、官方权重和推荐配置。 指标分三类:图像保真度(PSNR / SSIM / LPIPS)、VBench 七维视频质量(美感、成像、闪烁、平滑、主体一致性、背景一致性、动态程度)及其平均分 Overall、以及相机轨迹误差(平移 TransError、旋转 RotError)。 方法 VBench Overall ↑ 平移误差 ↓ 旋转误差(°) ↓ PSNR ↑ LPIPS ↓ ReCamMaster 83.836 0.124289 7.8626 15.1383 0.377962 TrajectoryCrafter 82.984 0.090812 5.3254 19.9689 0.217875 WorldForge 82.384 0.079961 4.5021 19.6494 0.218029 InSpatio-World 83.447 0.082399 4.4011 20.6855 0.183115 UniWorld-View 84.295 0.068705 4.1958 22.4735 0.121668 CameraAnything 83.036 0.186443 3.1868 15.1583 0.342180 WiW(本文) 85.192 0.068622 2.8326 23.1511 0.121664 表 1|数据来自论文 Table 1(DAVIS / OpenVid-1M)。箭头表示越大越好或越小越好。窄屏可横向滑动。 结论是:WiW 拿下 七维平均分最高(85.192) 、 平移误差最低(0.068622) 、 旋转误差最低(2.8326°) 、PSNR 最高(23.1511)、LPIPS 最低(0.121664)。有意思的是,它在旋转误差上并不是靠牺牲画质换来的——美感 56.556、成像 68.004 也是全部方法里最高。 消融实验把「哪块证据最要紧」问得很清楚: 去掉目标视角 warping 的代价最大 ——旋转误差从 2.8326° 涨到 26.1158°(约 9.2 倍),平移误差从 0.068622 涨到 0.581847(约 8.5 倍);去掉源相机 Plücker 条件同样让相机误差上升。这说明 精确的控制需要一个清晰的空间参照 ,而不是靠模型自己猜。 图 2 概念示意:同一个场景、不同的观看位置——「换个机位再看一遍」正是 WiW 要解决的问题(插图由 AI 生成,内容由AI生成) 四、它真正的价值 把控制与训练解耦。 同一个冻结主干同时支持相机控制重渲染、长时程…