World in World:把控制权从训练搬到推理期,西湖大学 AGI Lab 的免训练接口
先问一个很朴素的问题:一段已经拍好的视频,你能不能「换个机位」再看一遍?
不是剪辑,不是补帧——而是让模型想象出:如果当时摄影机放在左侧三步、再高半米,这个画面该长什么样;街上那个人继续往前走,被墙挡住的招牌应该露出来,而之前生成过的画面,回头再看还得是同一副样子。
这个任务对视频世界模型来说几乎是「四项全能」:既要跟录制的事件保持同步,又要把内容放到指定视角,还要把新暴露的区域合理地补全,最后还得在回访旧视角时恢复曾经生成过的外观。
9 月 10 日发布在 arXiv、来自西湖大学 AGI Lab 的 World in World(WiW),做了一件很「省」的事:它不改模型、不加训练,只是在推理时给冻结的视频世界模型接了一个接口,就把上面四件事一起办成了。
过去的思路是「缺什么能力就训什么模块」:要相机控制就训一个相机控制分支,要补全就训一个补全模块,要记忆就再加一套检索。模块越堆越多,每个都要数据、要算力、要单独对齐。
WiW 反过来问:如果世界模型本身已经足够强,那缺的可能只是一个把「证据」喂给它的方式?
作者的做法是不训练任何新参数,直接在推理期构造四类视觉证据,把它们统一转成「带相机标签和时间标签的干净视觉状态」,再通过冻结模型的原生自注意力读进去。
四类证据分别解决一个具体缺口:
每一类证据都自带 token 级支撑度和可用时间表——什么时候有、能支撑到哪些 token,都是明确的,而不是一股脑塞进去。
两个关键零件负责把证据「送对地方」:
实现上,WiW 直接挂在公开的 LingBot-World 2.0(causal-fast 检查点)上,所有预训练参数冻结,视觉证据全部在推理期构造,没有任何控制专用适配器。评测集是 DAVIS 与 OpenVid-1M,对手包括 ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything 六个方法,各自用官方实现、官方权重和推荐配置。
指标分三类:图像保真度(PSNR / SSIM / LPIPS)、VBench 七维视频质量(美感、成像、闪烁、平滑、主体一致性、背景一致性、动态程度)及其平均分 Overall、以及相机轨迹误差(平移 TransError、旋转 RotError)。
| 方法 | VBench Overall ↑ | 平移误差 ↓ | 旋转误差(°) ↓ | PSNR ↑ | LPIPS ↓ |
|---|---|---|---|---|---|
| ReCamMaster | 83.836 | 0.124289 | 7.8626 | 15.1383 | 0.377962 |
| TrajectoryCrafter | 82.984 | 0.090812 | 5.3254 | 19.9689 | 0.217875 |
| WorldForge | 82.384 | 0.079961 | 4.5021 | 19.6494 | 0.218029 |
| InSpatio-World | 83.447 | 0.082399 | 4.4011 | 20.6855 | 0.183115 |
| UniWorld-View | 84.295 | 0.068705 | 4.1958 | 22.4735 | 0.121668 |
| CameraAnything | 83.036 | 0.186443 | 3.1868 | 15.1583 | 0.342180 |
| WiW(本文) | 85.192 | 0.068622 | 2.8326 | 23.1511 | 0.121664 |
表 1|数据来自论文 Table 1(DAVIS / OpenVid-1M)。箭头表示越大越好或越小越好。窄屏可横向滑动。
结论是:WiW 拿下七维平均分最高(85.192)、平移误差最低(0.068622)、旋转误差最低(2.8326°)、PSNR 最高(23.1511)、LPIPS 最低(0.121664)。有意思的是,它在旋转误差上并不是靠牺牲画质换来的——美感 56.556、成像 68.004 也是全部方法里最高。
消融实验把「哪块证据最要紧」问得很清楚:去掉目标视角 warping 的代价最大——旋转误差从 2.8326° 涨到 26.1158°(约 9.2 倍),平移误差从 0.068622 涨到 0.581847(约 8.5 倍);去掉源相机 Plücker 条件同样让相机误差上升。这说明精确的控制需要一个清晰的空间参照,而不是靠模型自己猜。
需要说明:以上三条是本文基于方法与实验设置做出的判断,不是作者的原话。
你觉得「冻结主干 + 推理期接口」这条路,会不会成为世界模型落地的主流姿势?欢迎在评论区聊聊。