封面:城市街景与相机路径示意
封面为 AI 生成的示意插图(内容由AI生成),非论文原图

不改一个参数,让视频世界模型「换个机位再看一遍」

World in World:把控制权从训练搬到推理期,西湖大学 AGI Lab 的免训练接口

论文:arXiv:2609.11548(cs.CV)· 2026-09-10 · AGI Lab, Westlake University · 项目页已公开

先问一个很朴素的问题:一段已经拍好的视频,你能不能「换个机位」再看一遍?

不是剪辑,不是补帧——而是让模型想象出:如果当时摄影机放在左侧三步、再高半米,这个画面该长什么样;街上那个人继续往前走,被墙挡住的招牌应该露出来,而之前生成过的画面,回头再看还得是同一副样子。

这个任务对视频世界模型来说几乎是「四项全能」:既要跟录制的事件保持同步,又要把内容放到指定视角,还要把新暴露的区域合理地补全,最后还得在回访旧视角时恢复曾经生成过的外观。

9 月 10 日发布在 arXiv、来自西湖大学 AGI Lab 的 World in World(WiW),做了一件很「省」的事:它不改模型、不加训练,只是在推理时给冻结的视频世界模型接了一个接口,就把上面四件事一起办成了。

论文速览

标题:World in World: Explore the World with World Models
作者:Chenxi Song*, Yanming Yang*, Chi Zhang(* 共同一作;通讯作者 Chi Zhang)
单位:AGI Lab, Westlake University(西湖大学)
编号:arXiv:2609.11548(cs.CV)· 2026-09-10
项目页:chenxi-song.github.io/worldinworld

一、它押的注:控制力不一定来自训练

过去的思路是「缺什么能力就训什么模块」:要相机控制就训一个相机控制分支,要补全就训一个补全模块,要记忆就再加一套检索。模块越堆越多,每个都要数据、要算力、要单独对齐。

WiW 反过来问:如果世界模型本身已经足够强,那缺的可能只是一个把「证据」喂给它的方式?

作者的做法是不训练任何新参数,直接在推理期构造四类视觉证据,把它们统一转成「带相机标签和时间标签的干净视觉状态」,再通过冻结模型的原生自注意力读进去。

不是给模型加能力,而是给它补上下文。

二、四类证据,和两个关键零件

四类证据分别解决一个具体缺口:

每一类证据都自带 token 级支撑度和可用时间表——什么时候有、能支撑到哪些 token,都是明确的,而不是一股脑塞进去。

两个关键零件负责把证据「送对地方」:

源视频(含已录制的事件) 源视频观测 目标视角场景投影 几何渲染 检索的历史生成状态 四类证据都带 token 级支撑度与可用时间表 对应关系路由:持久点标识 + 几何 → token 对应 冻结的因果视频模型 通过原生自注意力读取视觉证据 全部预训练参数保持不动 EWA:在同一次去噪前向里调节各路证据贡献 新视角画面 / 长时程回访 / 动作迁移
图 1 WiW 的推理期接口:四类视觉证据 → 对应关系路由 → 冻结模型自注意力 → EWA 调节(示意图由 AI 生成,内容由AI生成)

三、实验:在 6 个基线上拿下「平均分最高 + 相机误差最低」

实现上,WiW 直接挂在公开的 LingBot-World 2.0(causal-fast 检查点)上,所有预训练参数冻结,视觉证据全部在推理期构造,没有任何控制专用适配器。评测集是 DAVIS 与 OpenVid-1M,对手包括 ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything 六个方法,各自用官方实现、官方权重和推荐配置。

指标分三类:图像保真度(PSNR / SSIM / LPIPS)、VBench 七维视频质量(美感、成像、闪烁、平滑、主体一致性、背景一致性、动态程度)及其平均分 Overall、以及相机轨迹误差(平移 TransError、旋转 RotError)。

方法VBench Overall ↑平移误差 ↓旋转误差(°) ↓PSNR ↑LPIPS ↓
ReCamMaster83.8360.1242897.862615.13830.377962
TrajectoryCrafter82.9840.0908125.325419.96890.217875
WorldForge82.3840.0799614.502119.64940.218029
InSpatio-World83.4470.0823994.401120.68550.183115
UniWorld-View84.2950.0687054.195822.47350.121668
CameraAnything83.0360.1864433.186815.15830.342180
WiW(本文)85.1920.0686222.832623.15110.121664

表 1|数据来自论文 Table 1(DAVIS / OpenVid-1M)。箭头表示越大越好或越小越好。窄屏可横向滑动。

结论是:WiW 拿下七维平均分最高(85.192)、平移误差最低(0.068622)、旋转误差最低(2.8326°)、PSNR 最高(23.1511)、LPIPS 最低(0.121664)。有意思的是,它在旋转误差上并不是靠牺牲画质换来的——美感 56.556、成像 68.004 也是全部方法里最高。

消融实验把「哪块证据最要紧」问得很清楚:去掉目标视角 warping 的代价最大——旋转误差从 2.8326° 涨到 26.1158°(约 9.2 倍),平移误差从 0.068622 涨到 0.581847(约 8.5 倍);去掉源相机 Plücker 条件同样让相机误差上升。这说明精确的控制需要一个清晰的空间参照,而不是靠模型自己猜。

概念插图:从屋顶俯瞰城市街道
图 2 概念示意:同一个场景、不同的观看位置——「换个机位再看一遍」正是 WiW 要解决的问题(插图由 AI 生成,内容由AI生成)

四、它真正的价值

五、冷静看:三个限制

需要说明:以上三条是本文基于方法与实验设置做出的判断,不是作者的原话。

六、一句话总结

世界模型的能力也许早就够用了,我们缺的只是一个把「该看什么」告诉它的接口。

你觉得「冻结主干 + 推理期接口」这条路,会不会成为世界模型落地的主流姿势?欢迎在评论区聊聊。

本文基于该论文的 arXiv HTML 版正文(含方法、实验设置、Table 1 与消融)整理,未引用论文原图;数值均来自论文,判断部分由本助手给出。文献:Chenxi Song, Yanming Yang, Chi Zhang. World in World: Explore the World with World Models. arXiv:2609.11548, 2026.

编辑备注(供发布时选用,不属于正文)

  1. 不改一个参数,让视频世界模型「换个机位再看一遍」
  2. 比 SOTA 还省:一篇免训练论文,把世界模型的控制权搬到推理期
  3. 世界模型的能力早就够了,缺的只是一个接口
  4. 旋转误差 2.83° 对 26.12°:哪块证据最不能少
  5. 把控制从训练搬到推理:World in World 拆解
内容由AI生成