查看作品文字内容
封面为 AI 生成的示意插图(内容由AI生成),非论文原图 给一张图,让 AI 递归地「写」出一座可执行的城市 Recursive Code World Models:佐治亚理工把「怎么造一个复杂世界」变成了递归流程 论文:arXiv:2609.11499(cs.CV)· 2026-09-10 · Georgia Institute of Technology · 21 页 / 11 图 给 AI 一张俯瞰的城市插画,让它「造」出这座城市——不是生成一张新图,而是产出一份 可执行、可编辑的 3D 场景代码 。 听起来像是把大象塞进冰箱:一次生成整座城,细节必然糊;分块生成再拼起来,接缝和比例又会崩。 9 月 10 日发布在 arXiv、来自 佐治亚理工学院 的 Recursive Code World Models(RCWM) ,给出的解法出人意料地「像人干活」: 先立整体,哪里没解决就递归下去解决,解决完再回到整体修一遍关系。 论文速览 标题: Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs 作者: Zhiqi Li(通讯), Yuxuan Liao, Bo Zhu · 单位:Georgia Institute of Technology 编号: arXiv:2609.11499 (cs.CV)· 2026-09-10 · 21 页 / 11 图 一、代码世界模型的真问题不是「表示」,而是「怎么造」 「代码世界模型」的思路已经很成熟:把世界表示成一段可执行程序,程序跑起来就是世界。但这个表示本身并不回答一个工程问题—— 面对一个复杂场景,你该怎么把它一步步构造出来? 整景一次性生成,细粒度结构(单栋小楼、树丛、岸线)必然丢失;拆开单独生成再拼装,共享误差和空间关系又没人负责。RCWM 的答案是把「怎么造」也形式化:用一个 会递归调用自己的构造求解器 。 二、三步一个循环:整体—局部—整体 RCWM 把可执行世界写成 递归场景程序(RSP) ——组合式的场景代码;配套的求解器每次被调用,都执行同一套完整流程: 建立整体 :先给出整景的初版程序,确定全局布局与主要关系; 递归重建未解析的部分 :把选中的子区域交给自己的求解调用,让它们跑一遍同样的完整流程; 回到整体精修组合 :父级回访,处理局部精修之后才浮现的边界问题、空间关系和共享误差。 这个 global–local–global 的递归,让细尺度结构拥有了自己的「感知—编辑」回路,同时又不丢掉整景的几何与关系。 还有两个容易被忽略的细节: 参考对齐视图 在层级之间传播共享的相机投影,保证每一层看到的是同一套视角约定;判断「该继续精修、该递归下探、还是该返回」的,是一个 视觉语言编码智能体 ——它直接比对参考图与当前渲染图,用视觉判断来驱动构造过程。 单张参考图像 递归场景程序 RSP + 会自调用的构造求解器 同一个求解器被反复调用,逐层解决未解析的部分 ① 建立整体 先给出整景的初版可执行程序 ② 递归重建未解析的部分 每个子世界再跑一遍完整流程 ③ 回到整体精修组合 处理边界、空间关系与共享误差 递归下探 视觉语言编码智能体负责判断 直接比对参考图与场景渲染图 据此决定继续精修、递归下探,还是返回 可执行的场景程序 + 渲染结果 图 1 RCWM 的递归构造流程:同一个求解器被反复调用,逐层解决未解析的部分(示意图由 AI 生成,内容由AI生成) 三、实验:11 张参考图,PSNR 与 LPIPS 全胜 评测设置很干净: 5 张整景参考 + 5 张局部裁剪 ,分别来自 CC0 的「Isometric city」素材包示例构图(city-full 与 school-block、police-corner、park-lake、shop-row 四个裁剪)以及 WorldClaw 的演示渲染(island-harbor、medieval-village、snow-village、japan-island、valley-village)。 只给图像,不给原始提示词、地形或资产 。 所有方法共用同一底座与同一推理强度:由 gpt-6-astra 经 Codex 命令行智能体以高推理强度驱动,RCWM 的每个递归节点各算一次 Codex 会话。对手是 SEIG(作者自行复现)、VIGA、img2threejs。评测指标为 PSNR、SSIM、Edge(Canny 边缘,3 像素容差)、LPIPS(AlexNet 主干)、CLIP ViT-B/32 余弦相似度。 场景 / 方法 PSNR ↑ SSIM ↑ Edge ↑ LPIPS ↓ CLIP ↑ city-full · SEIG 14.5 0.51 0.83 0.339 0.90 city-full · VIGA 9.5 0.48 0.58 0.670 0.83 city-full · img2threejs 15.5 0.55 0.91 0.243 0.93 city-full · RCWM(本文) 18.2 0.66 0.94 0.158 0.95 medieval-village · RCWM 18.7 0.71 0.89 0.200 0.93 japan-island · RCWM 19.3 0.73 0.87 0.201 0.96 school-block(裁剪)· RCWM 16.4 0.56 0.97 0.171 0.94 表 1|节选自论文 Table 1(RCWM 行与 city-full 的全部对比行)。窄屏可横向滑动。 结果很干脆: 在每一张参考图上都拿到最高 PSNR 和最低 LPIPS ;SSIM 在 11 张参考中拿下 9 张最高(唯一例外是 valley-village,VIGA 0.41 对 RCWM 0.38)。改进同时覆盖整景与局部裁剪两组——也就是说它不是「只会看大结构」,细尺度也没落下。 消融部分最有意思:作者对比了五种构造流程——单次平铺放大、先局部后整体、先整体后局部(但不回头修组合)、递归但固定二层、递归且自由深度。在 medieval-village 上,自由深度那一次展开到 三层、共 33 个节点 ,说明「让子问题自己继续往下拆」这件事确实被用上了。 图 2 概念示意:从一个视角的参考图出发,重建出可被程序编辑的「微缩世界」(插图由 AI 生成,内容由AI生成) 四、它真正的价值 把构造过程变成可复用的原则。 「建立整体 → 递归解决未解析部分 → 回来精修组合」这套流程与具体场景无关,可以套用到其它代码世界模型上。 细尺度有了自己的回路。 细节不再依赖一次生成的质量,而是可以反复「看渲染图、改代码」。 世界是可执行的,所以是可编辑的。 产物是程序,意味着你能直接改某栋楼的位置、某条街的走向,而不是重新生成一张图。 五、冷静看:作者自己列出的局限 这篇论文难得地把局限写得很直白,值得原文照搬要点: 单视角输入天然歧义。 被遮挡的几何与绝对尺度无从确定; 视觉检查会漏错。 靠「看渲染图」判断对错,本身不是可靠的验证器; …