李飞飞押注空间智能:生成世界如何“经得起折腾”?
本文探讨空间智能中生成式三维世界面临的关键挑战:AI生成世界虽快,却因缺少独立可验证、可增量更新的“状态底账”,导致首个有效结果慢、局部修改后关系失守。文章分析了感知式与符号化路线的瓶颈,提出以Renderer/Simulator/Planner架构为基础,通过状态层、行动学习与验证系统构建可持续运行的世界模型,并引用World Labs、SceneOrchestra、生境科技等案例与评测数据。核心判断是:未来世界模型的衡量标准将从首帧画质转向首次有效时间、约束通过率与长程状态一致性。
事件概述
李飞飞押注的空间智能被视为世界模型的主流路线之一,目标是让AI从识别二维画面,走向理解、推理和生成可进入、可操作、可编辑的三维世界。文章提出,真正的考验在于构建一个“站得住”的世界:当AI交付的内容从“画面”变成“三维世界”、互动从“观看”变成“进入和操作”后,对象需要在多轮操作中保持身份,规则要承受真实行动,局部修改也要与已有关系相容。李飞飞将所需能力概括为 Renderer(画出来)、Simulator(记住世界状态与变化)和 Planner(决定下一步),三者通过共享的状态层——“底账”连接,决定生成世界能否持续运行。
维持状态层需要系统在运行中不断遭遇未知、记录冲突并修正假设,即递归自我改进(RSI)。系统保存“状态—目标—行动—新状态—验证—反馈”的完整轨迹,识别能力缺口,自动生成新任务和困难样本,再经独立评测、版本门控与回滚驱动下一轮迭代。空间世界因具有明确对象、可执行动作和可外部核验结果,成为这一闭环的理想试验场。
生成世界的现状与三条路线
当前,生成式AI已能产出带空间属性的世界。例如,Kimi K3 的演示中,一段自然语言变成浏览器中的程序化开放世界,骑乘、森林、村庄、山地、水体和天气处于同一运行画面;GPT-5.6 与 Codex 构建的 MiniTown 则把分区、居民日程、车辆与昼夜循环组织在同一状态里。
“一句话生成”背后是一条长生产链:拆解意图、检索资产、求解空间关系、执行脚本、检查渲染结果,再修复空场景、穿模、对象缺失与状态丢失。一个可运行空间至少包含三类状态:语义状态(对象是什么、承担什么功能)、几何状态(尺寸、位置、边界、拓扑)和运行状态(门是否打开、角色任务、路径是否有效),三者绑定在同一对象生命周期中。系统还需区分“编辑世界”与“在世界中行动”,两者权限、依赖和回滚方式不同。
构建可运行世界的技术路径主要沿三条路线展开:感知式世界生成(视觉生成驱动)、符号化/程序化世界生成(对象身份、规则为核心),以及正在形成的融合架构。三条路线优势不同但正朝同一方向收敛:视觉表征开始吸收对象身份和可操作状态,程序化系统补入视觉经验与开放环境泛化;融合架构试图用统一中间表示承接两者。关键检验发生在行动之后——观察与状态能否同步更新。
核心瓶颈:速度与状态
感知式路线将大量世界信息压在画面或潜在表征里,错误常藏在镜头之外;符号化路线把对象和程序显式写出,错误则藏在代码和工具状态之后。它们根因相近:生成结果承担了过多世界状态,却缺少一份独立、可验证、可增量更新的“底账”。
速度瓶颈表现为“第一次返回很快,第一个有效结果却很慢”。用户在等待第一个通过几何、功能和任务检查的结果。SceneOrchestra 在同一 A6000 环境复测时,LayoutGPT、Holodeck、SceneOrchestra 和 SceneWeaver 的平均运行时间从 2.3 分钟延伸到 91 分钟;World Labs 文档将 Draft、完整 World 和高质量 Mesh 分别放在约 20 秒、5 分钟和接近 1 小时的时间带。衡量高频空间工具的指标需要从“首轮响应”移向“首次有效时间”。
状态瓶颈出现在局部修改后。感知式世界会在视角切换、遮挡和重返场景时改变尺度或细节;符号化系统可能在移动对象后破坏碰撞、承托、朝向、绑定或路径。公开评测中,FloorplanQA 出现违反碰撞和路径约束的情况;GameCraft-Bench 记录了局部机制运行、完整游戏依然失败的案例;GEST 让 LLM 独立输出完整事件图时 50 次尝试全部失败,程序化状态后端接管后执行才稳定;SceneSmith 表明场景图需补齐碰撞、质量、惯性和摩擦属性才能进入仿真系统。维持连续性需要持续对象身份、关系与依赖图、事件日志、版本历史、增量求解器和验证器。
解决方向:状态—行动闭环的世界模型
World Labs 按功能将世界模型分为 Renderer、Simulator 和 Planner,三者需要一层可持续运行的状态作为接口,保存对象身份、几何、关系、约束、行为接口、任务进度、来源、置信度与版本,并把每次修改转化为可检查的局部补丁。状态层同时容纳离散结构与连续空间:对象、部件、拓扑和规则适合写入场景图;光照、视线、通行、可达性等连续变化需空间场与求解器。SceneScript、HDSL 等研究将场景写成可寻址、可局部修复的命令或层级程序,OpenUSD 则让对象与版本跨工具持续存在。
国内空间智能创业公司生境科技展示了相近的系统思路:其自主空间智能将空间状态模型、空间—行动模型和空间执行引擎围绕同一世界状态组织,分别负责维护对象/几何/关系/规则/历史、学习目标/动作/未来状态关系、生成/修改/渲染并写回结果。其 MST-Builder 尝试把合规图文、商品、3D 资产和 UGC 编译为带语义、几何、关系、来源与许可信息的空间 Token;NSF 研究用连续功能场表达“哪里适合做什么”。这种底账驱动架构使局部修改只需重算受影响区域,工程上已实现 20 秒级增量解算。
行动学习方面,行业趋势是将空间生成展开为一连串可训练轨迹。机器人侧研究(如 ConceptGraphs、SayPlan、VoxPoser)呈现分层结构:高层维护长期目标,中层规划对象与关系,底层求解几何、路径和控制,失败时回到最近稳定状态。生境科技将反馈采集嵌入空间创作流程,能够积累覆盖对象添加、删除、移动、替换、撤回、保存和评分等操作的完整状态转移轨迹。撤回操作可转化为反事实负样本,连续编辑序列则揭示了长期目标如何被拆解为多步行动。
闭环最后需要验证系统。确定性规则检查格式、边界、对象生命周期和依赖完整性;几何求解与路径搜索判断空间可用性;多模态模型观察遮挡、语义与整体视觉后果;用户行为或机器人任务给出最终反馈。行业正从“成功渲染”推进到“状态正确、任务可做”。OptiScene 把人工检查转为偏好数据,LayoutVLM 将可微约束接入布局优化,SimWorld Studio 让编译、物理检查和 VLM 反馈共同驱动修正。生境科技的 HiSQ-Bench 将空间质量拆为意图一致性、几何合理性、空间可用性和审美感知,并用智能体执行晨间、归家和探索等任务;VisAlign 则把结构化决策放入代理房间,让多模态裁判观察组合兼容性和视觉瑕疵。研究稿报告,在 Gemini 2.5 Pro 代理评分中,完整方法的 Scene Compatibility 为 0.73,高于 SFT 的 0.56,Artifact 指标由 0.24 降至 0.15。不过,代理房间目前仍采用二维近似,评测依赖模型裁判,真实三维碰撞、长期交互和第三方复现仍有待检验。
结论:从“画出世界”到“验证世界”
生成式AI已跨过“能否造出一个世界”的门槛,但“这个世界能否经得起行动”仍是待解命题。未来衡量世界模型的关键指标将转向首次有效时间、局部修改后的约束通过率、长程状态一致性,以及真实任务能否完成。感知式与符号化路线不会始终困在各自起点,而会在 Renderer、Simulator 与 Planner 之间以状态层为接口汇合。到那个阶段,生成不再等于“画出一个世界”,而是提出一个可验证的世界版本。核心命题是:AI 不仅要能造出世界,更要让世界在每一次行动之后依然成立。
