国产世界模型UniWorld-View登顶李飞飞团队榜单,适配昇腾算力且全开源
兔展智能联合北大、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队WorldScore榜单,支持单图/视频输入并生成新视角视频,已适配国产昇腾算力,代码和权重全部开源。
事件概述
由兔展智能联合北京大学、鹏城实验室研发的UniWorld-View模型,在李飞飞团队发布的WorldScore世界模型榜单中排名第一。该模型支持单图或视频输入,用户可自定义相机轨迹(推拉摇移、360°环绕)生成新视角视频,且单图3D生成与视频4D生成共享同一套代码和模型。训练数据来自北大系初创企业元空智能,代码和权重已全部开源。
核心技术
大基线新视角合成的难点
传统NeRF、3DGS方法依赖多视角重建,面对单目视频(视角覆盖小)易产生空洞伪影;生成式方法虽能补全,但缺乏显式3D建模,大角度旋转时易失控。UniWorld-View采用“几何+生成”路线,先通过点云渲染提供几何条件,再引导视频扩散模型生成。
遮挡感知点云渲染
团队指出,普通点云渲染在大基线视角下会出现前景背景撕裂(纹理扯到背景)和背面漏光(正面点透过背面)两种穿帮。为此提出:
- 双重投影:将源画面投影到目标视角再投影回来,标记被遮挡区域并挖掉,避免错误几何信号误导模型。
- 法向过滤:估计各点法向量,剔除背对相机的点,解决背面漏光。
双流条件注入架构
- 几何流:将经过遮挡处理的点云渲染图与掩码编码后注入潜变量,约束生成内容的3D结构。
- 外观流:通过Ref-DiT模块(新视角特征作Query,源视频特征作Key/Value)进行交叉注意力,让模型从源视频中取补缺失纹理。
4D重建
将时间冻结在首帧,生成静态环绕视图作为外观锚点,再在固定机位上生成同步多视角视频,最后喂给动态3DGS优化得到可自由漫游的4D场景,实现单目视频到4D场景的全流程。
开源与适配
UniWorld-View已适配国产昇腾算力,代码和权重在GitHub(PKU-YuanGroup/UniWorld-View)完全开源。
团队背景
兔展智能由北京大学校友与北大视觉领域青年领军人才联合创立,此前曾发布UniWorld-V2(理解生成统一架构)和UniWorld-V2.5(对齐GPT-Image-2生成能力)。团队正推进商业设计工具RabbitVis,推动视觉AI产品化。
