NUS Show Lab:融合自回归与离散扩散,构建具身智能统一底座

2026/09/14 10:50阅读量 2

新加坡国立大学Show Lab提出Show-o架构,在单一Transformer中融合自回归(AR)与离散扩散机制,打破文本理解与视觉生成的模态壁垒。该架构通过循环一致性监督解决数据稀缺问题,并利用3D Tokenizer与时空注意力提升视频生成连贯性。在具身智能落地方面,团队采用云端大模型规划与端侧低延迟控制相结合的策略,实现了从多模态理解到机器人实时动作预测的闭环。

事件概述

新加坡国立大学(NUS)Show Lab 负责人寿政教授在 ECCV 2026 上展示了其最新研究成果。团队致力于打破传统“拼接独立模型”的做法,通过在单个 Transformer 架构中深度融合自回归(Autoregressive, AR)预测与离散扩散(Discrete Diffusion)生成,构建了统一的具身大模型底座。这一突破旨在解决多模态 AI 从“被动理解”向“主动体验”演进中的核心痛点,包括效率瓶颈、数据稀缺以及实时反应需求。

核心信息

1. 架构创新:Show-o 统一模型

  • 混合机制:Show-o 是首个将自回归与离散扩散融合于单一 Transformer 的模型。在处理文本时保持自回归模式以维持逻辑推理能力;在图像或视频生成时切换至基于 Mask-and-Predict 的离散扩散模式。
  • 优势:避免了纯自回归方案在图像生成时的算力开销巨大和速度慢的问题,同时解决了连续扩散模型难以与离散 Token 的大语言模型无缝融合的技术难题。支持任意顺序和组合的多模态输入输出。

2. 技术突破:Show-2 解决三大瓶颈

为从静态图像迈向动态视频生成,Show-2 引入了以下关键改进:

  • 循环一致性监督(Cycle Consistency):针对缺乏标注数据的特定领域(如文化遗产),通过“观察-描述-再合成”的自监督闭环,利用生成能力反哺理解能力,拓宽了 Scaling Law 的数据边界。
  • 3D Tokenizer 与时空双向注意力:开发通用 3D Tokenizer 统一编解码图像和视频。视觉部分采用时空双向注意力机制,使所有视觉 Token 在空间和时间维度互见,大幅提升视频连贯性与画质。
  • 双路径架构设计:输入端共享 3D Encoder,内部拆分为理解与生成两条路径。理解路径引入语义层(Semantic Layer)进行特征蒸馏,既保障视觉理解精度,又维持高质生成效果,解决了完全共享编码器在少样本场景下的性能拉扯问题。

3. 具身智能落地:从 VLM 到 VLA 闭环

  • 模型演进:从视觉-语言模型(VLM)扩展至具备动作预测能力的视觉-语言-动作模型(VLA)。同时结合世界模型(World Model)与世界动作模型(WAM),实现“预测动作”与“预测未来视觉结果”的闭环。
  • 部署策略:采用“云端大模型 + 端侧微调模型”协同工作。云端模型负责复杂规划(尽管有 8-20 秒延迟),端侧模型负责毫秒级实时反馈与控制,确保机器人在物理环境中的快速响应。
  • 实验环境:搭建了包含固定双臂系统(双指夹爪/五指灵巧手)和移动底盘的遥操作采集平台,用于收集“状态-动作轨迹”数据以训练模型。

值得关注

  • 数据效率:循环一致性监督机制证明了在无标签海量视频(如 YouTube “生肉”视频)中提取物理常识的可行性,为低资源领域的 AI 进化提供了新思路。
  • 实时性平衡:研究证实了通过特征对齐与蒸馏,开源底座模型可实现远超闭源模型的推理速度,证明了“数字生命”大脑需兼具深思熟虑与本能反应的能力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。