影溯章国锋:把互联网视频变成空间智能的“太阳能”,是数据破局的关键

2026/08/11 15:30阅读量 2

影溯科技创始人章国锋认为,空间智能规模化最大的卡点是3D/4D数据供给,遥操、第一视角采集等方式成本高、难以Scale;真正可行的路径是把互联网海量视频转化为全量3D/4D场景数据,成本可下降一至两个数量级。公司已实现单目视频转360度动态场景,并在今年完成新一轮融资。

事件概述

影溯科技创始人兼董事长、浙江大学求是特聘教授章国锋近期与极客公园创始人张鹏进行对话,系统阐述了空间智能当前的核心瓶颈——3D/4D训练数据的规模化获取问题。他认为,遥操作、第一视角采集等方式类似“伐木和挖石油”,成本高、多样性有限,难以支撑世界模型所需的互联网量级数据。真正的突破口在于将互联网上已有的海量2D视频转化为结构化、全量的3D/4D数据,如同把无处不在的“阳光”转化为可用的“太阳能”。

影溯科技成立一年,致力于打造空间智能基础模型,已推出基础模型 InSpatio-World 和引擎平台 Topos(含 Pro、Lite 两版)。公司预计今年可实现单目视频转360度动态场景并开始批量转制,整体成本较传统实地采集加重建模式下降至少一至两个数量级。今年6月,公司完成新一轮融资,将主要投入模型训练与数据引擎建设。

核心信息

  • 数据问题是空间智能第一性问题:语言模型和视频模型受益于互联网三十年积累,而3D数据缺乏互联网级别的原生来源,成为世界模型训练的最大瓶颈。
  • 3D表征是模型学习物理世界的基础:物理规律定义在3D空间而非2D像素上,先建立“空间骨架”,后续的理解、预测和推演才能高效学习。将3D结构引入模型后,学习效率可提升一个数量级以上。
  • 互联网视频是最大的“阳光”资源:视频每一帧都包含运动、物理规律和三维信息,关键是如何高效提取并转化为全量、动态的3D/4D训练数据。
  • 影溯技术路径与进展:从2D视频自动生成全量3D场景,并进一步恢复完整4D动态场景;内部已验证单目视频转360度动态全量3D/4D的可行性。
  • 成本结构:预训练数据需要海量、低成本、多样化,后训练可接受高成本专家数据;影溯的目标是让大规模生产3D/4D数据在经济上成立。
  • 模型与产品布局:InSpatio-World 用于让用户“走进”动态视频;Topos Pro 面向具身训练与仿真,可将场景中的物体自动实例化并接入物理引擎;Topos Lite 定位轻量化3D生成,已开源模型与技术报告,并推出普通用户可拍摄生成3D场景的App。

值得关注

  • 影溯认为,空间智能的“ChatGPT时刻”会首先出现在数字世界——用户通过一句话或几张图即可获得可进入、可交互的三维世界;随后再向物理世界延伸,例如更智能的扫地机器人、自动驾驶处理长尾场景。
  • 对于物理规则,章国锋主张“知道的就告诉它,不知道的让世界告诉它”,即先验约束与数据学习相结合,而4D数据记录世界的变化过程,是学习复杂物理规律的重要来源。
  • 影溯当前阶段被类比为GPT-2.0:关键技术路径已验证,但真正的数据Scaling尚未发生。公司规划最终需要数千万到一亿量级的场景数据,才有可能迎来空间智能的质变。
  • 模型架构上,影溯探索Transformer的三维适配和超越Next Token Prediction的新范式,但坚持“三维结构不能丢”,认为三维世界的问题应尽量在三维空间解决。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。