形界智能:AI实时视频的最大误判是沿用两段式架构,端到端才是解

2026/08/24 14:18阅读量 2

形界智能认为,把实时视频生成拆成独立的理解模型和生成模型,是市场对AI实时视频的最大误判。该公司推出端到端的全域沉浸式生成模型Rise,以10B参数实现500毫秒无感延迟和每秒1分钱的推理成本,用户只需通过摄像头自然动作即可进入和影响视频世界。行业正从离线生成转向实时生成,但技术路线分化明显。

事件概述

2024年8月,Google Research、DeepMind与特拉维夫大学联合展示了一段由模型实时推演生成的《DOOM》游戏画面,但此后两年,行业焦点仍集中在Sora、可灵、Seedance等离线生成模型上。直到2026年年中,实时视频生成迎来爆发,Anthropic被曝正洽谈以约60亿美元收购实时视频生成初创公司Decart,资本密集涌入该赛道。

当前行业大致分三条路线:离线生成(字节Seedance、快手可灵、生数Vidu)只改变生产方式,观众仍坐在屏幕外;实时流式生成(World Labs、Odyssey等)让人从观众变成玩家,但仍需通过键盘、鼠标和Prompt驱动;第三条路线被称为“全域沉浸式生成”(Immersive),代表玩家为形界智能,其核心是让模型适应人,用户无需学习指令,通过摄像头用动作、表情、姿态即可进入和影响视频世界。

核心信息

形界智能成立于2026年5月,CEO王裕鑫为中科大博士,此前作为元石科技007号员工,牵头组建过国内较早的MoE架构大模型预训练团队。公司成立首月即完成数千万元天使轮融资。

团队在同期发布两篇论文:Stream-R1从训练侧改造流式视频蒸馏过程,Stream-T1从推理侧探索流式视频的Test-Time Scaling,分别从训练和推理两端提升流式生成质量,双双登顶Hugging Face每日论文榜前二。

2026年7月WAIC期间,形界智能发布“Era”系列首个互动视频生成模型Genesis,支持随时打断、感知摄像头输入、对观众动作实时响应,首次跑通“实时理解+实时生成+实时响应”闭环。展会三天累计体验时长超10小时,等待名单上有100多个意向团队。

随后不到一个月,公司发布“Era”系列第二款全域沉浸式生成基础模型Rise。其关键设计是端到端架构:不采用“理解模型把动作翻译成指令、再交给生成模型”的两段式方案,而是将理解与生成放进同一个模型,以“Native Interactive Representation Scaling”方式处理持续视频流输入。传统两段式方案因翻译损耗和串行等待,延迟被锁在4秒以上;Rise则将体感延迟压至500毫秒,成为国内第一家真正实现该水平的玩家。

Rise的预训练阶段同时学习视频理解、视频生成以及两者联合建模;后训练阶段仅用300小时赛车数据就实现逼真互动体验。推理成本从两段式方案的每秒7毛钱降至每秒1分钱——一场两小时的AI直播互动,成本从5000到8000元降至72元。

值得关注

形界智能创始人王裕鑫认为,当前技术在物理仿真、记忆、多人参与、画面精细度等方面与世界模型仍有差距,“还处在GPT-3的前夜”。但面向直播、陪伴、教育等场景,数字内容正在从“被观看的对象”变成“可进入的空间”。形界智能的定位不是世界模型赛道,而是更低门槛的世界入口。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。