深度机智PhysBrain 1.5登顶全球开源榜首,物理智能基座能力逼近顶尖闭源模型

2026/09/14 11:18阅读量 2

中国公司深度机智发布物理基座模型PhysBrain 1.5,在28项公开基准测试中以72.5的综合均分位居开源模型第一,与GPT-6 Astra(73.3)等顶尖闭源模型的差距缩小至1分以内。该模型采用“Physical Loop”统一架构,将具身理解、动作生成与未来状态预测整合于同一自回归主干,并基于Ego360人类全景交互数据进行预训练。目前PhysBrain 1.5已全面开源2B与8B版本,标志着中国团队在物理AI基础模型领域进入全球第一梯队。

事件概述

2026年9月9日,中国人工智能公司深度机智正式发布物理基座模型PhysBrain 1.5。该模型在涵盖视觉空间感知、具身认知与规划等五大维度的28项公开基准测试中,取得72.5的综合均分,位列所有参评开源模型首位。其性能表现已大幅缩小与当前最强闭源模型如GPT-6 Astra(73.3)和Gemini 3.6 Flash(73.0)之间的差距,显示出在物理智能领域的强劲竞争力。

核心信息与技术突破

1. 评测成绩与行业地位

  • 综合得分:PhysBrain 1.5-8B以72.5分领跑开源阵营,较主要开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分。
  • 单项优势:在28项测试中,取得14项开源第一、10项开源第二。其中Part-Affordance(可操作部位识别)达84.0分,RoboRefit(视觉目标定位)达89.8分,显示其在从识别到交互的关键环节具备系统性领先。
  • 多版本覆盖:同步开放PhysBrain 1.5-2B(66.6分)与PhysBrain 1.5-8B。2B版本虽不参与排名,但其分数已超过多数其他非PhysBrain开源模型,证明了技术路线在轻量化部署上的有效性。

2. “Physical Loop”统一架构
PhysBrain 1.5摒弃了传统的“理解+动作+预测”多模型拼接模式,构建了统一的自回归基座模型,实现物理智能闭环:

  • 具身理解:通过VLM接口注入物理感知,输出结构化空间坐标与轨迹目标,不仅“看到”画面,更理解场景中的物理常识与任务意图。
  • 动作生成:基于Human-as-Humanoid管线,从人类视频学习手腕运动方式,直接生成机器人可执行的动作步骤。该能力具有通用性,无需为不同形态或控制频率的机器人单独训练。
  • 未来状态预测:在给定当前画面与指令后,预测1秒后的物理状态,同时输出RGB图像、深度图和机器人掩码。这种“先想象结果、再采取行动”的前瞻能力,为闭环中的纠错提供了依据。

3. 数据路线:人类经验驱动

  • Ego360全景数据体系:模型预训练监督完全来自人类交互视频。通过记录全景环境、全身姿态、手部运动及语音,保留连续的任务上下文,使模型学习“情境-动作-反馈”的完整循环,而非碎片化操作。
  • Human-as-Humanoid框架:作为连接人类数据与机器人动作的桥梁,该框架实现了从人类行为到机器人动作空间的转换。此前在Prime U拟人机器人上的验证显示,原始示范吞吐量达到传统遥操作的4.8至7.2倍,并实现了部分任务的零样本迁移。

值得关注

  • 全栈布局闭环:深度机智已完成从数据采集(Ego360)、基座模型(PhysBrain)、动作转换(Human-as-Humanoid)到本体验证(Prime系列)的全栈独立闭环,形成了系统性的研发壁垒。
  • 战略先发优势:早在2025年10月,该公司即提出以“人类学习”为核心路径的技术路线图,这一判断在2026年被全球多家头部机构(如PI、NVIDIA等)的转向所验证。
  • 开源生态影响:PhysBrain 1.5的技术报告、模型权重及评测工具包已全部向社区开放,上线3天下载量超3k,为全球开发者提供了媲美顶尖闭源模型的物理智能基座选择。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。