紫东太初开源ZDTaichu5.0-9B:10B级模型空间具身能力断层领先,通用性能不降级
2026/09/16 21:08阅读量 2
紫东太初发布并开源90亿参数多模态大模型ZDTaichu5.0-9B,在九大国际权威空间理解基准测试中斩获八项第一,显著超越Gemma 4、Gemini 3 Pro等竞品。该模型通过全栈数据生产管线与内置自适应循环推理技术,实现了空间具身智能与通用能力的双重突破,支持复杂物理场景下的连续任务规划与执行。
事件概述
紫东太初(Zi Dong Tai Chu)最新开源了通用多模态大模型 ZDTaichu5.0-9B。该模型在保持图文理解、代码生成等通用能力处于第一梯队的同时,在空间感知与具身智能领域展现出断层领先的性能,旨在解决多模态模型从“数字理解”向“物理世界行动”跨越的难题。
核心性能表现
- 空间具身能力:在涵盖空间感知、三维推理、多视角变换及具身交互的九大国际权威基准测试中,ZDTaichu5.0-9B在10B规模以下的开闭源模型中取得8项第一。例如,在目标定位任务中,其给出的归一化坐标精准落入目标区域;在多视角推理中,能正确进行参照系转换判断方位。
- 对比优势:相比 MindCube-tiny (78.27 vs 48.84)、Gemma 4 8B-E4B (78.27 vs 70.87) 和 Grok 4 (78.27 vs 63.56),ZDTaichu5.0-9B 得分高达 78.27,优势明显。
- 通用能力:未因侧重空间能力而牺牲通用性。在 AI2D 基准测试中得分为 91.48(仅次于 Gemini 3 Pro),WeMath 为 75.9,MathVista Mini 为 84.5,OCR Bench 为 85.5,且在 Agent 工具调用和代码执行任务中表现稳定。
关键技术路径
为实现“通用+具身”的双线突破,模型采用了以下核心技术架构:
-
全栈数据生产管线:
- 预训练阶段:整合开源图文、网页文档、视频素材及仿真三维场景,通过感知哈希去重和内容重写,建立视觉、语言与时空概念的对齐。
- 监督微调(SFT):引入真实业务问答、空间具身案例及 Agent 轨迹,构建多轮对话序列。针对具身样本,严格校验图像、对象关系与操作约束的一致性,确保思维链(CoT)具备视觉依据。
- 强化学习(GRPO):建立“能力域-难度-质量”三维自动标签系统筛选高信息量样本,利用 GRPO 将答案正确性、坐标命中率和格式合规性转化为奖励信号,优化模型短板。
-
内置自适应循环推理:
- 引入熵门控机制,根据预测不确定性动态调整计算深度。对于高不确定性节点,在模型内部重复执行部分层块计算以增加表征精度,无需调用外部工具。
- 配套三重稳定化设计:阻尼更新控制修正幅度,双重停止判据监测 KL 散度与隐状态残差,以及轨迹读出与状态回滚机制,确保算力合理倾斜且结果稳定。
-
内外循环协同机制:
- 内部循环:聚焦当前输入的单步感知与推理优化。
- 外部任务循环:接收新观测和执行反馈,更新任务进展。这种机制使模型能将单步空间判断串联为连续长程任务,显著提升如试管转移、工件搬运等实体系统中的任务成功率。
应用场景与开源价值
- 科研自动化:在阻尼振子求解 demo 中,模型能完整组织解析、代码执行、结果核对及图表输出,实现科研 Agent 的闭环工作流。
- 智能制造:演示了从料架抓取工件到放置工作台的完整过程,模型能将工单目标转化为随现场状态持续更新的操作规划。
- 产业落地:除了开放模型权重,团队还开源了经过工业级验证的数据生产管线详细方案。企业可利用自有数据(如车间录像、实验记录)进行二次训练,降低重复研发成本,加速个性化空间多模态模型的迭代。
