中科院发布“知境”技术体系,将AI社会心智从模糊情商变为可测可训工程
2026/07/27 13:00阅读量 2
中国科学院计算技术研究所“知境”团队发布社会心智大模型技术体系,包括评测基准SoMBench、训练系统Zing和部署架构Actio。SoMBench将社会心智拆解为71项任务,20个顶级大模型在其中的最高正确率仅72.08%。Zing-27B多模态模型综合均值超越GPT-5.5,Zing-32B文本模型比肩DeepSeek-V4-Pro,小参数模型在高阶信念推理上表现突出。该体系旨在让AI在家庭聚餐、团队协作等场景中更“懂人心”。
事件概述
7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队正式发布知境社会心智大模型技术体系,旨在解决现有大模型在社交、协作等场景中“情商”不足的问题。该体系包含三部分:社会心智评测基准SoMBench、自适应训练系统Zing,以及显式心智状态部署架构Actio。
核心信息
- SoMBench评测基准:将社会心智拆解为3大一级维度、17个二级维度、71项细粒度任务,包含3481道实例。通过多题型交叉验证和捷径检测等手段,可精准定位模型的错误模式。20个顶级大模型测试结果显示,最强模型正确率仅72.08%,无一达到90%。
- Zing训练系统:采用FLARE数据飞轮(根据诊断缺陷合成新训练样本)、两阶段训练(先通用社会心智打底,再专项能力强化)、OPD在线蒸馏(避免强化学习中的灾难性遗忘)三大机制。
- 核心性能数据:
- Zing-27B多模态模型在五项社会心智评测综合均值达79.80,超越GPT-5.5的78.44,尤其在HiToM(递归信念追踪)上领先4.08个百分点,EmoBench(情绪理解)上领先5.62个百分点。
- Zing-32B文本模型综合均值76.32,略超DeepSeek-V4-Pro的75.90,EmoBench上78.13对71.88领先6.25个百分点。
- Zing-8B和Zing-14B小参数模型在HiToM上分别达到78.08和80.00,超越同尺寸基座模型近12和8个百分点,三阶和四阶信念推理提升超过20个百分点。
- Actio部署架构:以Harness为核心,选择性激活四大模块:PRISM(分层心理与社交技能)、Starling Memory(状态记录)、SAGE(推理经验复用)、Gated RAG(社会文化知识检索),实现按需调用心智能力。
值得关注
知境团队将社会智能从模糊的“情商”转变为具有评测工具、训练方法和运行时接口的工程对象。该体系已在多项国际基准上验证有效性,小参数模型的表现尤其适合端侧部署(如家庭看护、儿童陪伴机器人)。项目技术报告已发布,相关模型权重和评测基准将在GitHub逐步开源。
