新论文改写AI科研评价规则:深度原理MIRA双榜第一

2026/08/24 21:21阅读量 2

一篇题为《Measuring AI Scientists: From Exams to Discovery》的论文提出“发现回合”评估体系,首次系统性衡量AI的真实科研能力,告别只看最终答案的传统考试式评测。该论文由深度原理联合多家全球顶尖机构完成。深度原理的MIRA平台作为实践样本,在Research Claw Benchmark和Science Agent Arena两项评测中均位列第一。

事件概述

8月19日,一篇题为《Measuring AI Scientists: From Exams to Discovery》的论文发布,首次系统提出衡量AI真实科研能力的评价范式。该论文由深度原理(Deep Principle)联合微软研究院、斯坦福大学、FutureHouse、Edison Scientific、艾伦人工智能研究所、加州大学伯克利分校等机构共同完成,诺贝尔化学奖得主Frances Arnold参与署名。

核心信息

  • 论文核心创新是提出“发现回合”(discovery episode)评估体系,全程记录AI在科研周期中的每一步决策,对整条轨迹的科学性、严谨性和有效性进行综合评分,而非只考核最终答案。
  • 评估围绕科研闭环的三个阶段——科研假说、方案执行、实验结果解读——分别建立评判维度,并进行全流程闭环测试。
  • 论文重新定义了失败实验数据的价值,认为失败的实验数据是训练和评估AI科研的核心资产;同时对AI科研结果的真实性和独立性提出高要求。

实践数据

深度原理的MIRA平台被视为该体系下的产业样本。其采用“多智能体小队+高性能计算与自动化实验室双执行引擎+科研记忆体系”三层架构,实现从假设生成到实验验证的完整闭环。

  • 在化学、能源、材料综合评测Research Claw Benchmark和药物发现评测Science Agent Arena中,MIRA均位列第一,且单项任务平均成本为行业最低。
  • 深度原理此前发布的React-OT模型可在0.4秒内计算化学反应过渡态,为平台提供底层高精度计算能力。
  • 公司已依托MIRA在锂电、工业冷却液、新能源材料等领域布局自研管线,由AI主导全周期科研。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。