Nature探讨“爱因斯坦测试”:AI能否在零污染环境下独立提出光量子理论?
2026/09/19 19:36阅读量 4
Nature近期文章探讨了由DeepMind联合创始人哈萨比斯提出的“爱因斯坦测试”,旨在检验AI能否仅凭历史知识独立提出新科学框架。独立研究者训练了知识截止于1900年的模型GPT-1900,虽在光电效应问题上输出了类似光量子的描述,但因数据泄露风险和缺乏真正的溯因推理能力,被指未能真正重现科学发现。研究指出,当前大模型擅长归纳与演绎,但距离具备自主发现问题、判断理论价值及进行溯因飞跃的科学家水平仍有巨大差距。
事件概述
《Nature》发表文章深入分析了被称为“爱因斯坦测试”的科学创造力评估方案。该概念由诺贝尔奖得主、Google DeepMind联合创始人哈萨比斯(Demis Hassabis)提出,核心在于将AI置于特定的历史知识限制下,观察其能否直面当时的物理难题,自行构建超出训练数据的解释框架,而非简单复述已知答案。这一测试被视为衡量人工智能通用智能(AGI)潜力的重要指标。
核心实验:GPT-1900的挑战
今年3月,独立研究者Michael Hla执行了一项名为“Machina Mirabilis”的实验,试图验证上述设想。
- 模型构建:Hla利用Andrej Karpathy的nanochat框架,从零训练了一个拥有33亿参数的Transformer语言模型,命名为GPT-1900。
- 数据清洗:预训练语料主要来自1900年以前的书籍和报纸(约220亿token),并额外收集了牛顿、麦克斯韦等前现代物理学家的著作(约2.9亿token)。为确保“零污染”,所有包含“爱因斯坦”、“量子力学”、“相对论”等后世概念的文献均被剔除。
- 实验过程:研究者向模型提供关于光电效应的矛盾现象(如频率门槛、电子动能与频率的关系等),并要求模型基于当时已知的经典假设找出问题所在。
实验结果与分析
尽管GPT-1900在回答中输出了“光可能不是连续的,而是由许多彼此分离、频率不同的部分组成”这一论述,看似触及了爱因斯坦1905年提出的光量子概念,但分析认为该实验并未成功证明AI具备独立科学发现能力。
- 数据泄露风险:实验过程中使用了现代AI模型(如Claude系列)生成指令问答和强化学习评分。这导致“1900年封闭环境”的人设难以维持,无法完全排除模型通过间接途径接触到现代物理知识的可能性。
- 推理能力的局限:GPT-1900在大多数其他物理任务中表现失败。其看似突破性的回答更多是词句的合理拼接,而非形成了可靠的物理理解。此外,实验由人类预先筛选好现象和矛盾,模型只需在既定路径上寻找解释,这与科学家自主发现问题、设定方向的难度不可同日而语。
深度观点:AI距离成为科学家还差什么?
研究人员引用多篇立场论文和案例,指出了当前大语言模型(LLM)在科学推理中的根本缺陷:
- 缺乏“溯因”能力:Google DeepMind研究员Tom Zahavy将科学推理分为归纳(总结规律)、演绎(逻辑推导)和溯因(发明全新解释)。当前LLM擅长前两者,但缺乏爱因斯坦式的“溯因飞跃”,即从零开始提出全新解释框架的能力。
- 泛化能力不足:基础模型在特定任务(如行星轨道预测)中表现良好,但一旦场景变化,便无法举一反三地运用底层原理,更像是临时拼凑规则而非掌握真理。
- 价值判断缺失:MIT计算机科学家Jacob Andreas指出,生成理论表述并非最难部分,真正的挑战在于判断哪些理论值得被检验。真实的科研需要在混沌中自主做出判断,评估想法的重要性并主动验证修正,这是当前AI尚未具备的核心素质。
结论
虽然AI可能在受限条件下输出符合历史事实的描述,但要宣称AI成为“科学家”,必须证明其在无提示、无泄露的环境下,能自主发现值得追问的问题、判断其价值并进行验证。目前,AI仍主要处于复述已有知识的阶段,距离真正的科学创新尚有本质区别。
