科学自动机来了:能填平科研地板,却难抬高天花板
AI for Science发展加速,已出现从AI生成内容到自动核验的闭环“科学自动机”,能以更高效率产出论文和成果。但有分析指出,其存在两个副作用:研究者跳开核心科研环节会失去品味与判断力;且其搜索范围局限于现有语料,只能快速填平研究空白,难以提出新概念,无法真正抬高科学天花板。
AI for Science发展明显提速。2026年3月的《AI for Science 创新图谱》显示,近五年全球相关论文数量翻了一倍多,材料、量子科技、航空航天等方向年均增速超过30%;此前中国发表量全球第一,但篇均被引低于美国。中美欧英日均已出台国家级部署。
在产业侧,海外资本主要流向自主实验室公司。Periodic Labs于2025年9月获3亿美元种子轮,用于“AI提假设、机器人做合成”,以寻找高温超导材料;Lila Sciences累计融资5.5亿美元,向外界开放自动化实验室平台。
生成端已有完整跑通案例。2026年2月,上海日行迹(Analemma)的FARS系统开始直播自动生成论文,第一轮连续运行228小时产出100篇AI领域短论文;经斯坦福Agentic Reviewer按ICLR标准打分,FARS论文平均分5.05,高于ICLR 2026人类投稿均值4.21,低于最终录用均值5.39。后续17天产出166篇,平均约两小时一篇,单篇成本一千余美元。但该系统是“流水线加一道质检”,打分后不会反馈改进下一轮。
验证端同样在推进。2026年8月1日OpenAI公布的十个数学问题,每个都附Lean 4机器可核验证书;Google发布Science One Framework,为推理步骤挂上证据链;上海AI实验室的“书生·端砚”在蛋白质和材料方向做干湿闭环,并加入独立评审智能体核查引用与输出。若验证结果能接回生成端,形成“下一轮从上一轮起步”的循环,即构成一台科学自动机。计算机、数学等领域因验证可在机器内完成,会率先闭合;其他领域则需机器人介入物理世界。
文章认为,科学自动机存在两个陷阱:
能力陷阱:科研所需的品味和判断力,必须在长期亲身科研过程中才能养成。自动机会使研究者最早退出写作、实验等核心环节,机构考核产出而非能力养成,这种退场可能不可逆。有博士生使用AI建议的方法跑实验,性能没有提高却不知原因;论文写作本身也是形成判断力的过程,写作时往往会出现更干净的设计,而这一环节在自动化中最先被跳开。下一代研究者若未经“毒打”,将难以建立科研判断力。
天花板陷阱:科学自动机的搜索范围被锁定在已有语料内,只能通过大量组合搜索快速“填平地板”,例如材料筛选、老药新用、天气预报等。这类工作在某些领域会特别有用,已有的效率数据包括:抗菌物质挖掘成功率是人类专家几十倍,芯片设计效率提升五到十倍、周期缩短一半,气象模型比传统数值方法快上千倍。但这些成果多为对已知空间的组合,尚未带来语料外的新规律。真正的重大突破——如负数、非欧几何,以及AlphaFold将蛋白质结构预测从物理问题改为学习问题——往往来自语料之外的新概念、新结构。大模型本质是超级模式补全器,目前无法突破已知语料泛化的边界。
结论是:科学自动机可在某些领域带来实际成果,但其副作用不可忽视。填平地板本身没有错,但科学的大进步需要抬高天花板;只靠暴力铺满地板,甚至会丧失抬天花板的能力。
