AI范式变革:从大语言模型走向科学数据融合
2026/07/25 19:33阅读量 2
王坚在2026WAIC上指出,当前大语言模型仅能处理人类已有知识,无法主动发现未知。未来AI的突破方向是让科学数据(如光谱、地震波、基因序列)成为基础模型的“一等公民”,实现从“处理已知”到“发现未知”的跨越。之江实验室已启动“021”科学基础模型项目,古生物学等领域的实践已展示出巨大的精度提升潜力。
事件概述
2026年世界人工智能大会(WAIC)上,阿里云创始人王坚以一名18岁高中生利用退役卫星旧数据发现近150万未编目天体的案例,引出当前AI的发展瓶颈——大语言模型仅能处理文本化的人类知识,无法自主探索未知领域。他呼吁推动一场“范式变革”:让科学数据成为基础模型的“原住民”。
核心信息
- 现状局限:截至2025年12月,中国生成式AI用户达6.02亿,普及率42.8%,仅用2年(从ChatGPT算起)或1年(从DeepSeek-R1算起)达到这一水平,而互联网达到相同普及率用了15年。但当前AI本质是大语言模型,处理上限限于人类已有知识体系。
- 科学数据的关键性:科学数据(如天文观测信号、地震波、基因序列、化石记录等)多为非文本、不连续、含有噪声的原生数据。传统大模型无法直接理解或从中发现隐藏规律。
- 实践案例:
- 中国科学家团队利用10万个生物属、近2万个物种的化石数据,将地质时间轴精度从百万年级提升至万年级,该成果入选联合国“科学促进可持续发展十年”政策清单。
- 之江实验室已启动“科学基础模型”项目(内部代号“021”,寓意从0到1),并于2026年3月与瑞士联邦理工联合举办“AI+天文学”研讨会。
- 未来方向:将科学数据与文本、代码纳入同一语义空间,构建通用基础模型。届时AI可处理深空信号、大气环流、基因序列等原始信息,实现跨维度模式识别,从“执行命令的工具”进化为“主动探索的大脑”。
值得关注
当前大模型竞赛(如参数规模、推理能力)可能只是阶段性现象,真正的“范式革命”在于底层数据来源的扩展——从文本独占到科学数据融合。这一转变将对科研方法、教育模式、产业逻辑产生深远影响,正如功能机之争之于智能手机时代。
