刘军教授:统计学是AI基石,未来核心在于不确定性量化
2026/09/20 17:15阅读量 4
美国国家科学院院士刘军指出,统计学与数学的根本区别在于研究“反问题”,即从观测数据反推总体特征以应对不确定性。人工智能革命的成功源于对统计思想的全面拥抱,深度学习、生成式模型及强化学习等核心技术均根植于回归分析、密度估计和随机梯度下降等统计方法。当前大模型在不确定性描述上存在欠缺,因此不确定性量化(如置信区间)将成为统计学未来发展的核心锚点。
事件概述
在2026年全国两会期间,人工智能与大模型成为热点话题。清华大学统计与数据科学系主任、美国国家科学院院士刘军在接受《世界科学》采访时指出,这些技术发展的背后离不开统计学这一基础学科。他强调,统计学不仅是数学的分支,更拥有独立的哲学体系,其核心在于研究不确定性并进行反问题推理,是人工智能与数据科学的理论基石。
核心信息
1. 统计学与数学的本质区别:正问题 vs 反问题
- 数学(正问题):给定条件计算事件概率。例如,已知罐中白黑球比例为7:3,计算抓取样本中特定比例的概率。
- 统计学(反问题):从观测数据反推总体特征。例如,通过抓取的样本(如9白1黑)推断罐中真实比例,并量化这种推断的不确定性(置信度)。
- 学科定位:统计学更接近人类认知过程(“窥一斑而知全豹”),属于交叉科学的基本架构,而非单纯的数学应用。它关注整体框架和解决实际问题的推动力,具有独特的价值观和方法论。
2. 辛普森悖论与分层分析的重要性
- 现象描述:在不同分组中成立的趋势,合并到整体数据后可能完全相反。例如,医生甲整体治愈率高于医生乙,但细分到轻症和重症组别后,医生乙在各组的治愈率均更高。
- 决策启示:决策时必须纳入相关条件与潜在变量进行分层分析,避免被表面结果误导。这一悖论深刻影响了人类对因果关系的认知方式。
3. AI革命的技术根源:全面拥抱统计思想
- 历史渊源:杰弗里·辛顿(Geoffrey Hinton)等先驱在神经网络冷门期(20世纪90年代)已尝试将统计方法嵌入模型。降维技术与主成分分析(PCA)密切相关,非线性降维最终导出了生成式模型的基本框架。
- 核心技术映射:
- 回归分析 → 推到极致即为深度学习,构成感知任务的技术基石。
- 密度估计 → 推到极致即为生成式模型。
- 随机逼近/随机梯度下降:源自1951年的罗宾斯-门罗算法,是强化学习和现代机器学习优化的核心手段。
- 结论:人工智能的核心技术手段均根植于统计学,统计学可视为与数学并列的自然语言,用于描述世界中的不确定性。
4. 未来核心锚点:不确定性量化
- 现状痛点:当前大模型和人工智能技术在不确定性的描述与量化方面较为欠缺。
- 统计学优势:统计学始终将置信区间、显著性等风险度量置于中心位置,具备成熟的风险评估体系。
- 发展方向:不确定性量化将是统计学未来若干年的重点研究方向,也是弥补当前AI缺陷的关键领域。
值得关注
- 因果推断理论:唐纳德·鲁宾提出的“没有操纵就没有因果关系”(no causation without manipulation)原则,强调了通过干预来界定可靠因果效应的重要性,纠正了诸如性别决定能力等错误归因。
- 排名聚合算法:刘军团队提出的BARD(贝叶斯排名数据聚合)及后续的分层-马洛斯模型,展示了统计学在处理复杂排序数据、筛选可靠评委方面的应用能力,体现了贝叶斯方法结合先验信息与客观证据的优势。
- 中文文本处理早期探索:早在监督学习普及前,统计学家已通过寻找共现字符串(词元)的方式解决古文分词问题,这与现代大语言模型的Tokenization原理高度一致,证明了统计学在自然语言处理领域的先导作用。
