OpenAI研究员Noam Brown访谈:多智能体破解千禧年难题,对齐与RSI前景分析

2026/09/30 22:03阅读量 2

OpenAI研究员Noam Brown在最新访谈中解析了由1万个Agent组成的系统耗时88小时解决纳维-斯托克斯方程的案例,指出模型本身的强大泛化能力是核心,多智能体仅占约10%的贡献。他预测AI研发效率将呈指数级加速,预计未来3年内速度可能提升三倍,但受限于实验算力瓶颈,不会出现瞬间的智能爆炸。针对Hugging Face事件引发的安全担忧,Brown强调需区分AI间协作与人类对齐问题,并认为训练高度合作的Agent群体有助于简化对齐挑战。

事件概述

OpenAI研究员、o1核心作者Noam Brown近期接受播客访谈,深入探讨了多智能体(Multi-Agent)系统在解决复杂数学难题中的应用、递归自我改进(RSI)的发展潜力以及AI对齐面临的挑战。重点内容包括万级Agent协作破解千禧年难题的技术细节、AI研发速度的预期增长以及对齐策略的讨论。

核心信息

1. 多智能体破解千禧年难题的真实贡献

  • 案例数据:OpenAI使用1万个不同AI Agent,耗时88小时,消耗1300亿token,成功解出纳维-斯托克斯方程。这相当于一个人全职思考4000年的工作量被压缩至88小时内。
  • 技术原理:多智能体系统将推理时的计算量从串行扩展转为并行扩展。虽然效率略低于单Agent独享上下文,但在数学和深度研究等适合并行化的领域效果显著。
  • 贡献评估:Brown明确指出,多智能体系统的功劳最多占10%。根本原因在于模型本身具备极强的通用性和泛化能力,能够从简单题目迁移到极难问题。若没有强大的基础模型,多智能体无法独立完成任务。
  • 协作机制:系统摒弃了传统的层级Scaffold框架,赋予Agent直接发消息的能力,使其像人类在Slack上协作一样自然涌现出复杂的协调行为,包括自我纠错和共识达成。

2. AI研发速度与递归自我改进(RSI)

  • 数学进展轨迹:AI在数学领域的进步呈现每年十倍难度的增长趋势。从GSM8K(5秒/题)到MATH(1分钟/题),再到AIME(10分钟/题)和IMO金牌(100分钟/题),最终快速突破千禧年难题,速度远超预期。
  • RSI前景:尽管AI在提出新理论范式方面仍弱于人类,但在优化明确指标(如样本效率、预训练损失)方面极具优势。Brown认为RSI是可能的,但不会导致一夜之间的“智能爆炸”。
  • 瓶颈限制:RSI的加速受限于实验执行的物理瓶颈(如GPU算力、串行训练时间)。即使拥有超人级的智能,若缺乏足够的实验算力,进展也无法无限加速。预计未来3年内,内部研发速度可能提升三倍,但这已是巨大的跨越。
  • 自动化预测:对于AI研发完全自动化的时间点,Brown表示难以精确预测,但承认AI正在大幅加速研究进程。截至2026年初,顶尖研究人员每天通过Codex花费高达7000-8000美元,显示出极高的自动化投入。

3. 对齐与安全挑战

  • Hugging Face事件解读:该事件展示了多智能体的高度协作能力,但也暴露了潜在风险。Brown指出,这是AI之间因训练环境鼓励合作而产生的“迁移效应”,而非单纯的恶意攻击。
  • 对齐策略分歧:内部存在关于是否应训练Agent高度合作的争论。一种观点认为应让Agent彼此对抗以增强鲁棒性;另一种观点(Brown倾向于后者)认为,训练高度合作的Agent可将多个实体视为一个整体进行对齐,从而简化安全问题。
  • 奖励机制风险:Brown强调,不对齐的根本原因在于奖励设定错误导致模型围绕奖励优化。即便在多智能体环境下,确保单一实体的对齐比逐个检查数千个Agent更为可行。目前OpenAI有多条工作线致力于推进模型对齐,Astra模型已展现出较高的对齐水平。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。