OpenAI发布719篇数学证明手稿,Mistral与Reflection推出开源模型挑战中国优势,安全研究员辞职引发行业反思
OpenAI于2026年10月6日通过未公开的前沿模型发布了719篇数学证明手稿,尽管此举符合部分披露建议,但仍被指未完全遵循关于避免将研究成果作为营销工具的规范。与此同时,法国Mistral和美国Reflection AI相继发布高性能开源权重模型,旨在缩小与中国在开源领域的差距并降低推理成本。此外,OpenAI资深安全研究员David Robinson因不满公司文化及发布策略而辞职,呼吁建立更严格的安全冗余机制。
OpenAI发布大量数学证明手稿
2026年10月6日,OpenAI在其公共GitHub仓库中发布了一批由内部未公开前沿模型生成的数学成果。此次发布包含719篇手稿,涵盖372个主题家族,其中许多证明已在Lean形式化系统中完成验证。除了代码和结果外,OpenAI还公开了10份模型推理摘要、计算资源估算(以ChatGPT Pro使用量表示)以及问题尝试统计数据。
该模型此前曾解决纳维-斯托克斯方程这一克雷数学研究所千禧年大奖难题之一。OpenAI表示,其咨询了高等研究院的“人工智能与数学顾问组”(AGMAI),并建立了论文修订和引用协议。然而,AGMAI在9月29日的建议中明确要求实验室披露模型名称、提示词和计算成本,并停止在无法被科学界访问的专有模型上测试高级问题,但媒体指出OpenAI并未完全遵循这一特定建议。OpenAI董事会称此次发布是“人类理解过程的开始”,而非终点。
Mistral与Reflection AI推出开源模型对标中国
西方两家实验室在数日内发布了旨在替代中国主导开源市场的前沿模型:
- Mistral Large 4 (Le Chonk):法国公司Mistral发布的万亿参数多模态模型,目前处于预览阶段,正式版预计月底上线。该模型针对编码、网络安全、制造、金融及电气工程等任务进行了优化,自称是目前除中国以外最强大的开源权重模型,性能接近部分专有模型。
- Beam:美国Reflection AI推出的文本专用混合专家(MoE)模型,拥有5010亿总参数和230亿活跃参数,基于23.8万亿token预训练,支持100万token上下文窗口。Reflection声称Beam在高级推理基准上与Z.ai的GLM-5.2持平,且推理计算成本仅为同类领先西方开源模型的1/3至1/4,但在绝对性能上略逊于Kimi K3或GLM-5.3等顶级开源模型。完整权重和技术细节将于本月公布。
OpenAI安全研究员辞职批评公司文化
OpenAI资深安全研究员David Robinson于2026年10月3日辞职,并在《大西洋月刊》发表文章称公司文化“已破裂”。Robinson曾参与起草当前的准备框架(Preparedness Framework)并监督12次前沿模型发布的安全报告。
他批评OpenAI依赖“试错法”进行系统发布,认为随着系统能力增强,这种模式必然导致规模日益扩大的失败案例,如Hugging Face系统被Agent突破事件所示。Robinson主张前沿实验室应像核电站或繁忙机场一样,建立多层冗余和谨慎的时间规划,以防止人为错误引发灾难。他还呼吁加强外部安全激励和更深层次的价值观对齐工作。此事件紧随Anthropic研究人员Jacob Coxon于9月的辞职及其对行业风险的警告之后,反映出AI安全领域对当前快速迭代模式的深层担忧。
