Reflection AI发布Beam模型:美国回应中国开放AI,主打主权部署与强化学习

2026/10/07 17:27阅读量 4

美国初创公司Reflection AI于10月5日发布首个开放权重模型Beam,采用MoE架构(总参数5000亿/激活230亿),通过大规模自主预训练和强化学习实现高效推理。该模型被视为美国对中国主导的开放AI市场的战略回应,主要面向不愿使用中国模型的企业和政府客户。尽管绝对能力略逊于Kimi K3等领先模型,但其在编程、推理及智能体任务上的表现接近Qwen 3.8-Max,且推理成本显著降低。

事件概述

美国时间10月5日,成立仅两年的AI初创公司Reflection AI发布了其首个基础模型Beam。Beam是一个主攻编程、逻辑推理和智能体(Agent)任务的开放权重模型。市场普遍将其视为美国对中国在开源大模型领域领先地位的直接回应,旨在为那些希望掌控自身AI能力但不愿依赖中国模型的企业和政府提供替代方案。

核心技术与性能

  • 架构设计:Beam采用混合专家(MoE)架构,总参数量约为5000亿,但在推理过程中仅激活约230亿参数。作为对比,DeepSeek-V3激活370亿,Kimi K2激活320亿,智谱GLM-4.5激活320亿。
  • 训练数据与算力:预训练数据量达23.8万亿Token,高于DeepSeek-V3的14.8万亿和Kimi K2的15.5万亿。随后,公司利用10,500张Nvidia GB300 GPU连续运行4周,执行高强度强化学习(RL),生成了超过1亿次Rollout。
  • 性能对标:
    • 优势:在编程和智能体任务上,Beam的表现可与智谱GLM 5.2竞争,并接近阿里Qwen 3.8-Max。
    • 劣势:在绝对综合能力上,仍落后于Kimi K3等当前领先的闭源或半开源模型。
    • 效率:依靠大规模强化学习优化,Beam在处理相似难度推理任务时,消耗的Token数量和计算量仅为GLM 5.3或GPT-6 Luna等模型的1/3至1/4。
  • 技术路线验证:Reflection认为,随着预训练工程化成熟,下一阶段模型能力的提升将更多依赖于强化学习的规模化(Scaling RL)。Beam的成功证明了新公司可以通过大规模RL将较小激活参数的模型推向行业前列。

公司背景与资源

  • 创始团队:由前Google DeepMind研究员Misha Laskin和Ioannis Antonoglou创立。Antonoglou是AlphaGo核心团队成员,两人曾参与Gemini系列模型研发。
  • 融资与估值:公司累计融资超40亿美元,估值约250亿美元。Nvidia投资约8亿美元,双方关系紧密。
  • 算力支持:
    • 与云计算公司Nebius签署超10亿美元协议获取算力。
    • 与SpaceX签订算力协议,自今年7月起每月支付1.5亿美元,有效期至2029年。
    • 参与美国能源部Genesis Mission科研计划,为国家实验室提供开放模型。

商业模式与市场定位

  • 目标客户:主要面向大型企业、政府机构、公共部门以及“主权AI”项目。这些客户通常有数据隐私和安全合规要求,倾向于私有化部署。
  • 服务形态:不仅开放模型权重,还提供配套开源软件、API调用服务,以及支持在企业私有云、本地服务器或物理隔离环境中部署的方案。销售模式涵盖“模型+推理+软件栈+基础设施”。
  • 国际案例:今年3月,Reflection与韩国新世界集团签署合作备忘录,计划在韩国建设一座250MW的AI数据中心,为当地政府和企业提供主权AI服务,美国商务部长出席了签约仪式。

战略意义

Reflection的战略初衷原是基于“西方会出现足够强的开放模型”的判断,专注于强化学习和Agent研究。然而,随着DeepSeek V3等中国模型的崛起,中美开放模型差距拉大,Reflection被迫转向从头训练基础模型。Beam的发布标志着美国试图重新夺回开放模型体系的主导权,尽管目前其产品力尚未超越中国头部模型,但其背后的资本投入、算力资源及明确的政企市场定位,使其成为美国AI生态重建的重要一环。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。