谷歌DeepMind架构重组后发布Argon:以长上下文与性价比突围AI红海
2026/10/02 09:29阅读量 4
2026年9月30日,谷歌DeepMind在领导层重大调整后发布旗舰模型Argon。该模型将输出Token上限提升至100万,并在软件工程和企业自动化基准测试中取得领先,同时采取极具进攻性的低价策略。尽管跑分亮眼,但Argon在真实复杂场景中的表现及内部争议暴露了谷歌在追求产品化效率与保持科研深度之间的战略矛盾。
事件概述
2026年9月30日,谷歌DeepMind正式发布Gemini 4系列首款旗舰模型Argon。此次发布紧随8月份DeepMind高层架构的重大调整之后,标志着谷歌试图通过管理变革加速AI技术的商业化落地。Argon凭借百万级输出Token能力、特定领域的性能优势以及激进的定价策略,旨在帮助谷歌在竞争激烈的AI市场中重新确立前沿地位。
核心信息
1. 背景:DeepMind的“静默”权力交接
在Argon发布前两个月(2026年8月5日),Alphabet CEO桑达尔·皮查伊宣布DeepMind进行深层架构重组:
- 德米斯·哈萨比斯卸任日常运营,转任董事长及Alphabet首席科学家,专注于AGI长期战略。
- 科雷·卡武克丘奥卢升任高级副总裁,负责日常运营,强调“交付能力”优先于“探索自由度”。
- 杰夫·迪恩离开谷歌创办独立公益企业。
- 战略意图:权力中心从伦敦向加州转移,DeepMind正从独立的“研究飞地”转变为整合进谷歌全球产品体系(如搜索、Gmail、Chrome)的“高效产品引擎”。
2. Argon的技术亮点与基准表现
- 超长输出能力:输出Token上限从上一代的6.4万跃升至100万。这使模型能在单次推理中处理大型代码库迁移、深度研究等复杂任务,无需拆分多轮交互。
- 基准测试领先:在19项基准测试中,Argon宣称取得13项领先。
- DeepSWE v1.1(软件工程):得分77.9%,超越Claude Opus 5.5 (74.2%) 和 GPT-6 Astra (74.1%)。
- AutomationBench(企业自动化):得分51.3%,排名第一,比Claude Opus 5.5高出近9个百分点。
- CWE-bench v1(网络安全):得分68%,并列第一。谷歌称其发现了一项影响全球医院医疗软件的严重漏洞,而此前其他前沿模型未能识别。
- 实际工程应用:Argon已参与谷歌内部核心基础设施项目,包括Fuchsia Zircon内核(80万行C/C++代码)向Rust的迁移,以及libgav1视频解码器项目中约3.2万行SIMD代码的重写,新版本运行速度提升2.7倍。
3. 定价策略与市场定位
- 激进低价:推广期价格为输入2美元/百万Token,输出10美元/百万Token。缓存输入价格比标准输入低95%。
- 成本优势:据Artificial Analysis测算,折扣价下单个任务成本约1.99美元,比GPT-6 Astra低约40%。
- 战略信号:谷歌不再单纯追求“全能冠军”,而是聚焦企业知识工作、软件工程和网络安全等高价值场景,以性价比争夺开发者生态和企业客户。
4. 潜在风险与争议
- 实战与跑分的落差:
- 在更贴近真实复杂度的FrontierSWE v2测试中,Argon得分55.0%,落后于GPT-6 Astra (65.5%)超过10个百分点。
- 在科学推理测试Terminal-Bench Science 0.1中,也落后GPT-6 Astra超10个百分点。
- 彭博社报道指出,部分谷歌员工在日常编程工作中对Argon表现存疑,尤其在涉及前端设计等领域存在短板,引发外界对“benchmaxxing”(为刷榜优化)的质疑。
- 访问限制:Argon目前仅通过Fairwind计划向受信任的网络安全防御者开放,普通开发者和消费者需等待进一步的安全加固。这种分阶段发布引发了部分开发者关于“排队等待”的不满。
值得关注
Argon的发布是谷歌在经历Gemini 3.5 Pro项目搁置(据估损失高达4亿美元训练成本)后的双重反击。虽然Argon证明了谷歌仍具备训练前沿模型的能力,并找到了差异化的切入角度,但其在非受控环境下的能力衰减以及内部对实战效果的争议,表明谷歌尚未完全解决“研究深度”与“产品效率”之间的矛盾。在OpenAI和Anthropic迭代速度极快(平均每6天一个新旗舰)的背景下,Argon能否在真实工作流中证明其稳定性,将是谷歌能否真正“重回前沿”的关键考验。
