Gemini 4 Argon 发布:知识写作能力领跑,编程表现存疑

2026/10/01 08:31阅读量 2

Google 正式发布 Gemini 4 Argon 旗舰模型,在 18 项基准测试中占据 13 项第一,尤其在金融分析、法律推理及长文本处理上表现卓越,输出上限提升至 100 万 token。然而该模型在代码构建和终端操作等工程类任务中排名垫底,且第三方报道指出其实际性能与跑分存在落差。尽管定价极具竞争力,但其长期停更后的真实实力仍需市场进一步验证。

事件概述

Google 正式发布了停更七个半月的旗舰模型 Gemini 4 Argon。该模型目前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,尚未全面公开,预计将优先向付费 API 用户和 Google AI Ultra 订阅者开放。

核心性能数据

根据官方公布的数据,Gemini 4 Argon 在 18 项测试中有 13 项取得领先成绩,呈现出明显的“偏科”特性:

  • 知识与长文本优势显著:
    • 在涉及真实金融分析的 Vals Finance Agent v2 和律师工作的 Harvey’s Legal Agent Benchmark 测试中,表现大幅领先其他模型。
    • 支持 100 万 token 的输出上限(上一代为 6.4 万),在 GraphWalks 超长上下文测试中领先其他旗舰模型超过 10%。
    • 幻觉率降至 15%,为前沿模型中最低,面对不确定信息时更倾向于回答“不知道”。
  • 编程与工程能力较弱:
    • 在 DeepSWE v1.1 测试中达到 77.9%,略优于 GPT-6 Astra 和 Claude Opus 5.5。
    • 但在 FrontierSWE v2(从零构建项目)和 Terminal-Bench 4.0(Linux 终端操作)中处于垫底水平。
    • 第三方盲评平台 Arena.ai 显示,其在 Text Arena 排名第一,但在 Code Arena 和 Agent Arena 中仅排第 8。

定价策略

Gemini 4 Argon 的 API 定价极具竞争力,旨在提供极高的“智价比”:

  • 输入价格:每百万 token 2 美元。
  • 输出价格:每百万 token 10 美元。
  • 缓存命中价格:0.1 美元(原价的 5%)。
  • 当前优惠期结束后价格预计翻倍,但相比 GPT-6 Astra 和 Fable 5.1 便宜约五分之一,大致持平 GPT-6.1 Sol 和 Sonnet 5.5。

行业观察与争议

尽管跑分亮眼,但 Gemini 4 的实际表现面临质疑:

  1. 内部怀疑:彭博社援引知情人士称,Google 内部员工对 Gemini 4 的真实性能持怀疑态度,认为其在编码等实际任务中效果不尽如人意。
  2. 刷榜嫌疑:此前 Gemini 3.8 Flash 跑分与实测落差巨大,此次 Gemini 4 的全面 SOTA(State of the Art)成绩也被部分观察者视为可能经过特殊优化。
  3. 迭代滞后风险:由于长达七个半月的停更,竞争对手(如 ChatGPT 和 Claude)在此期间已完成版本迭代,Gemini 4 的实际落地体验可能不如纸面数据强劲。

总体而言,Gemini 4 Argon 的发布标志着 Google 重新回到大模型竞争赛道,其下限有保障,但能否弥补长期停滞带来的差距,仍需通过大规模实际应用来检验。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。