Gemini 4 Argon 发布:知识写作能力领跑,编程表现存疑
2026/10/01 08:31阅读量 2
Google 正式发布 Gemini 4 Argon 旗舰模型,在 18 项基准测试中占据 13 项第一,尤其在金融分析、法律推理及长文本处理上表现卓越,输出上限提升至 100 万 token。然而该模型在代码构建和终端操作等工程类任务中排名垫底,且第三方报道指出其实际性能与跑分存在落差。尽管定价极具竞争力,但其长期停更后的真实实力仍需市场进一步验证。
事件概述
Google 正式发布了停更七个半月的旗舰模型 Gemini 4 Argon。该模型目前仅通过 Fairwind 计划向少量网络安全合作伙伴开放,尚未全面公开,预计将优先向付费 API 用户和 Google AI Ultra 订阅者开放。
核心性能数据
根据官方公布的数据,Gemini 4 Argon 在 18 项测试中有 13 项取得领先成绩,呈现出明显的“偏科”特性:
- 知识与长文本优势显著:
- 在涉及真实金融分析的 Vals Finance Agent v2 和律师工作的 Harvey’s Legal Agent Benchmark 测试中,表现大幅领先其他模型。
- 支持 100 万 token 的输出上限(上一代为 6.4 万),在 GraphWalks 超长上下文测试中领先其他旗舰模型超过 10%。
- 幻觉率降至 15%,为前沿模型中最低,面对不确定信息时更倾向于回答“不知道”。
- 编程与工程能力较弱:
- 在 DeepSWE v1.1 测试中达到 77.9%,略优于 GPT-6 Astra 和 Claude Opus 5.5。
- 但在 FrontierSWE v2(从零构建项目)和 Terminal-Bench 4.0(Linux 终端操作)中处于垫底水平。
- 第三方盲评平台 Arena.ai 显示,其在 Text Arena 排名第一,但在 Code Arena 和 Agent Arena 中仅排第 8。
定价策略
Gemini 4 Argon 的 API 定价极具竞争力,旨在提供极高的“智价比”:
- 输入价格:每百万 token 2 美元。
- 输出价格:每百万 token 10 美元。
- 缓存命中价格:0.1 美元(原价的 5%)。
- 当前优惠期结束后价格预计翻倍,但相比 GPT-6 Astra 和 Fable 5.1 便宜约五分之一,大致持平 GPT-6.1 Sol 和 Sonnet 5.5。
行业观察与争议
尽管跑分亮眼,但 Gemini 4 的实际表现面临质疑:
- 内部怀疑:彭博社援引知情人士称,Google 内部员工对 Gemini 4 的真实性能持怀疑态度,认为其在编码等实际任务中效果不尽如人意。
- 刷榜嫌疑:此前 Gemini 3.8 Flash 跑分与实测落差巨大,此次 Gemini 4 的全面 SOTA(State of the Art)成绩也被部分观察者视为可能经过特殊优化。
- 迭代滞后风险:由于长达七个半月的停更,竞争对手(如 ChatGPT 和 Claude)在此期间已完成版本迭代,Gemini 4 的实际落地体验可能不如纸面数据强劲。
总体而言,Gemini 4 Argon 的发布标志着 Google 重新回到大模型竞争赛道,其下限有保障,但能否弥补长期停滞带来的差距,仍需通过大规模实际应用来检验。
