Gemini 3.8 Flash发布:性能逼近Opus 5,但单任务成本因Token消耗增加而上升
Google于9月2日发布Gemini 3.8 Flash,在长程软件工程及Agent任务中表现接近Anthropic的Opus 5,且保持原有API单价不变。然而,由于模型推理更复杂、输出Token量显著增加,实际单任务完成成本上涨约40%。这标志着AI定价逻辑正从“按Token计费”向“按任务结果计费”转变。
事件概述
Google于2026年9月2日正式上线Gemini 3.8 Flash。这是继8月13日Gemini 3.7 Flash之后,谷歌在六周内第三次更新Flash系列模型。该版本旨在应对Anthropic发布的Fable 5.1/Mythos 5.1以及OpenAI即将推出的Astra等前沿模型的竞争。
核心性能与基准测试
Gemini 3.8 Flash主要提升了代码生成(Coding)和自主智能体(Agent)能力,部分指标已触及顶级旗舰模型水平:
- 长程软件工程:在DeepSWE v1.1测试中得分73.7%,仅比Opus 5(74.0%)低0.3个百分点;相比上一代3.7 Flash(65.3%)提升8.4个百分点。
- 命令行Agent实战:在Terminal-Bench 2.1中得分89.4%,略微超过Opus 5的89.1%。
- 垂直领域Agent:在金融分析Vals Finance Agent v2中得分为61.4%(高于Opus 5的58.6%);在法律Agent测试Harvey中得分为10.0%(高于Opus 5的6.7%)。
- 通用推理:在HLE-Verified多学科专家推理测试中,两者表现持平(均为54.9% vs 54.4%)。
局限性:在更强调通用能力的复杂测试中,如Terminal-Bench 4.0(19.1% vs 51.8%)、GDPVal-AA v2知识工作(1545 Elo vs 1824)及OSWorld 2.0电脑操作(59.0% vs 75.4%),Gemini 3.8 Flash仍落后于Opus 5。Artificial Analysis的智能指数显示,3.8 Flash High档得分为59分,略低于Opus 5 Max的63分。
速度优势:尽管性能提升,3.8 Flash仍保持高吞吐量,输出速度达304.6 Token/秒,在比较组中排名第一。
价格机制与成本变化
虽然API标价未变,但实际使用成本显著上升,反映出“按任务付费”的趋势:
- API单价不变:输入0.75美元/百万Token,输出3.75美元/百万Token,缓存读取0.075美元/百万Token,与3.7 Flash一致。
- 单任务成本上涨:据Artificial Analysis测试,3.8 Flash High档完成一个Intelligence Index任务的平均成本为0.58美元,较3.7 Flash的0.40美元上涨约40%。
- 原因分析:模型进行了更多推理步骤和工具调用,导致平均输出Token增加30%(每个任务约4.8万个Token)。用户虽无需支付更高的Token单价,但需购买更多Token以完成任务。
这一现象与Anthropic Fable 5.1类似:尽管其将缓存读取价格降低75%,但由于输出Token量激增(约为前代的1.7倍),单任务成本反而上升了20%。这表明前沿模型正通过增加计算量(更长思考、更多输出)来换取成功率,导致计价单位从单纯的Token转向综合任务成本。
技术迭代与产品策略
- 快速迭代模式:谷歌采用类似软件开发的敏捷迭代方式,3.8 Flash基于3.7 Flash直接优化,而非底层架构换代。这种高频更新使得模型能迅速吸收真实用户反馈和专项训练成果。
- Cyber支线反哺主模型:新发布的Gemini 3.8 Flash Cyber在漏洞发现和修补测试中表现优异。谷歌指出,网络安全领域的专项训练所获得的编码和推理能力,已反向融入通用Flash模型的核心智能中。
- 组织调整支持:Google DeepMind高级副总裁Koray Kavukcuoglu统筹前沿研究、Gemini App及开发者团队,缩短了从研究到产品迭代的反馈链路。
行业影响
Gemini 3.8 Flash的发布揭示了大模型竞争的三个关键趋势:
- 性能趋同:Flash系列等非旗舰模型在特定任务上已具备挑战顶级旗舰的能力。
- 成本重构:随着Agent应用普及,单纯比较Token单价已失去意义,企业需关注“每任务成本”(Cost per Task)及性价比。
- 工程化迭代:模型更新频率加快,逐渐从“代际跃迁”转变为“持续版本更新”,依赖真实场景数据驱动优化。
