Gemini 3.8 Flash 发布:跑分逼近旗舰,实测仍显粗糙

2026/09/03 06:52阅读量 1

Google 光速发布 Gemini 3.8 Flash,官方宣称其在编程、多模态及专业领域表现接近 Opus 5 等顶级模型,且价格保持不变。然而实测显示,该模型虽生成速度极快,但在复杂任务中常出现细节缺失和逻辑粗糙的问题,被指为“快速堆砌结果”而非深度推理。这反映了 Google 在放弃短期冲击最强模型后,转向以 Flash 系列维持市场份额的战略现实。

事件概述

Google 于近日凌晨正式发布 Gemini 3.8 Flash,这是六周内推出的第三款 Flash 系列模型。官方将其定位为“迄今最聪明的 Flash 模型”,旨在承担长程软件工程、自主 Agent(智能体)及复杂企业工作流等高难度任务,试图弥补因 Gemini 3.5 Pro 交付失败而留下的旗舰能力空缺。

核心信息

1. 性能与跑分数据

Google 公布的基准测试数据显示,3.8 Flash 在多项指标上显著超越前代,并逼近 Claude Opus 5 等前沿模型:

  • 长程软件工程:在 DeepSWE v1.1 测试中得分 71.0%(3.7 Flash 为 65.3%),距离 Opus 5 的 74.0% 仅一步之遥。
  • 综合知识:在 HLE-Verified 测试中得分 54.9%,略高于 Opus 5 的 54.4%。
  • 多模态能力:在 CharXiv Reasoning(图表理解)中得分 86.2%,超过 Opus 5;在 LVBench(长视频处理)中得分 87.8%,表现优于 GPT-5.6 Sol 和 Opus 5。
  • 垂直领域:在金融(Vals Finance Agent V2)和法律(Harvey’s Legal Agent Benchmark)任务中均超过更昂贵的竞品模型。

此外,同步发布的 3.8 Flash Cyber 专为网络安全设计,在内部漏洞发现测试中成功率超 70%,但仅限通过 Fairwind Program 向可信机构提供。

2. 定价策略

  • 当前价格:保持与 3.7 Flash 一致,输入 $0.75/百万 Token,输出 $3.75/百万 Token。
  • 未来调整:该优惠价为限时政策,预计将于 2027 年 1 月 1 日 恢复至标准价格(输入 $1.5,输出 $7.5)。Google 暗示由于迭代速度快,此优惠价可能持续覆盖多个版本周期。

3. 技术机制

Google 解释称,3.8 Flash 的性能提升主要源于“更努力的推理”:面对复杂问题时,它会执行更多推理步骤、反复调用工具并自我检查。这种机制可能导致 Token 消耗增加,因此 Google 建议对计算效率敏感的用户降低推理档位或继续使用 3.7 Flash。

值得关注:实测与官方的落差

尽管跑分亮眼,但实际用户体验与官方宣传存在明显温差,呈现出“速度快但质量糙”的特点:

  • 3D 建模测试:在要求使用 Three.js 构建空客 H145 直升机模型的测试中,模型在不到一分钟内生成代码,但成品细节粗糙,部件关系错误,被形容为“鸡仔饼与鸡仔的关系”。
  • 物理模拟测试:在 3D 水流模拟任务中,生成的地形结构存在明显逻辑漏洞(如“漏水”现象)。
  • 社区反馈:用户普遍认可其响应速度,但指出其在真实编程和生成任务中容易草率理解需求,输出形式完整但细节缺失的结果。

分析结论
官方演示往往依托于完整的 Agent 框架、多轮指令循环及专用工具环境(如 Antigravity + Nano Banana),展示了模型的技术上限;而普通用户的单次自然语言指令则暴露了模型独立工作的下限。目前,3.8 Flash 更像是一个高效的“Agent 零件”,尚不足以单独支撑可靠的自主工作流,其判断力、稳定性和完成度与真正的旗舰模型仍有差距。

战略背景

此次发布折射出 Google AI 战略的调整:

  1. 资源倾斜:在 Gemini 3.5 Pro 受挫后,Google 短期内不再押注 Fable/Opus 级别的超大规模模型竞赛,转而集中资源开发成本更低、迭代更快的 Flash 系列。
  2. 市场定位:Flash 系列需负责守住用户基本盘。Gemini App 月活已超 10 亿,大众用户对 AI 的需求主要集中在搜索、总结、创作等高频场景,而非复杂的零日漏洞挖掘或长达数小时的自主工作流。
  3. 长期目标:Gemini 4 仍承担着重返第一梯队的使命,但在其到来之前,Flash 必须强行承担旗舰代言人的角色,导致其在“极致性价比”与“旗舰级能力”之间面临巨大的张力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。