Gemini 3.6 Flash 发布:价格降了、token省了,但性能被指原地踏步

2026/07/22 09:43阅读量 2

Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 及 3.5 Flash Cyber 三款新模型。3.6 Flash 主打更低成本和 token 效率,但 Artificial Analysis 评测显示其智能水平与上一代持平,网友普遍抱怨性能不及竞品、中文能力差。同时,旗舰模型 3.5 Pro 因代码能力未达预期而跳票,Google 已将预告转向 Gemini 4。

事件概述

Google 在近日发布三个新 AI 模型:Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber。官方强调新模型“更高效”“更聪明”“为 agent 而生”,但第三方评测和用户反馈显示,3.6 Flash 在智能水平上相比 3.5 Flash 并无明显提升,引发广泛调侃。

核心信息

1. Gemini 3.6 Flash

  • 定位:主力(workhorse)模型,侧重低成本、高效率。
  • 价格:输入 1.5 美元/百万 token,输出 7.5 美元/百万 token,比前代 3.5 Flash(输出 9 美元/百万 token)便宜。
  • token 节省:Artificial Analysis 数据显示,相比 3.5 Flash 少用 17% 输出 token,在 DeepSWE 基准上可节省高达 65%。
  • 基准成绩
    • DeepSWE:从 37% 提升至 49%。
    • MLE Bench(机器学习研究):从 49.7% 提升至 63.9%。
    • OSWorld-Verified(计算机操作):从 78.4% 提升至 83%。
    • GDPval-AA v2(知识工作):从 1349 提升至 1421。
  • 安全:升级 Frontier Safety 防护,重点针对 CBRN 和网络攻击。
  • 知识截止日期:从 2025 年 1 月推进至 2026 年 3 月。
  • 第三方评测:Artificial Analysis 指出,3.6 Flash 的“智能指数”得分与 3.5 Flash 完全相同。
  • 用户吐槽
    • 网友 Balder 实测认为三个新模型性能均比 3.5 Flash 差,存在基础解码问题、中文选词离谱、图片视频质量差、记忆混乱等问题。
    • 网友 Angel 指出,3.6 Flash 的性价比不如 GPT-5.6 Sol medium(价格更高但智能更低)。
    • 网友 Conor Dart 在 AI 生成游戏测试中发现纹理质量反而下降。

2. Gemini 3.5 Flash-Lite

  • 定位:更低成本的轻量模型,主打高吞吐、低延迟。
  • 价格:输入 0.3 美元/百万 token,输出 2.5 美元/百万 token。
  • 速度:每秒 350 个 token(Artificial Analysis 测量)。
  • 特性:支持调节“推理档位”,计算机操作内置为工具。
  • 基准提升
    • Terminal-Bench 2.1(代码与 agent):从 31% 提升至 54%。
    • GDM-MRCR v2(长上下文):从 60.1% 提升至 72.2%。
    • GDPval-AA v2:从 642 飙升至 1140。
  • 亮点:在部分 agent 和代码任务上反超前代 Gemma 3 Flash。

3. Gemini 3.5 Flash Cyber

  • 定位:专用于寻找和修复代码安全漏洞的模型。
  • 基础:基于 3.5 Flash 微调,配合 CodeMender 工具使用。
  • 表现:在 CyberGym 基准上达到第一梯队水平,且更省 token。
  • 限制:仅面向“可信合作伙伴”限量开放内测,锁定能力防止滥用。

值得关注

  • 旗舰模型 3.5 Pro 跳票:据彭博社等媒体报道,3.5 Pro 的代码生成能力未达内部预期,Google 曾更新训练数据但未起色,传闻已推翻原方案重训。
  • Google 转向预告 Gemini 4:AI 宣传负责人 Logan Kilpatrick 公开表示已启动“史上最雄心勃勃的 Gemini 4 预训练”,但被解读为在旗舰跳票背景下的转移视线。
  • 市场对比:OpenAI 的 Tibo 同日宣布,由于周活跃用户达 1000 万,Codex 和 ChatGPT Work 付费用户额度重置,形成鲜明反差。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。