Gemini 3.6 Flash 发布:价格降了、token省了,但性能被指原地踏步
2026/07/22 09:43阅读量 2
Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 及 3.5 Flash Cyber 三款新模型。3.6 Flash 主打更低成本和 token 效率,但 Artificial Analysis 评测显示其智能水平与上一代持平,网友普遍抱怨性能不及竞品、中文能力差。同时,旗舰模型 3.5 Pro 因代码能力未达预期而跳票,Google 已将预告转向 Gemini 4。
事件概述
Google 在近日发布三个新 AI 模型:Gemini 3.6 Flash、3.5 Flash-Lite 以及专用于网络安全的 3.5 Flash Cyber。官方强调新模型“更高效”“更聪明”“为 agent 而生”,但第三方评测和用户反馈显示,3.6 Flash 在智能水平上相比 3.5 Flash 并无明显提升,引发广泛调侃。
核心信息
1. Gemini 3.6 Flash
- 定位:主力(workhorse)模型,侧重低成本、高效率。
- 价格:输入 1.5 美元/百万 token,输出 7.5 美元/百万 token,比前代 3.5 Flash(输出 9 美元/百万 token)便宜。
- token 节省:Artificial Analysis 数据显示,相比 3.5 Flash 少用 17% 输出 token,在 DeepSWE 基准上可节省高达 65%。
- 基准成绩:
- DeepSWE:从 37% 提升至 49%。
- MLE Bench(机器学习研究):从 49.7% 提升至 63.9%。
- OSWorld-Verified(计算机操作):从 78.4% 提升至 83%。
- GDPval-AA v2(知识工作):从 1349 提升至 1421。
- 安全:升级 Frontier Safety 防护,重点针对 CBRN 和网络攻击。
- 知识截止日期:从 2025 年 1 月推进至 2026 年 3 月。
- 第三方评测:Artificial Analysis 指出,3.6 Flash 的“智能指数”得分与 3.5 Flash 完全相同。
- 用户吐槽:
- 网友 Balder 实测认为三个新模型性能均比 3.5 Flash 差,存在基础解码问题、中文选词离谱、图片视频质量差、记忆混乱等问题。
- 网友 Angel 指出,3.6 Flash 的性价比不如 GPT-5.6 Sol medium(价格更高但智能更低)。
- 网友 Conor Dart 在 AI 生成游戏测试中发现纹理质量反而下降。
2. Gemini 3.5 Flash-Lite
- 定位:更低成本的轻量模型,主打高吞吐、低延迟。
- 价格:输入 0.3 美元/百万 token,输出 2.5 美元/百万 token。
- 速度:每秒 350 个 token(Artificial Analysis 测量)。
- 特性:支持调节“推理档位”,计算机操作内置为工具。
- 基准提升:
- Terminal-Bench 2.1(代码与 agent):从 31% 提升至 54%。
- GDM-MRCR v2(长上下文):从 60.1% 提升至 72.2%。
- GDPval-AA v2:从 642 飙升至 1140。
- 亮点:在部分 agent 和代码任务上反超前代 Gemma 3 Flash。
3. Gemini 3.5 Flash Cyber
- 定位:专用于寻找和修复代码安全漏洞的模型。
- 基础:基于 3.5 Flash 微调,配合 CodeMender 工具使用。
- 表现:在 CyberGym 基准上达到第一梯队水平,且更省 token。
- 限制:仅面向“可信合作伙伴”限量开放内测,锁定能力防止滥用。
值得关注
- 旗舰模型 3.5 Pro 跳票:据彭博社等媒体报道,3.5 Pro 的代码生成能力未达内部预期,Google 曾更新训练数据但未起色,传闻已推翻原方案重训。
- Google 转向预告 Gemini 4:AI 宣传负责人 Logan Kilpatrick 公开表示已启动“史上最雄心勃勃的 Gemini 4 预训练”,但被解读为在旗舰跳票背景下的转移视线。
- 市场对比:OpenAI 的 Tibo 同日宣布,由于周活跃用户达 1000 万,Codex 和 ChatGPT Work 付费用户额度重置,形成鲜明反差。
