谷歌发布Gemini三款Flash新模型,旗舰3.5 Pro跳票,市场反应冷淡
2026/07/22 06:08阅读量 2
谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款新模型,主打省token和低成本,但第三方评测显示3.6 Flash智能水平与上一代基本持平,性价比遭质疑。旗舰3.5 Pro因代码能力未达预期而跳票,谷歌已将宣传重心转向Gemini 4。用户实测反馈新模型存在多种性能问题,未能扭转Gemini能力下滑的负面印象。
事件概述
谷歌发布三款新Flash模型(3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyber),但市场评价不佳,旗舰3.5 Pro继续跳票,用户对Gemini能力下滑的调侃未因本次发布而改善。
核心信息
1. Gemini 3.6 Flash(主力模型)
- 定位:3.5 Flash的小迭代,主打节省输出token(比上一代少用17%,DeepSWE场景节省65%)。
- 价格:输入1.5美元/百万token,输出7.5美元/百万token(上一代输出9美元)。
- 性能提升:DeepSWE基准从37%提升至49%;MLE Bench从49.7%升至63.9%;OSWorld-Verified从78.4%升至83%;GDPval-AA v2从1349升至1421。
- 知识截止:更新至2026年3月。
- 安全:升级Frontier Safety防护,重点关注CBRN和网络攻击抗越狱能力。
2. Gemini 3.5 Flash-Lite(高吞吐低延迟)
- 价格:输入0.3美元/百万token,输出2.5美元/百万token,每秒可输出350个token。
- 特点:支持调整推理档位,可应对不同复杂度任务。
- 对比:在SWE-Bench Pro(54.2% vs 49.6%)和OSWorld-Verified(74.0% vs 65.1%)等任务上反超旧款3 Flash。
3. Gemini 3.5 Flash Cyber(安全专用)
- 基于:3.5 Flash微调,配合CodeMender工具使用。
- 能力:CyberGym基准达到第一梯队水平,比大模型更省token。
- 开放:仅对“可信合作伙伴”限量内测,防止被用于攻击。
4. 旗舰3.5 Pro跳票
- 官方仅称“正在和合作伙伴测试”,未公布上线时间。
- 据彭博社等报道,3.5 Pro的代码生成能力未达内部预期,谷歌曾更新训练数据补短板仍无起色,甚至有传闻从零重训。
- 谷歌AI宣传委员Logan Kilpatrick已将宣传重点转向Gemini 4,引发“画饼续命”质疑。
市场与用户反馈
- 第三方评测:Artificial Analysis指出3.6 Flash智能水平与3.5 Flash基本持平,全行业排名低于Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5等竞品。网友Angel称其使用成本比GPT-5.6 Sol medium更高但智能更低,冲击Flash系列的“性价比”定位。
- 用户实测:网友Balder反映新模型存在基础解码错误、中文选词离谱、多模态生成质量差、记忆混乱、工具调用错误等问题。
- 整体印象:从去年起网友就调侃Gemini能力持续下滑,本次发布未能扭转负面印象,反而引发更多吐槽。谷歌目前仅靠Flash模型维持存在感,Gemini 4若再翻车,能力下滑的调侃可能成真。
