2026年7月21日,Google一口气推出了三款全新AI模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。官方一如既往地宣称它们"更高效""更智能""专为大规模AI Agent设计"。然而,开发者社区的反应却并不一致,不少人认为这次更新的实际体验与官方宣传之间存在明显差距。
本文将从技术规格、基准测试、定价策略和社区真实反馈等维度,全面拆解Gemini 3.6 Flash的真实表现。
Gemini 3.6 Flash 的定位与核心升级点
Google将Gemini 3.6 Flash定位为"干活模型"(workhorse),也就是说,它并非为了争夺排行榜第一的旗舰型号,而是面向日常开发任务和AI Agent工作流的主力模型。作为今年5月I/O大会上发布的3.5 Flash的迭代版本,3.6 Flash主要在以下几个方向进行了升级。
Token 效率提升
这是Google反复强调的一大亮点。根据Artificial Analysis Index的数据,3.6 Flash相比3.5 Flash减少了约17%的输出token使用量。在DeepSWE等场景下,token节省幅度甚至高达65%。
Google还表示,该模型在执行多步任务时推理步数更少、工具调用频次更低。换句话说,完成同样的工作量,3.6 Flash的路径更短,计费也更少。
价格下调
Gemini 3.6 Flash的定价为每百万token输入1.5美元、输出7.5美元。相比上一代3.5 Flash每百万token输出9美元的价格,降幅约为17%。对于需要大规模调用AI Agent的任务来说,这一成本差异在总账单上会体现得非常明显。
代码与 Agent 能力增强
代码能力是3.6 Flash主推的升级方向。官方公布的基准数据如下:
| 基准测试 | Gemini 3.5 Flash | Gemini 3.6 Flash | 提升幅度 |
|---|---|---|---|
| DeepSWE | 37% | 49% | +12pp |
| MLE-Bench | 49.7% | 63.9% | +14.2pp |
| OSWorld-Verified(计算机操作) | 78.4% | 83% | +4.6pp |
| GDPval-AA v2(知识工作) | 1349 | 1421 | +72 |
从数据来看,DeepSWE的提升幅度不小,从37%跃升至49%。MLE-Bench的增长更为显著,接近14个百分点。Google还特别提到,3.6 Flash生成的代码冗余更少,执行循环更短,更贴近生产环境的要求。
计算机操作(Computer Use)也已成为Gemini API和企业版的内置工具,可直接调用,无需额外配置。
知识截止日期更新
还有一个不太显眼但很实用的更新:Gemini 3.6 Flash的知识截止日期从2025年1月推进到了2026年3月。对于需要模型了解近期事件的应用场景来说,这一更新非常必要。
安全防护升级
安全方面,Google称3.6 Flash上线了升级版的Frontier Safety框架,重点强化了对CBRN(化学、生物、放射性、核)和网络攻击类滥用的防御,同时减少了对正常请求的误拒率。
配角也有亮点:Gemini 3.5 Flash-Lite
本次同步发布的3.5 Flash-Lite定位比3.6 Flash再低一档,专门针对高吞吐、低延迟的任务场景,例如批量文档处理和Agent搜索。
几个关键指标:
速度:每秒约350个token,是3.5系列中最快的
价格:每百万token输入0.3美元、输出2.5美元
支持推理档位调节,低配任务用最低档追求速度,复杂子任务可以把思考深度往上调
Flash-Lite在部分Agent和代码任务上的表现令人意外。例如在SWE-Bench Pro上,Flash-Lite取得了54.2%的成绩,而老一代的Gemini 3 Flash只有49.6%。OSWorld-Verified也是如此,74.0%对65.1%。一个定位更低、价格更便宜的模型,在不少任务上反而超越了上一代的正式版,确实有些"以下犯上"的意味。
安全领域的新尝试:Gemini 3.5 Flash Cyber
第三个模型3.5 Flash Cyber风格有所不同,专门用于查找和修复代码中的安全漏洞。它基于3.5 Flash微调而来,配合Google自家的CodeMender工具使用。
不过,该模型目前仅面向可信合作伙伴进行限量内测,普通开发者暂时无法使用。Google给出的理由是漏洞检测能力本身具有两面性,需要先确保防守方有足够的时间来利用,再考虑更大范围的开放。
社区怎么看:争议不小
官方数据看起来不错,但社区的反馈却明显分化。
第三方测评的冷水
Artificial Analysis直接泼了一盆冷水:Gemini 3.6 Flash的智能指数(Intelligence Index)得分为50,与3.5 Flash完全相同。也就是说,尽管token效率提高了、成本降低了,但模型本身的推理和理解能力并没有实质性进步。
对比同期竞品,3.6 Flash的智能指数低于Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5等多个模型。有用户在X(原Twitter)上直接评价:"分数一模一样,竞品一堆比它强,这升级升了个寂寞。"
性价比的质疑
另一个让开发者不满的地方是性价比。有用户指出,Gemini 3.6 Flash的使用成本比GPT-5.6 Sol Medium还高,但智能水平却更低。Flash系列一直以来的卖点就是性价比,结果在性价比这个核心指标上被竞品反超,处境确实有些尴尬。
作为参照,OpenAI的Codex在同一时间宣布周活跃用户已达1000万,并为付费用户发放了新一轮额度。两条消息放在一起看,对比感很强。
实测反馈的落差
也有开发者做了更细致的实际测试。例如,用Google自家的Antigravity来运行AI生成游戏任务,结果并不理想,纹理质量反而出现了退化。还有用户反映3.6 Flash在中文选词上经常出错、生成的图片和视频质量不稳定、多轮对话中偶尔会出现记忆混乱和工具调用错误等问题。
当然,也有正面的反馈。Hebbia、Harvey、Figma、JetBrains等企业客户肯定了3.6 Flash在文档解析、图表数据分析、报告生成等多模态知识工作中的表现。对于这类结构化任务,3.6 Flash的效率提升是实实在在的。
绕不开的问题:Gemini 3.5 Pro 去哪了?
发布了一堆Flash,社区更关心的问题其实是:旗舰级的Gemini 3.5 Pro到底什么时候出?
Google官方说法是"正在和合作伙伴测试,准备好就上线"。但据彭博社等多家媒体报道,3.5 Pro的代码生成能力一直未能达到内部预期,6月份专门更新了一版训练数据来补强代码短板,但效果依然不理想。有消息称Google甚至推翻了原有训练方案,从头重新训练。
与此同时,Google AI负责宣传的Logan Kilpatrick已经开始将公众注意力引导到Gemini 4上,声称Gemini 4的预训练已经启动,并且进展令人兴奋。在旗舰模型跳票的背景下,这番表态多少有些"先别急,大的要来了"的意味。
怎么理解这次发布:省成本的路走得通,但智能还欠着
综合来看,Gemini 3.6 Flash这次发布的逻辑比较清晰:Google在token效率和成本控制上确实做了有效的工作,17%的token节省和对应的降价,对于大规模部署AI Agent的企业用户来说具有实际价值。
但问题在于,效率的提升并没有伴随智能水平的提高。Artificial Analysis的智能指数原地不动就是最好的说明。在当前竞争激烈的模型市场里,Sonnet 5、GPT-5.6系列、Grok 4.5等竞品都在同步甚至更快地推进,单纯靠"更省"已经不足以构成竞争优势。
Flash-Lite倒是一个值得关注的产品。它在极低价格下展现出了不错的任务完成能力,对于需要大批量处理轻量级任务的场景,是一个实用的选择。
至于Gemini 3.5 Pro的缺席和Gemini 4的画饼,某种程度上反映了Google在前沿模型竞争中面临的压力。能不能在下一代产品上实现真正的突破,可能才是决定Gemini系列前途的关键。
模型多了,选择也多了
从这次发布也能看出一个趋势:市场上的模型越来越多,定位越来越细分。Google自己一口气就出了三个,加上OpenAI、Anthropic、Meta、DeepSeek等厂商的产品,开发者面对的选择已经非常繁杂。
不同的任务适合不同的模型,轻量级的用Flash-Lite,需要深度推理的用Pro或旗舰级别,代码任务和知识任务的最优选择也经常不同。实际开发中,频繁切换模型、管理不同厂商的API Key、处理不同的接口格式,确实是一件麻烦事。
写在最后
Gemini 3.6 Flash交出的这份答卷,优点和短板都很明确。省token、降成本、缩短Agent执行链路,这些改进对企业级批量部署有实在的好处。但智能指数原地踏步、性价比被竞品反超、旗舰Pro型号迟迟不到位,这些问题同样摆在台面上,回避不了。
对开发者来说,现阶段更务实的做法可能不是押注某一个模型,而是保持灵活。模型市场正处在快速洗牌期,今天的最优选择三个月后未必还是。与其纠结于某一家的产品路线,不如把精力放在架构层面,确保自己的应用能够低成本地适配不同模型。
Google把赌注押在了Gemini 4上。能不能翻盘,就看下一手牌了。
