游乐游手机版
首页/AI教程/文章详情

Gemini 3.6 Flash发布:省Token但智商存疑

时间:2026-07-23 22:00
2026年7月21日,Google一口气推出了三款全新AI模型:Gemini 3 6 Flash、Gemini 3 5 Flash-Lite和Gemini 3 5 Flash Cyber。官方一如既往地宣称它们 "更高效 " "更智能 " "专为大规模AI Agent设计 "。然而,开发者社区的反应却并不一致,

2026年7月21日,Google一口气推出了三款全新AI模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。官方一如既往地宣称它们"更高效""更智能""专为大规模AI Agent设计"。然而,开发者社区的反应却并不一致,不少人认为这次更新的实际体验与官方宣传之间存在明显差距。

本文将从技术规格、基准测试、定价策略和社区真实反馈等维度,全面拆解Gemini 3.6 Flash的真实表现。

Gemini 3.6 Flash 的定位与核心升级点

Google将Gemini 3.6 Flash定位为"干活模型"(workhorse),也就是说,它并非为了争夺排行榜第一的旗舰型号,而是面向日常开发任务和AI Agent工作流的主力模型。作为今年5月I/O大会上发布的3.5 Flash的迭代版本,3.6 Flash主要在以下几个方向进行了升级。

Token 效率提升

这是Google反复强调的一大亮点。根据Artificial Analysis Index的数据,3.6 Flash相比3.5 Flash减少了约17%的输出token使用量。在DeepSWE等场景下,token节省幅度甚至高达65%。

Google还表示,该模型在执行多步任务时推理步数更少、工具调用频次更低。换句话说,完成同样的工作量,3.6 Flash的路径更短,计费也更少。

价格下调

Gemini 3.6 Flash的定价为每百万token输入1.5美元、输出7.5美元。相比上一代3.5 Flash每百万token输出9美元的价格,降幅约为17%。对于需要大规模调用AI Agent的任务来说,这一成本差异在总账单上会体现得非常明显。

代码与 Agent 能力增强

代码能力是3.6 Flash主推的升级方向。官方公布的基准数据如下:

基准测试Gemini 3.5 FlashGemini 3.6 Flash提升幅度
DeepSWE37%49%+12pp
MLE-Bench49.7%63.9%+14.2pp
OSWorld-Verified(计算机操作)78.4%83%+4.6pp
GDPval-AA v2(知识工作)13491421+72

从数据来看,DeepSWE的提升幅度不小,从37%跃升至49%。MLE-Bench的增长更为显著,接近14个百分点。Google还特别提到,3.6 Flash生成的代码冗余更少,执行循环更短,更贴近生产环境的要求。

计算机操作(Computer Use)也已成为Gemini API和企业版的内置工具,可直接调用,无需额外配置。

知识截止日期更新

还有一个不太显眼但很实用的更新:Gemini 3.6 Flash的知识截止日期从2025年1月推进到了2026年3月。对于需要模型了解近期事件的应用场景来说,这一更新非常必要。

安全防护升级

安全方面,Google称3.6 Flash上线了升级版的Frontier Safety框架,重点强化了对CBRN(化学、生物、放射性、核)和网络攻击类滥用的防御,同时减少了对正常请求的误拒率。

配角也有亮点:Gemini 3.5 Flash-Lite

本次同步发布的3.5 Flash-Lite定位比3.6 Flash再低一档,专门针对高吞吐、低延迟的任务场景,例如批量文档处理和Agent搜索。

几个关键指标:

  • 速度:每秒约350个token,是3.5系列中最快的

  • 价格:每百万token输入0.3美元、输出2.5美元

  • 支持推理档位调节,低配任务用最低档追求速度,复杂子任务可以把思考深度往上调

Flash-Lite在部分Agent和代码任务上的表现令人意外。例如在SWE-Bench Pro上,Flash-Lite取得了54.2%的成绩,而老一代的Gemini 3 Flash只有49.6%。OSWorld-Verified也是如此,74.0%对65.1%。一个定位更低、价格更便宜的模型,在不少任务上反而超越了上一代的正式版,确实有些"以下犯上"的意味。

安全领域的新尝试:Gemini 3.5 Flash Cyber

第三个模型3.5 Flash Cyber风格有所不同,专门用于查找和修复代码中的安全漏洞。它基于3.5 Flash微调而来,配合Google自家的CodeMender工具使用。

不过,该模型目前仅面向可信合作伙伴进行限量内测,普通开发者暂时无法使用。Google给出的理由是漏洞检测能力本身具有两面性,需要先确保防守方有足够的时间来利用,再考虑更大范围的开放。

社区怎么看:争议不小

官方数据看起来不错,但社区的反馈却明显分化。

第三方测评的冷水

Artificial Analysis直接泼了一盆冷水:Gemini 3.6 Flash的智能指数(Intelligence Index)得分为50,与3.5 Flash完全相同。也就是说,尽管token效率提高了、成本降低了,但模型本身的推理和理解能力并没有实质性进步。

对比同期竞品,3.6 Flash的智能指数低于Meta Spark 1.1、GLM-5.2、Sonnet 5、Grok 4.5等多个模型。有用户在X(原Twitter)上直接评价:"分数一模一样,竞品一堆比它强,这升级升了个寂寞。"

性价比的质疑

另一个让开发者不满的地方是性价比。有用户指出,Gemini 3.6 Flash的使用成本比GPT-5.6 Sol Medium还高,但智能水平却更低。Flash系列一直以来的卖点就是性价比,结果在性价比这个核心指标上被竞品反超,处境确实有些尴尬。

作为参照,OpenAI的Codex在同一时间宣布周活跃用户已达1000万,并为付费用户发放了新一轮额度。两条消息放在一起看,对比感很强。

实测反馈的落差

也有开发者做了更细致的实际测试。例如,用Google自家的Antigravity来运行AI生成游戏任务,结果并不理想,纹理质量反而出现了退化。还有用户反映3.6 Flash在中文选词上经常出错、生成的图片和视频质量不稳定、多轮对话中偶尔会出现记忆混乱和工具调用错误等问题。

当然,也有正面的反馈。Hebbia、Harvey、Figma、JetBrains等企业客户肯定了3.6 Flash在文档解析、图表数据分析、报告生成等多模态知识工作中的表现。对于这类结构化任务,3.6 Flash的效率提升是实实在在的。

绕不开的问题:Gemini 3.5 Pro 去哪了?

发布了一堆Flash,社区更关心的问题其实是:旗舰级的Gemini 3.5 Pro到底什么时候出?

Google官方说法是"正在和合作伙伴测试,准备好就上线"。但据彭博社等多家媒体报道,3.5 Pro的代码生成能力一直未能达到内部预期,6月份专门更新了一版训练数据来补强代码短板,但效果依然不理想。有消息称Google甚至推翻了原有训练方案,从头重新训练。

与此同时,Google AI负责宣传的Logan Kilpatrick已经开始将公众注意力引导到Gemini 4上,声称Gemini 4的预训练已经启动,并且进展令人兴奋。在旗舰模型跳票的背景下,这番表态多少有些"先别急,大的要来了"的意味。

怎么理解这次发布:省成本的路走得通,但智能还欠着

综合来看,Gemini 3.6 Flash这次发布的逻辑比较清晰:Google在token效率和成本控制上确实做了有效的工作,17%的token节省和对应的降价,对于大规模部署AI Agent的企业用户来说具有实际价值。

但问题在于,效率的提升并没有伴随智能水平的提高。Artificial Analysis的智能指数原地不动就是最好的说明。在当前竞争激烈的模型市场里,Sonnet 5、GPT-5.6系列、Grok 4.5等竞品都在同步甚至更快地推进,单纯靠"更省"已经不足以构成竞争优势。

Flash-Lite倒是一个值得关注的产品。它在极低价格下展现出了不错的任务完成能力,对于需要大批量处理轻量级任务的场景,是一个实用的选择。

至于Gemini 3.5 Pro的缺席和Gemini 4的画饼,某种程度上反映了Google在前沿模型竞争中面临的压力。能不能在下一代产品上实现真正的突破,可能才是决定Gemini系列前途的关键。

模型多了,选择也多了

从这次发布也能看出一个趋势:市场上的模型越来越多,定位越来越细分。Google自己一口气就出了三个,加上OpenAI、Anthropic、Meta、DeepSeek等厂商的产品,开发者面对的选择已经非常繁杂。

不同的任务适合不同的模型,轻量级的用Flash-Lite,需要深度推理的用Pro或旗舰级别,代码任务和知识任务的最优选择也经常不同。实际开发中,频繁切换模型、管理不同厂商的API Key、处理不同的接口格式,确实是一件麻烦事。

写在最后

Gemini 3.6 Flash交出的这份答卷,优点和短板都很明确。省token、降成本、缩短Agent执行链路,这些改进对企业级批量部署有实在的好处。但智能指数原地踏步、性价比被竞品反超、旗舰Pro型号迟迟不到位,这些问题同样摆在台面上,回避不了。

对开发者来说,现阶段更务实的做法可能不是押注某一个模型,而是保持灵活。模型市场正处在快速洗牌期,今天的最优选择三个月后未必还是。与其纠结于某一家的产品路线,不如把精力放在架构层面,确保自己的应用能够低成本地适配不同模型。

Google把赌注押在了Gemini 4上。能不能翻盘,就看下一手牌了。

来源:https://juejin.cn/post/7665302519635083291
上一篇KoboldCPP安装配置全攻略及显卡驱动检查方法 下一篇Kimi K3最新版本修复Bug越修越多现象引发用户热议
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
TalkVisions实时视频翻译应用,消除语言障碍
AI教程 · 2026-07-25

TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions是一款实时视频翻译应用,能将视频中的口语实时转录为文本并翻译成用户所选语言,以字幕形式叠加在画面上,支持多语言、低延迟,还可保存录制视频,有效消除跨语言沟通障碍。

AI驱动的日历管理工具Ipso
AI教程 · 2026-07-25

AI驱动的日历管理工具Ipso

IpsoAI是一款专为专业人士及助手打造的AI日历管理工具,能够自动协调多方日程、智能草拟邮件,并通过快速安排会议、提供智能建议及自动化工作流程,显著减少琐碎操作,帮助用户高效管理时间、提升工作效率。

Spectate企业级专业高效监控与事故管理一体化平台
AI教程 · 2026-07-25

Spectate企业级专业高效监控与事故管理一体化平台

Spectate是一款高效监控和事故管理工具,能在30秒内检测故障并推送告警。它支持Slack、PagerDuty等主流集成,提供自定义状态页面和全球性能监控。系统自动更新状态并推送修复建议,帮助团队减少沟通成本,快速解决问题。

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4
AI教程 · 2026-07-25

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

通义千问2 5大模型发布,多项能力宣称赶超GPT-4,中文语境下文本理解、生成、知识问答等表现优异。相比2 1版本,理解提升9%、逻辑推理提升16%、指令遵循提升19%。开源1100亿参数模型超越Llama-3-70B,获评开源最强。已服务超9万家企业,与小米、微博等达成合作。

万知个人AI工作站:一站式智能阅读创作分享平台
AI教程 · 2026-07-25

万知个人AI工作站:一站式智能阅读创作分享平台

万知是集成多种AI能力的个人工作站,支持自然语言交互、文档快速阅读与摘要生成、PPT自动设计与优化,覆盖学术研究、商务报告、写作辅助及日常问答等场景,全方位提升工作效率。