游乐游手机版
首页/AI热点日报/热点详情

刚刚,Gemini 3.6 Flash正式发布,但广大网友又笑得更大声了

类型:热点整理2026-07-22
Google发布三款新模型:3 6Flash省token但智能无提升;3 5Flash-Lite更快更便宜,性能反超旧版;3 5FlashCyber专注安全修复,仅限内测。旗舰3 5Pro跳票,被吐槽又贵又笨,整体评价不佳。

如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。

这是近期网友对 Gemini 的一句戏谑式吐槽。

按理说,一家公司发布新模型,本该是来“打脸”这类调侃的。可就在刚刚,Google 一口气推出三款新模型后,网友非但没收回这句话,反而笑得更响亮了。多少透着一股“所有人都不指望你,结果你还真最不争气”的荒诞感。

这三款模型分别是:3.6 Flash、3.5 Flash-Lite,以及专注网络安全领域的 3.5 Flash Cyber。官方博客措辞依旧熟悉得令人恍惚——「更高效」「更聪明」「专为大规模 AI agent 打造」,一字未落,句句到位。

然而实际体验却呈现出冰火两重天的割裂感。

主角登场:3.6 Flash 到底强在哪儿?

先看头号主力——3.6 Flash。官方定位极简:「干活型模型」(workhorse)。

它基于今年 5 月 I/O 大会发布的 3.5 Flash 进行小幅迭代,核心卖点只有一个:省 token。

据 Artificial Analysis Index 数据,3.6 Flash 相比 3.5 Flash 输出 token 减少 17%,在 DeepSWE(Datacurve 推出的基准)等任务中甚至能节省高达 65%。官方还强调其在多步推理任务中,所需推理步数与工具调用次数均显著降低——意味着干同样活,废话更少、绕路更短、账单更薄。

价格也确实下调了:输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——而上一代 3.5 Flash 的输出定价为 9 美元,这次直接砍至 7.5。快且省,单个 agent 任务成本自然压得更低。

基准测试方面,官方晒出一整页数据。

代码能力是重中之重。DeepSWE 分数从 37% 提升至 49%,官方解释称:冗余代码修改减少、循环执行更精简,生成结果更贴近真实生产环境需求。机器学习方向的 MLE Bench 更是跃升明显,由 49.7% 拉至 63.9%。

计算机操作(computer use)能力亦有进步,OSWorld-Verified 从 78.4% 升至 83%。同时,“计算机操作”功能已正式成为 Gemini API 及企业版内置工具,真正做到开箱即用。

知识工作层面,GDPval-AA v2 从 1349 提升到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告撰写等多模态任务中表现尤为亮眼。Figma、JetBrains 也纷纷站台背书。

顺带一提,还有个低调却实在的更新:知识截止日期终于从 2025 年 1 月推进至 2026 年 3 月——老黄历,总算翻篇了。

安全方面,3.6 Flash 部署了升级版 Frontier Safety 防护机制,重点盯防 CBRN(化学、生物、放射性、核)及网络攻击类滥用行为,抗越狱能力增强,同时尽量避免误拒正常请求。

·以小博大:便宜又灵活的 3.5 Flash-Lite,还能动态切换推理档位

第二款是 3.5 Flash-Lite,定位比 3.6 Flash 更轻量,主打「快」与「便宜」,专攻高吞吐、低延迟场景,例如 agent 搜索、批量文档处理。

它是当前 3.5 系列中最快的模型,Artificial Analysis 测得其输出速度达每秒 350 token。价格更是亲民——输入仅 0.3 美元、输出 2.5 美元/百万 token。官方称其质量相较今年 3 月发布的 3.1 Flash-Lite 有大幅跃升。

一个值得注意的设计是:支持调节「推理档位」。简单任务启用最低档,追求极致速度与成本;复杂子任务则可提升思考档位。此外,计算机操作功能同样被集成进该模型。

相比前代,提升显著:Terminal-Bench 2.1(代码与 agent 任务)从 31% 跃至 54%;长上下文理解 GDM-MRCR v2 由 60.1% 升至 72.2%;真实任务执行 GDPval-AA v2 更是从 642 飙升至 1140。

有趣的是,这款“小弟”在多项 agent 与代码任务中,竟反超了资历更深的 3 Flash:

比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。这意味着——原本需靠 3 Flash 完成的任务,如今有了更快更强的平替方案。

官方列举了几种典型用法:从海量电商数据中提取产品特征、辅助 3.6 Flash 同时生成 25 个网页设计方案、批量翻译并总结收据、边玩边迭代开发小游戏。Ashler、Palo Alto Networks、Ramp 等客户也盛赞其“速度、智能、成本三位一体”。

第三款 3.5 Flash Cyber 风格突变,专用于识别和修复代码中的安全漏洞。

Google 的逻辑颇为务实:当前 AI 发现漏洞的速度,已远超人类修复节奏。既然漏洞越积越多,不如用轻量高效的 Flash 模型批量“补锅”。

该模型基于 3.5 Flash 微调而来,需搭配自研工具 CodeMender 使用。后者内部运行多个 Flash Cyber agent,协同分析、最终整合生成统一报告。

在业内权威基准 CyberGym 上,官方宣称其已达第一梯队水准,且比更大参数模型更省 token。

不过,这个模型目前我们普通用户暂时无缘使用。

考虑到“找漏洞”能力天然具备双刃属性,一向保守的 Google 也学 Anthropic 开始讲安全叙事——将模型严格限制为「可信合作伙伴」专属,仅限内测。目的很明确:帮一线防御方抢在漏洞被利用前完成修补,同时严防恶意用途。

说好的 3.5 Pro 呢?如来佛祖也没辙

看到这儿你或许会问:发了一堆 Flash,那真正扛旗的旗舰 3.5 Pro 去哪了?

官方口径仍是:“正与合作伙伴联合测试,准备就绪即上线。”但这句话背后的故事,恐怕并不体面。

据彭博社等媒体报道,3.5 Pro 在代码生成能力上始终未能达到 Google 内部预期。该公司甚至在 6 月下旬专门更新训练数据以强化该短板,结果仍无明显起色。更有传言称,Google 已彻底放弃原有训练路径,决定从零重启训练。

而 Google AI 宣传负责人 Logan Kilpatrick 更是在舆论场干脆跳过 3.5 Pro,将焦点全押在 Gemini 4 上,直言团队已启动“史上最雄心勃勃”的 Gemini 4 预训练,并称进展令人振奋。

听上去鼓舞人心,但放在“旗舰跳票”的语境下审视,难免让人怀疑这是转移视线、画饼续命的惯用手法。

除了这些幕后消息,单看今日发布的 Flash 系列本身,外界评价也并非一边倒叫好。

第三方评测机构 Artificial Analysis 指出:两款新模型确实在单任务耗时与 token 效率上取得进步,Flash-Lite 的智能指数上涨 11 分——但 3.6 Flash 的综合智能水平,相较于 3.5 Flash 几乎毫无提升。

价格降幅不足以掩盖能力停滞,而能力又无法支撑其现有定价。

X 平台网友犀利吐槽:3.6 Flash 在 Artificial Analysis 评测中与 3.5 Flash 打出完全相同的分数,甚至不及 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 等竞品,直呼“烂得离谱”(阴阳怪气 doge)。

质疑声不止一处。

网友 Angel 从性价比切入:Gemini 3.6 Flash 的单位成本高于 GPT-5.6 Sol medium,可智能表现反而更低。“又贵又笨”,这对主打性价比的 Flash 系列而言,无疑是致命打击——毕竟它的立身之本,正是“够用、便宜、稳定”。

作为对照,OpenAI 的 Tibo 也同步发声:因周活跃用户突破 1000 万,全新一天开启,Codex 与 ChatGPT Work 的付费用户额度已重置,欢迎畅用。

这一对比,这份落差,还有人记得那个曾被寄予厚望的 Google Gemini 3 吗?

实测派也迅速补刀。网友 Balder 更是直接开团:

这三款模型性能全面落后于旧版 3.5 Flash。他晒出个人测试结果,问题包括但不限于——基础解码异常、中文选词频繁失准;生成图像与视频质量极差、严重偏离指令且配额限制苛刻;记忆混乱频发、工具调用错误率居高不下。

他还抛出一个阴谋论:Google 如此操作,或意在腾出算力资源转售给 Anthropic,并调侃道:“这就是皮查伊梦寐以求的‘Cloud First’。”

此外,X 用户 Conor Dart 使用 Google 自家 Antigra vity 工具测试 AI 游戏生成效果,结果不出所料:木纹质感进一步退化,大理石纹理虽接近但依然不可用。他直言这又是一次翻车,并表示“继续等 Gemini 3.5/3.6 Pro 吧”。

一言以蔽之?别问新模型强不强,先问它闪不闪(Flash)就完事了。一边是官方吹得天花乱坠的“更高效、更省钱、更省 token”,另一边是多数用户的当场差评,以及模型背后隐藏的旗舰跳票、核心人才流失、市值缩水等一系列连锁危机。

这很难不让人生疑:Google 是否真在这轮技术演进中点歪了科技树?只顾压缩成本,却忘了提升智商,只能靠几个 Flash 模型勉强稳住阵脚?

反正 Gemini 4 的预训练已经启动。倘若这一把再翻车,那句关于阿尔茨海默症的玩笑,恐怕就要应验成真了。

来源:https://www.php.cn/faq/2863355.html?uid=1246273

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。