游乐游手机版
首页/AI热点日报/热点详情

谷歌Gemini 4即将发布,启动史上最大模型训练

类型:热点整理2026-07-22
智东西7月22日消息,今日凌晨,谷歌发布了三款全新模型:Gemini 3 6 Flash、Gemini 3 5 Flash-Lite以及Gemini 3 5 Flash Cyber。此次发布的核心目标,是重点提升Agent工作流所需的Token效率、响应速度和运行可靠性,为开发者提供更高效、更低成本

智东西7月22日消息,今日凌晨,谷歌发布了三款全新模型:Gemini 3.6 FlashGemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。此次发布的核心目标,是重点提升Agent工作流所需的Token效率、响应速度和运行可靠性,为开发者提供更高效、更低成本的AI解决方案。

▲谷歌发布Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber(图源:X)

三款模型核心亮点一览

这三款模型各有侧重,旨在满足不同场景下的开发需求:

  • Gemini 3.6 Flash:面向编程、知识工作和多模态任务,主打Token效率提升。在第三方评测机构Artificial Analysis的Intelligence Index(智力指数)中,其任务Token消耗量比3.5 Flash少17%,在DeepSWE测试中的输出Token消耗最多减少约65%
  • Gemini 3.5 Flash-Lite:主打低延迟和高吞吐量,生成速度达到每秒350个输出Token,在Agent工作流中较前代的Flash-Lite模型有显著提升。
  • Gemini 3.5 Flash Cyber:专门用于发现和修复网络安全漏洞,与CodeMender代码安全Agent配合使用,性能已达到前沿模型的竞争水平,与Mythos 5和GPT-5.6 Sol能力相当。不过,该模型暂不面向普通开发者开放。

值得注意的是,在Artificial Analysis的榜单上,Gemini 3.6 Flash的速度成绩优秀,但智力和成本的优势相对不明显。该模型的Intelligence得分只有50,落后于Claude Fable 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM-5.2等模型,甚至连Meta的Muse Spark 1.1也排在它前面。同时,其单任务成本达到0.50美元(约合软妹币3.39元),较DeepSeek、MiniMax、GLM、Muse Spark、Grok等模型更贵。

▲Gemini 3.6 Flash在能力、速度和成本上与其他模型对比(图源:Artificial Analysis)

作为昔日大模型“御三家”之一,谷歌此次最突出的优势仍然是速度。目前,Gemini 3.5 Flash-Lite和Gemini 3.6 Flash在输出速度上,位列榜单前两位

▲Gemini 3.5 Flash-Lite和Gemini 3.6 Flash位列模型输出速度榜前两位(图源:Artificial Analysis)

对于等待了两个月的新模型用户,这次发布可能有些“不尽人意”。今年5月,谷歌CEO桑达尔·皮查伊(Sundar Pichai)在I/O大会上预告,Gemini 3.5 Pro将在6月推出;如今7月已经过半,用户仍未见其踪影。对于这款迟到的Gemini 3.5 Pro,谷歌称该模型正在与合作伙伴测试,将在准备就绪后尽快发布。与此同时,谷歌还提前预告了Gemini 4,称已启动公司迄今规模最大的预训练任务。

01. Gemini 3.6 Flash:效率提升,成本降低

Gemini 3.6 Flash基于开发者和企业客户对3.5 Flash的反馈进行了改进。在处理多步骤工作流时,新模型需要的推理步骤和工具调用次数更少,同时减少了输出冗余,有效降低了任务成本。

价格与成本

  • 输入价格:每100万个Token 1.5美元(约合软妹币10.2元),与3.5 Flash持平。
  • 输出价格:每100万个Token 7.5美元(约合软妹币51元),低于3.5 Flash。

3.6 Flash大幅降低了每项Agent任务的运行成本:

  • 在DeepSWE v1.1测试中,3.5 Flash平均每项任务消耗约27.6万个输出Token,而3.6 Flash降至约9.7万个,降幅接近65%
  • 在Artificial Analysis Intelligence Index中,两款模型的平均输出Token消耗分别约为2.8万个和2.3万个,Gemini 3.6 Flash的Token消耗量降低约17%

▲Gemini 3.6 Flash和Gemini 3.5 Flash任务输出Token对比(图源:谷歌)

性能测试表现

  • 软件工程Agent评测(DeepSWE v1.1):3.6 Flash得分为49%,高于3.5 Flash的37%和3.1 Pro的12%。
  • 机器学习工程测试(MLE-Bench):3.6 Flash得分为63.9%,领先3.5 Flash的49.7%和3.1 Pro的42.6%。
  • 知识工作测试(GDPval-AA v2):3.6 Flash、3.5 Flash和3.1 Pro的得分分别为1421、1349和965。
  • 计算机操作能力测试(OSWorld-Verified):三者得分分别为83.0%、78.4%和76.2%。Computer Use现已成为Gemini API和Gemini Enterprise中的内置客户端工具。

▲3.1 Pro、3.5 Flash和3.6 Flash其他能力对比(图源:谷歌)

应用案例与客户反馈

谷歌还展示了Gemini 3.6 Flash的应用案例,包括更高效地分析金融数据和电话会议记录、通过多Agent协作执行代码迁移、为3D工作流开发照片纹理提取工具,以及结合tldraw离线编辑器创建交互式主题设计工具。

在代码迁移任务的对比测试中,Gemini 3.6 Flash的规划耗时为20秒,低于3.5 Flash的24秒;执行迁移的时间则由2分08秒缩短至1分20秒,整体耗时减少约34%。根据案例展示,3.6 Flash生成了更详细、结构更清晰的代码审计与验证文档,覆盖数据模型、API接口、业务逻辑、UI组件等多项针对性验证任务。

▲Gemini 3.5 Flash和Gemini 3.6 Flash在代码迁移任务中耗时对比(图源:谷歌)

多家早期客户也给出了积极反馈:

  • 设计软件公司Figma认为,3.6 Flash在质量、速度和成本之间取得了较好平衡,可以加快原型探索和迭代。
  • 法律AI公司Harvey称,该模型在文档起草和审查任务中平均快12%
  • 开发工具公司JetBrains称,其低推理等级下的编程性能较上一代Flash提高了10%至20%

安全防护

安全方面,3.6 Flash加强了针对化学、生物、放射性与核风险以及网络攻击滥用的前沿安全防护。谷歌称,这些措施提高了模型抵抗越狱攻击的能力,同时尽量减少对正常用途的错误拒绝。

02. Gemini 3.5 Flash-Lite:速度最快,价格最低

Gemini 3.5 Flash-Lite是Gemini 3.5系列中速度最快、价格最低的模型,主要面向Agent搜索、文档处理等强调低延迟和高吞吐量的任务。

根据Artificial Analysis的数据,该模型每秒可以生成350个输出Token。其输入和输出价格分别为每100万个Token 0.3美元(约合软妹币2元)和2.5美元(约合软妹币17元)。

开发者可以根据工作负载调整模型的思考等级:在大规模、低成本任务中选择minimal或low等级,在需要处理多步骤子Agent任务时启用更高等级。3.5 Flash-Lite同样内置了Computer Use工具。

性能提升

与3.1 Flash-Lite相比,3.5 Flash-Lite在多个测试中取得了显著提升:

  • Agent终端编程测试(Terminal-Bench 2.1):得分从31%升至54%
  • 长上下文测试(GDM-MRCR v2):得分从60.1%升至72.2%
  • 知识工作测试(GDPval-AA v2):得分从642升至1140

▲Gemini 3.1 Flash-Lite与Gemini 3.5 Flash-Lite对比情况(图源:谷歌)

3.5 Flash-Lite在部分测试中还超过了定位更高的3 Flash:

  • SWE-Bench Pro:Gemini 3.5 Flash-Lite和Gemini 3 Flash两款模型得分分别为54.2%和49.6%。
  • OSWorld-Verified:两者得分分别为74.0%和65.1%。

▲Gemini 3 Flash和Gemini 3.5 Flash-Lite对比情况(图源:谷歌)

美国金融科技公司Ramp认为,Gemini 3.5 Flash-Lite在票据提取任务中较好地平衡了准确率、延迟和成本。

▲美国金融公司Ramp对Gemini 3.5 Flash-Lite的评价(图源:谷歌)

03. Gemini 3.5 Flash Cyber:网络安全专用,暂不面向开发者

第三款模型Gemini 3.5 Flash Cyber基于3.5 Flash微调,专门用于发现、验证和修复网络安全漏洞。相比体量更大的模型,其Token价格更低,适合规模化检查代码安全问题。

该模型将与谷歌代码安全Agent CodeMender配合使用。CodeMender会同时运行多个3.5 Flash Cyber Agent,最后将不同Agent的分析结果合并成一份报告。

在CyberGym测试中,CodeMender最多调用5次模型时,3.5 Flash Cyber得分为83.2%。该模型在测试中的表现接近OpenAI和Anthropic的前沿模型:

  • Anthropic Agent内的Mythos Preview得分为83.1%
  • OpenAI Agent内的GPT-5.6 Sol得分为83.6%
  • Anthropic Agent内的Mythos 5得分为83.8%
  • OpenAI Agent内的GPT-5.5-Cyber得分为85.6%

▲Gemini 3.5 Flash Cyber在CyberGym测试中的表现(图源:谷歌)

考虑到漏洞发现和修复技术具有明显的双重用途,谷歌暂不向普通开发者开放3.5 Flash Cyber。该模型近期将通过CodeMender启动小范围试点,仅供政府机构和可信合作伙伴使用。

04. 上线与开放情况

目前,Gemini 3.6 Flash和3.5 Flash-Lite已经通过Google AI Studio、Android Studio及Gemini API向开发者开放。其中,3.6 Flash还进入了Google Antigra vity。

企业客户可以通过Gemini Enterprise Agent Platform使用这两款模型,3.6 Flash同时接入了Gemini Enterprise应用。普通用户可以在Gemini应用中使用两款模型,3.5 Flash-Lite还将逐步接入谷歌搜索。

Gemini 3.5 Pro目前仍处于合作伙伴测试阶段,谷歌计划在准备完成后扩大开放范围。

05. 常见问题(FAQ)

问:Gemini 3.6 Flash相比3.5 Flash,最大的改进是什么?

答:最大的改进在于Token效率。在DeepSWE测试中,其输出Token消耗最多减少约65%,在Intelligence Index中减少约17%。这意味着它能以更少的Token完成任务,从而降低运行成本并提升响应速度。

问:Gemini 3.5 Flash-Lite适合什么场景?

答:它非常适合对低延迟和高吞吐量有要求的任务,例如Agent搜索、文档处理、票据提取等。其生成速度达到每秒350个输出Token,成本也极具竞争力。

问:Gemini 3.5 Flash Cyber为什么不对普通开发者开放?

答:因为该模型专门用于发现和修复网络安全漏洞,这类技术具有明显的双重用途,可能被恶意利用。因此,谷歌仅向政府机构和可信合作伙伴开放,以降低安全风险。

问:Gemini 3.5 Pro什么时候发布?

答:谷歌表示Gemini 3.5 Pro目前仍在与合作伙伴测试中,将在准备就绪后尽快发布。具体时间尚未公布。

06. 结语:从追求单次性能,转向降低Agent总成本

谷歌此次更新Flash系列,重点转向降低Agent的实际运行成本。Gemini 3.6 Flash显著减少了完成任务所需的输出Token、推理步骤和工具调用次数,Gemini 3.5 Flash-Lite则进一步提升了生成速度。对于需要大规模部署Agent的企业和开发者来说,更低的成本和更快的响应速度仍具有实际吸引力。

不过,从Artificial Analysis等第三方榜单来看,Gemini的Flash系列模型能力目前难以保持领先。上周,月之暗面发布Kimi K3,其Intelligence得分仅落后于Claude Fable 5和GPT-5.6 Sol,在前端编程测试中甚至排到了榜首。国产模型已经从跟随者变成全球前沿模型竞争中的重要力量,谷歌面对的对手也远不止OpenAI和Anthropic。至于谷歌能否重回昔日“御三家”的牌桌,恐怕还要看已经延期的Gemini 3.5 Pro,以及刚刚开始预训练的Gemini 4。

来源:谷歌、X、Artificial Analysis

来源:https://36kr.com/p/3906321496872065

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。