谷歌 DeepMind 于7月21日发布了一组新模型——Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber,这些模型明显瞄准中轻量级模型的落地效率。三款模型各有侧重,但核心思路十分清晰:在保障性能的前提下降低使用成本,让企业客户能够放心地大规模部署 AI Agent。
作为本次更新的主角,Gemini 3.6 Flash 在代码生成、知识理解以及多模态处理能力上均实现了实质性提升。更关键的是,其 Token 消耗量直接减少了 17%——这意味着调用成本随之显著下降,对高频调用场景而言,节省的开支相当可观。而 Gemini 3.5 Flash-Lite 则主打“极致性价比”,轻量化设计使其更适合资源敏感型应用。至于 3.5 Flash Cyber,则是一款专为网络安全场景定制的模型,目前以有限访问试点形式向政府机构和可信合作伙伴开放,主要用于漏洞识别与修复。

谷歌方面也强调,此次发布的核心目标是为大规模构建 AI Agent 的企业客户提供高可靠、低延迟的基础设施支持。换言之,模型能力固然重要,但能否稳定运行、延迟是否足够低,才是决定能否实际落地的关键。
不过,细心的观察者可能已经注意到:市场期待已久的旗舰模型 Gemini 3.5 Pro 并未出现在本次更新名单中。该模型自2月更新后便再无动静,原因是内部性能达标挑战出现延迟,目前仍在合作伙伴阶段测试中。官方表示将争取尽快上线,但尚未公布具体时间表。
放眼整个行业,竞争压力不容小觑。OpenAI 已发布了 GPT-5.5/5.6,Anthropic 则推出了 Claude Opus 4.8 和 Sonnet 5,各家都在比拼算力与效率。谷歌显然也在加强硬件与软件的协同——不仅被曝出内部研发代号为“Frozen v2”的高效服务器芯片,更已启动了迄今为止规模最大的 Gemini 4 前沿预训练。这一系列举措表明,谷歌在 AI 基础设施和下一代大模型上的投入决心丝毫没有动摇。
