在AI大模型领域,谷歌这次的动作颇为引人注目。就在GPT-5即将亮相的关键时刻,他们直接推出了Gemini 2.5 Deep Think。这个版本可不简单,其前身曾在2025年国际数学奥林匹克竞赛中斩获过“金牌水平”的佳绩。
不过需要说明的是,当前上线的版本与那个夺金版本并非同一款。新版本进行了迭代优化,虽然解决那些烧脑的数学问题仍需花费数小时,但在日常使用中却变得更快、更顺手。内部评估显示,它在IMO基准测试中依然能达到铜牌水平。因此,结论很明确:新版本在性能上有所调整,但换来了更快的响应速度和更强的日常实用性。目前,该版本面向Google AI Ultra订阅者开放,而那个更强大的金牌版本,则仅对部分数学家和学者开放。
Gemini 2.5 Deep Think可以被视为2.5系列中的增强推理模型。它采用了并行思维与强化学习技术,能够同时测试多种假设。支持的输入形式也十分全面,文本、图像、音频、视频皆可处理,上下文窗口高达100万tokens,输出更是能扩展到19.2万tokens。
它究竟是如何思考的?
这种思路与人类面对复杂问题时的做法非常相似——我们不会只盯着一个方向,而是会多角度探索,反复权衡,最终完善答案。Deep Think通过并行思维技术,极大地拓展了模型思考能力的边界。它可以同时生成并审视多种思路,甚至随着时间的推移,修正或融合不同的想法,最终选出最优答案。
延长推理时间,或者说“思考时间”,为Gemini提供了更多空间去探索不同假设,从而为那些复杂问题找到创造性的解决方案。谷歌还为此开发了一套全新的强化学习技术,专门用于鼓励模型充分利用这些扩展后的推理路径。这使得Deep Think在时间积累中,逐渐成为一个更出色、更直观的问题解决者。
哪些场景能发挥最大价值?
Deep Think最适合需要创造力、战略规划以及逐步改进的问题。
举个例子,迭代开发与设计任务。如果让你为一座超现实宝塔编写复杂的HTML动画,用速度较快的2.5 Flash,你会得到一份快速但简洁的结果;换成标准的2.5 Pro,响应会更详细、更复杂。但一旦启用Deep Think,它就会运用多线程并行思维,反复推演各种可能性,最终生成的输出在精细度和复杂度上都会提升一个档次。
在科学与数学发现领域,Deep Think的表现同样值得期待。因为它能够推理高度复杂的问题,可以成为研究人员得力的工具。无论是构建并探索数学猜想,还是梳理复杂的科学文献,它都有望加速发现进程。
还有算法开发与编程。在处理那些需要问题建模、在复杂度和时效性之间权衡的高难度编程问题时,Deep Think的优势尤为突出。
基准测试的结果也很有说服力。在不使用外部工具的情况下,Gemini 2.5 Deep Think在衡量编程竞赛表现的LiveCodeBench V6,以及涵盖科学与数学的权威基准Humanity’s Last Exam上,都达到了顶尖水准,甚至超越了OpenAI的o3和xAI的Grok 4。
实际效果究竟如何?
很多人用一个经典例子来测试:“生成一只骑自行车的鹈鹕的SVG”。下面是Gemini 2.5 Deep Think的生成效果:

作为对比,之前有人用同样的测试去挑战OpenAI即将发布的GPT-5,效果是这样的:

从结果来看,Gemini 2.5 Deep Think在这个例子中似乎更胜一筹。谷歌选择在OpenAI正式发布GPT-5之前上线自家最强的推理模型,用意非常明确——就是要主动出击,在关键的AI赛道上抢占有利位置。
