游乐游手机版
首页/AI热点日报/热点详情

谷歌创始人最新访谈揭秘Gemini突然变强原因

类型:热点整理2026-07-22
谷歌创始人谢尔盖·布林表示,语言模型成为AI发展主要驱动力,思维模型具备可解释性。后训练占比增大,深度思考计划让模型可长时间推理。Gemini2 5Pro在多数排行榜居首,2 5Flash速度超快排名第二。

近日,谷歌创始人谢尔盖·布林接受了知名播客主理人洛根的访谈,围绕谷歌I/O大会的最新动态以及AI开发的整体现状,展开了一场深度对话。布林坦言,这次发布阵容相当精彩,甚至有些环节让他感到意外——比如谷歌搜索中突然上线的虚拟试穿功能,反响热烈。不过他也强调,从宣布到真正落地,还有大量工作要做,团队目前正全力以赴确保所有新功能顺利交付。

回顾人工智能发展的更广阔轨迹,布林指出,当前进展与几年前人们对“奇点”的理性推理截然不同,AI的发展方式令人惊讶。具体来说,有两个关键观察:第一,语言模型已成为AI发展的主要驱动力,这在15年前并不明显,尤其是考虑到DeepMind过去一直专注于物理基础;第二,思维模型展现出了惊人的可解释性——你可以洞察其推理过程,从安全角度看,这无疑是一个显著的积极信号。

从架构层面看,布林发现不同模型之间的相似度远超想象。即便是看似截然不同的视频传播模型,其训练过程也在不断趋同。后训练阶段(微调、强化学习等)在整体工作中所占的比例越来越大,工具使用等功能的加入,让模型变得更加强大。

谈到推理扩展,尤其是“深度思考”计划,布林透露了谷歌的愿景:让模型能够思考更长时间——数小时、数天甚至数月——从而对复杂问题给出更好的答案。这与克服长上下文输入的挑战不同,谷歌一直在努力实现这一点。从短期任务的训练模型,到期望它们能在几天内开发出新的东西,这是一个正在克服的重大差距。布林还提到,AI的发展时刻凸显了评估问题的普遍难度——无论对于人类还是AI而言,这都是一个难题。

最后,布林反思了谷歌的地位和创新步伐。他认为,企业必须定期进行自我改造,虽然充满挑战,但谷歌凭借在大规模数据、谷歌大脑和Transformer方面的深厚积累,已经为AI转型做好了充分准备。他对目前看到的加速发展感到乐观,并解释了谷歌大模型从跟随到领跑的原因。他特别提到,与2024年的赶超相比,2025年已经取得了显著进展——Gemini 2.5 Pro是一次明显的飞跃,至今在大多数排行榜上仍位居第一;而最近推出的Gemini 2.5 Flash,也被认为是一款速度超快、性能强大的模型,在许多排行榜上排名第二。

以下为访谈核心内容的重述——

主持人开场后,布林立刻回应了对I/O大会的总体感受:“这绝对是一系列非凡的发布。说实话,我可能连其中30%的内容都不完全了解——时间有限,我对Gemini了解很深,但甚至不知道虚拟试穿功能会上线。很多事让我感到惊讶。”他认为反响非常好,但人们需要花时间探索和理解,而团队正忙着交付所有发布的内容,这需要巨大的精力。“对许多团队来说,I/O是大量工作的开始,而不是终点线。”

Gemini的核心文本模型

当被问及关注重点时,布林表示自己主要聚焦于Gemini的核心文本模型,因为这将帮助谷歌更好地编码和开发AI背后的科学。同时,他也承认生成媒体领域令人惊叹,感觉像是超人。“使用文本模型,有些数学问题我可能能解决,但也会出错,或偶然发现代码——虽然这种情况越来越少。我现在经常依靠Gemini来做编码和数学。但无论如何,它还在人类范围内。而我的艺术天赋有限,根本不可能创作出图像或视频。如果我是一名摄像师或3D渲染师,可能需要一个月艰苦工作才能得到我在几分钟内就能生成的东西。生成媒体在视觉上非常引人注目,你无法逃脱。”

Gemini和Veo 3中的原生音频

主持人提到,Veo 3中的音频让他感到震撼——以往生成视频后还需要单独处理音频,现在模型能同步生乘人类对话,且效果出色。布林对此深表赞同:“我一直是音频的忠实粉丝。我个人很注重视觉,但多年来,特别是谷歌眼镜这类产品,让我意识到添加音频比添加3D效果更能丰富感知。当你真正让音频工作时,那是一种令人难以置信的感知变化。我最近看到了模型训练在过去一两个月内的进步,从最初到现在的变化感觉完全不同。”

关于原生音频在Gemini中的实现,布林解释:“我们花了很长时间才在Gemini中发布原生音频。底层模型已经具备能力至少一年,但要让原生音频输入、输出真正运行良好,需要大量时间。现在它终于出来了。Veo的做法类似,我相信音频也是通过Diffusion实现的,就像视频一样。在训练过程中,你可以看到生成的视频从最初形状不准确、文字模糊,逐渐成形,最终变成今天我们看到的样子。我很庆幸我们拥有一批机器学习研究人员,能同时在不同模式下探索不同的基础技术。”

模型训练运行的见解

主持人好奇“观看训练运行”究竟意味着什么。布林解释:“我们可以在训练过程中测试中间检查点——比如10%、20%的训练进度。模型在那些时间点上很弱,但你可以通过它们了解轨迹。尤其是大型训练运行,你会投入大量计算,也会在整个过程中多次测试,从而对最终趋势有相当好的把握。这对文本模型、视频模型(如Veo)都适用。所有模型都有这些中间结果,如果你真的深入其中,肯定会去检查,因为你对它最终会产生什么既紧张又兴奋。”

当前AI发展与过去预期的对比

主持人提到,谷歌CEO Sundar在15年前就和布林、拉里·佩奇讨论过AI的未来,而如今的发展与当年的想象惊人地相似。布林回应:“你可以通过奇点来理性推理,比如雷·库兹韦尔几十年前推断的2037年——现在看来可能有点保守。但真正看到它发生,感觉完全不同。15年前谈论AI,更像是在想象科幻未来,像玩游戏一样。而现在,它真的发生了,而且发展方式相当令人惊讶。”

他举例说明:“语言模型已经成为AI发展的主要驱动力,这在15年前并不明显。事实上,DeepMind过去一直专注于物理基础,认为拥有一个物理世界作为基础很重要。但语言模型能发展到这个程度,并不显而易见。而且有一个有趣的副作用:思维模型具有令人惊讶的可解释性。你可以看到模型是如何推理、如何得出结论的。如果没有大量工具,你很难检查模型权重并从中推断,但它的推理很多都用非常易懂的语言表达出来了。我认为这是15年前你没想到的,也是一个令人欣慰的意外。从安全角度看,这些东西在某种程度上确实‘表达了它们的想法’,这是一个很大的优点。虽然有些论文讨论它们会撒谎,但影响相对较小。”

模型训练的演变

当被问及模型训练过程如何从文本输入输出演变为完整系统时,布林指出:“所有不同模型在架构上高度相似——比如视频传播模型与文本语言模型,看似不同,但架构上有很多共同点,核心都是Transformer,这要感谢Noam和团队近十年的贡献。现在,我们正在添加工具使用等功能,这些大多发生在后训练阶段。后训练在整体训练中的占比越来越大,从以前的99%预训练,到现在可能90%或80%。后训练包括微调和RL类型的工作,过去只是最后一点塑造,现在材料越来越多,工具使用也在更大阶段出现,这让模型变得更加强大。”

推理和深度思考的未来

关于推理扩展和深度思考,布林说:“有趣的是,我们有大约五种不同的方法,都集中在‘深度思考’上。很高兴看到众多团队聚集在一起,有时我们会分散,需要很长时间,但这次我们采纳了所有人的最佳想法,将它们结合,确实产生了更强的结果。我认为这持续发生,就会成为一种超能力。如果模型不是只花一分钟思考,而是能运行一小时、一天甚至一个月,它们就能对重要问题给出更好的答案,这非常有价值。”

他进一步解释:“这有点新,而且不简单。我们破解了长上下文输入——已经有一年半左右掌握了一百万条信息。现在需要无限背景,但概括并不简单。对模型来说,就像经历‘土拨鼠日’,一遍又一遍重复。你以个人身份体验一天,尝试这个、尝试那个,然后生活就开始了,日复一日、月复一月。这是一种非平凡的概括。但我们已经知道怎么做。在输出方面,如果只是短小的数学问题,也不简单。这就好比面试时我们问10个问题,然后期望他们在几个月内建立大型系统——但用这种短问题测试一个人,真的合理吗?对AI模型,我们做了无数次类似的事情:只训练它们解决简单的数学和编码问题,然后期望它们能花长时间开发新东西。这是一个正在克服的差距,也是巨大的飞跃。”

谷歌的创业文化与加速AI创新

主持人感叹,从I/O展示的内容看,2025年的发布阵容明显比2024年大,创新明显加速,而且加入谷歌的感觉就像一次创业经历。布林回应:“公司需要定期自我重塑。我们最初是一家网络公司,后来必须让移动端工作,社交方面我们从来都不擅长。现在进入AI领域,令人兴奋的是,谷歌一直是一家AI公司——我们致力于大规模数据和分析,也是许多现代机器学习的诞生地,从谷歌大脑到Transformer。这是公司的DNA,所以我们应该做好充分准备去实现这个转变。”

“任何转变对公司来说可能都困难,但我感觉非常好。从2024年到2025年,我们在很多层面上都赶上了,特别是Gemini 2.5 Pro的推出,那是一个明显的飞跃。在2.5 Pro之前,我们可能已经是第一名,但这次进步很大,全面领先,至今在大多数排行榜上仍排名第一。这背后是科学引擎的因果——过去一年来的科学研究,让我们最终能够生产出这个模型。此后又发生了很多事,我们经历了2.5 Pro的几次迭代。你可能没注意到,昨天我们推出了新的2.5 Flash,在很多测量中它排在2.5 Pro之后,排名第二。凭借这个模型,我们在许多排行榜上名列前茅。很多人可能忽略了它,但它是超级快速的模型,会对很多用例有吸引力。有了今年2.5 Pro的基石,我们能够在此基础上继续发展并保持势头,这将是非常棒的一年。”

访谈尾声,主持人感谢布林对团队的推动,并送上一份特别的礼物——一块TPU V4(内部代号Pufferfish)。布林笑着拆箱,表示虽然这些芯片已经成为上一代产品,但团队仍在大量使用它们,而正是这些硬件让一切成为可能。他再次感谢了团队和所有客户的努力。

来源:https://k.sina.com.cn/article_7857201856_1d45362c001908cjhw.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。