一夜之间,大语言模型的竞争门槛又被推向了新高度。
Gemini Ultra发布仅仅数日,谷歌便再次推出Gemini 1.5版本。这一连串动作表明,谷歌铁了心要与OpenAI、微软正面交锋,研发节奏全面提速。
谷歌DeepMind首席科学家Jeff Dean与CEO Demis Hassabis亲自宣布了这款最新一代多模态大模型——Gemini 1.5系列。其中最受瞩目的当属Gemini 1.5 Pro,它不仅是谷歌迄今最强的MoE(混合专家)模型,更支持高达10,000K token的超长上下文窗口。
百万级token的上下文窗口意味着什么?意味着你可以直接与数十万字的超长文档进行对话,能够在几十万行代码的庞大代码库中定位Bug,甚至可以将一整部电影丢进去,让模型分析情节。谷歌还同步发布了一份长达58页的技术报告,详细阐述了背后的技术细节。
毫不夸张地说,大语言模型的赛道,从今天起被重新定义。
百万token级别:上下文窗口的史诗级跨越
在上下文窗口这条赛道上,此前最强的模型已经“卷”到了20万token的高度。而谷歌这次直接将数字拉升了一个数量级——稳定处理100万token,极限测试甚至达到1000万token,一举创下新纪录。

这个能力究竟有多强?我们先看一组“大海捞针”的测试结果。

在文本处理方面,Gemini 1.5 Pro在处理53万token文本时,检索完整性达到100%;处理100万token时,依然保持99.7%;即便处理极限的1000万token,检索准确性仍然高达99.2%。

在音频领域,它能在长达11小时的录音中,100%精准定位到隐藏的音频片段。

视频处理同样毫不逊色,面对约3小时的视频内容,它能100%找到隐藏的视觉元素。

研究人员还设计了一个更严苛的“百根针”测试——让模型在文本中检索100个不同的特定信息。Gemini 1.5 Pro在短文本长度上的表现直接超越GPT-4 Turbo,并且在100万token的全量范围内保持稳定输出。相比之下,GPT-4 Turbo的性能随着文本长度增加飞速下滑,而且在超过12.8万token之后直接“罢工”,高下立判。

模型的视野,被“史诗级”拓宽
大模型发展至今,上下文窗口已成为最关键的能力瓶颈。这些窗口由无数token组成,它们是处理单词、图像、视频、音频和代码的基本单元。窗口越大,模型能“看到”的信息就越多,输出自然更连贯、更准确、更实用。
而谷歌通过一系列机器学习创新,直接将Gemini 1.5 Pro的上下文窗口从上一代的3.2万token,拉升到惊人的100万token。这意味着,它可以一次性处理足足1小时的视频、11小时的音频、超过3万行的代码库,或者超过70万个单词的文本。甚至,在内部测试中,他们成功验证了高达1000万token的处理能力。
深入理解海量信息
脱胎换骨后的Gemini 1.5 Pro,处理长内容的能力堪称恐怖。它不仅能看,还能“懂”。

例如,丢给它一份阿波罗11号登月任务的402页飞行记录,它能从中找出复杂的对话、事件和细节,并对这些信息表现出深刻的理解。让它列举出文件中的3个喜剧性时刻——仅仅过了30多秒,答案就出来了。
多模态能力更是让人眼前一亮。输入一张图片,问它“这是什么时刻?”它能准确回答出,这是阿姆斯特朗踏上月球的一小步,也是人类的一大步。
这次谷歌还新增了一个功能,允许开发者上传多个文件(比如PDF)并直接提问。更大的上下文窗口,意味着模型能基于更全面的信息给出更可靠的回答。
横跨各种媒介的推理能力
Gemini 1.5 Pro在视频理解上的表现,同样令人印象深刻。凭借多模态能力,上传的视频会被拆解成数千个画面(不包含音频),模型可以基于这些画面进行复杂的推理。

一个很直观的例子:输入一部44分钟的无声电影——巴斯特·基顿的经典作品《小神探夏洛克》。模型不仅能精准捕捉到电影的情节发展,还能洞察到极易忽略的细节。询问它“找到一张纸从主角口袋中被拿出的瞬间”,大约60秒后,模型精准地给出了答案:电影的第12分01秒,并且描述了相关细节,完全准确。甚至,输入一张粗略的涂鸦,要求模型找到电影中的对应场景,它也能在一分钟内完成匹配。
高效处理超长代码
代码处理能力同样不遑多让。在处理超过10万行代码的超大型代码库时,Gemini 1.5 Pro展现出了极强的问题解决能力。

它不仅能深入分析各个示例,提出实用的修改建议,还能详细解释代码的各个部分是如何协同工作的。对于开发者来说,这意味着可以上传一个全新的代码库,让模型快速帮你熟悉和理清代码结构。
高效架构的秘密:MoE
Gemini 1.5的设计,根植于谷歌在Transformer和混合专家(MoE)架构上的长期积累。与传统的大一统神经网络不同,MoE模型由众多小型的“专家”神经网络组成。它们可以根据不同的输入类型,学会只激活最相关的专家网络路径。这种专门化的分工,使得模型的效率大幅提升。
通过Sparsely-Gated MoE、GShard-Transformer、Switch-Transformer、M4等一系列研究,谷歌早已成为MoE技术的领航者。这种架构带来的优势不仅仅是更快地掌握复杂任务、保持高质量输出,更在于训练和部署也变得更加高效。正因如此,整个团队才能以惊人的速度迭代和推出更先进的版本。
性能比肩Ultra,大幅超越1.0 Pro
在涵盖文本、代码、图像、音频和视频的综合测试中,Gemini 1.5 Pro在87%的基准测试上超越了上一代的1.0 Pro。而与旗舰级的1.0 Ultra相比,其表现也相差无几。

具体来说,Gemini 1.5 Pro在扩大上下文窗口后,性能并未打折。在“大海捞针”测试中,它能在100万token的文本中,以99%的准确率找出隐藏信息。此外,它还展现了卓越的“上下文学习”能力——仅凭长提示中提供的信息就能掌握新技能,无需额外的微调。这个能力在“从一本书学习机器翻译”基准测试中得到了验证,模型通过一本Kalamang语语法手册,就能学会翻译这种全球只有不到200人使用的罕见语言,学习效果与人类相当。
谷歌研究者成功地增强了模型处理长文本的能力,且这种增强并未影响到其他功能。虽然这项改进只用了训练Gemini 1.0 Ultra模型的一小部分时间,但1.5 Pro在31项性能测试中的17项上超过了1.0 Ultra,相比1.0 Pro,更是有27项表现更佳。

详细结果如下:



细节表现深度剖析
分析与掌握复杂代码库
这款模型能迅速吸收大型代码库并解答复杂问题。比如处理three.js——这个包含约10万行代码、示例和文档的3D JavaScript库。借助整个代码库为背景,系统可以帮助用户深入理解代码,并根据高层次需求修改复杂示例。例如,你可以要求:“展示代码,添加一个滑块控制动画速度,采用和其他演示相同的GUI风格。”或者精确指出需要修改的代码位置,以改变地形生成的高度。
浏览庞大而陌生的代码库
模型还能帮助我们理解代码结构,或定位某个功能的实现位置。在一个演示中,它处理了包含116个文件的JAX代码库(总计746k token),并成功找到了实现自动微分反向传播的确切代码。可以想象,在深入了解陌生代码库或日常工作中使用的代码库时,这种长上下文处理能力的价值。

长篇复杂文档的推理
在分析长篇复杂文本文档方面,模型同样表现出色。例如,面对雨果的五卷本小说《悲惨世界》(共1382页,含73.2万token),一个简单的实验展示了它的多模态能力:粗略地画出一个场景,询问“请看这幅图画中的事件发生在书的哪一页?”模型能给出准确的答案——1099页。
Kalamang语翻译:一个里程碑
报告中一个特别引人注目的例子,是关于Kalamang语的翻译。这是一种几乎未在互联网上留下任何足迹的语言,使用人数不足200人。Gemini Pro 1.5通过上下文学习掌握了这种语言的知识,其翻译质量与使用相同材料学习的人类不相上下。在英语到卡拉曼语的翻译中,它的ChrF得分达到了58.3,大幅超越此前最好的模型得分45.8,并略高于人类基准的57.0。这不仅是一个技术成就,更带来了提升罕见语言翻译质量的激动人心的可能性。


Gemini 1.5的诞生,意味着性能的一次阶段飞跃。它标志着谷歌在研究和工程创新上,又迈出了登月般的一步。接下来,能正面与Gemini 1.5抗衡的,恐怕就是传闻中的GPT-5了。
