游乐游手机版
首页/AI热点日报/热点详情

谷歌深夜发布原生多模态Gemini 挑战GPT-4霸主地位

类型:热点整理2026-07-21
谷歌发布原生多模态大模型Gemini,在MMLU测试中得分超越人类专家,多项基准领先GPT-4。但其测试使用思维链技巧并多次取优,演示视频也被质疑非实时交互,引发争议。

GPT-4迎来了一个真正的对手。

北京时间12月7日凌晨,谷歌CEO皮查伊突然扔出了一枚重磅冲击波——Gemini。就在前几天,外界还在传Gemini要推迟一个月才能上线,结果这突如其来的发布,让整个AI圈措手不及。以谷歌过往的实力来看,这注定又是AI界的又一个“不眠之夜”。

回想去年,ChatGPT发布不到两周,谷歌就拉响了警报紧急应战。好不容易推出的Bard,却在首次亮相时闹了乌龙,直接导致谷歌市值一夜蒸发1000亿美元。

更何况,GPT系列本身就是基于Transformer架构发展起来的,而Transformer最早就是谷歌提出的。要让谷歌心甘情愿认输,恐怕没那么简单。

果不其然,这一年来,关于Gemini的消息从未间断。有消息称,谷歌大脑和DeepMind部门合并,几乎耗尽了谷歌内部的全部算力资源,目的就是背水一战,与OpenAI一决高下。

只不过,前段时间OpenAI的发布会炸翻了AI圈,后来又上演了一出“宫斗剧”,甚至还传出了让人浮想联翩的Q*,谷歌却始终没有动静。一度让人以为,AI圈的王者之争已经尘埃落定。

就在一个月前,英伟达科学家Jim Fan就曾放话:“人们对谷歌Gemini的期望高得离谱!要想重现当年AlphaGo的辉煌,Gemini不仅要百分之百达到GPT-4的能力,还得在成本或速度上更胜一筹。”

生来就是全才

好在,从Gemini公布的演示视频来看,它确实没让人失望。

“Gemini,从第一天起就是多模态大模型——跨越文本、图像、视频、音频和代码的无缝推理。”这是谷歌官网上介绍Gemini时的第一句话。

和ChatGPT通过不断迭代,逐步叠加视觉、音频等多模态能力,最终形成“合体金刚”的路线不同,Gemini从诞生之初就是一位全能选手。它从一开始就被设计为原生多模态结构,文本、图像、音视频能力从训练之初就同步进行。从这个角度看,Gemini的学习方式更像人类。这意味着,Gemini可以无缝调用多模态能力,抽象理解、操作和组合不同类型的信息。

举个例子:如果同时向ChatGPT和Gemini上传一张图片,ChatGPT的处理流程是:先借助GPT-4V识别图像内容,再将其转换为文本,交给GPT进行语义理解,最后给出回答。而Gemini可以直接基于图像进行理解和回应,无需在不同模型之间切换。实际体验中,Gemini能减少信息损耗,回应也更加迅速和流畅。

从谷歌发布的演示视频就能看出端倪:

演示者一边画画,Gemini就能一边辨认,并用自然流利的语音与演示者对话。当演示者拿出蓝色玩具鸭实物时,它甚至幽默地回应:“看起来蓝色的鸭子比我想象中更常见。”

很显然,这种体验更接近漫威里的“贾维斯”——一种能与人类自如交互的高级人工智能。

这种体验背后,离不开Gemini的原生多模态架构

Gemini VS GPT-4

除了惊人的原生多模态能力,在性能方面,Gemini同样强悍

根据尺寸不同,Gemini共分为“中杯”、“大杯”和“超大杯”三个版本,即Ultra、Pro和Nano。它们在性能和适用任务上各有侧重。

  • Gemini Ultra — 规模最大、功能最强的模型,适用于高度复杂的任务,预计2024年初推出。
  • Gemini Pro — 适用于各种任务的最佳模型,已应用于谷歌聊天机器人Bard的升级版。
  • Gemini Nano — 可在终端设备上运行的高效模型,已能在谷歌Pixel 8 Pro手机上运行。

根据谷歌提供的数据,从自然图像、音频和视频理解,到数学推理,Gemini Ultra在32个常见的大语言模型研究和开发基准测试中,拿下了30个SOTA

其中,它在通用、推理、数学和编程等主要方向上的成绩如下:

更令人惊讶的是,在MMLU(大规模多任务语言理解)测试中,Gemini Ultra的得分达到了90.0%,超越了人类专家89.8%的表现,首次达到了超越人类专家的水平

MMLU测试涵盖了数学、物理、历史、法律、医学等57个学科,主要用于考察大语言模型的世界知识和问题解决能力。而在这57个学科中的每一个,Gemini都达到了甚至超过了行业专家的水准。

在图像基准测试中,Gemini Ultra在不使用OCR(对象字符识别)提取图像文本的情况下,表现优于GPT-4V

各项测试表明,Gemini在多模态处理方面展现出了强大的能力,在更复杂的推理上也蕴含巨大潜力。

实际能力被质疑

然而,模型发布后不久,就有人在谷歌提供的60页技术报告中发现了“小技巧”。

在MMLU测试中,Gemini的结果下方用灰色小字标注着“CoT@32”,这意味着,这个成绩是使用了思维链提示技巧,尝试了32次后选出的最佳结果。而对比的GPT-4,则是在没有使用提示词技巧、仅尝试5次的情况下得出的结果。测试中的变量控制,显然不够严谨。

此外,在展示超越人类专家的示意图中,比例尺也存在问题,让人误以为超越了人类专家很多,但实际上差距并不大。

HuggingFace的技术主管Philipp Schmind“修复”了这张图,指出实际情况应该是这样的:

而且,在谷歌一篇解释多模态交互过程的博客中,似乎暗示演示视频中的Gemini实时互动并非真实场景,而是使用了静态图片,通过多段提示词拼凑,再经剪辑才达到了演示效果。

无论谷歌是否有意使用“障眼法”,Gemini的发布无疑给看似稳定的AI界带来了不小的“震荡”。

与此同时,谷歌还宣布推出了迄今为止最强大、最高效、最可扩展的TPU系统:Cloud TPU v5p。Gemini正是在此基础上训练的,这意味着谷歌有望摆脱英伟达的算力限制,也为AI芯片市场带来了新的变数。

大模型的多模态探索

随着ChatGPT通过升级迭代获得了多模态能力,以及Gemini展现出的原生多模态能力,我们可以清晰地感受到,AI大模型的浪潮已经进入了全新阶段——从大语言模型转向多模态模型。后者更符合人类与世界的自然交互方式:用眼睛看,用耳朵听,用嘴巴说,用文字记录与决策。

多模态领域的技术探索,与互联网媒介形式的变化高度吻合——从文字媒体,到音视频媒体。如今,随着抖音、TikTok等短视频平台的崛起,视频已经成为这个信息时代的主流媒介。

根据思科的年度互联网报告,视频已经占据了互联网超过80%的流量

很明显,如果AI大模型不具备识别图像和音视频的能力,那么它的训练数据将跟不上信息迭代的速度,能力也将大打折扣。

如今,在多模态模型的探索道路上,除了GPT,Gemini也加入了战局。不知道未来Meta的Llama、马斯克的Grok等,是否也会加入这场角逐?

来源:https://m.elecfans.com/article/2334625.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。