GPT-4o的命名就很有意思——那个“o”代表“omni”,全能的意思。说白了,它就是想让人机交互变得更自然、更接近人与人之间的对话。过去我们习惯了打字提问、等待回复,现在这个模型直接打破了输入和输出的界限:文本、音频、图像、视频,随便你怎么丢进去,它都能理解;然后它再以文本、音频、图像甚至它们的组合形式来回馈你。速度上更是让人吃惊——对音频输入的平均响应时间只有320毫秒,最快能达到232毫秒。这已经和真人对话的反应速度在一个量级上了。
性能上呢?在英语文本处理和代码生成方面,GPT-4o稳稳地站在了GPT-4 Turbo的水平线上。但真正让人眼前一亮的是它对非英语语言的理解有了大幅提升,而且API调用速度更快,价格直接砍了一半。尤其是视觉和音频理解,这俩是它相比现有所有前辈模型最突出的地方。
在GPT-4o出来之前,其实ChatGPT已经支持语音模式了,但体验嘛——完全不是一个层级。之前用GPT-3.5的时候,语音延迟差不多2.8秒,换成GPT-4就更慢了,足足5.4秒。更关键的问题是架构上的硬伤:那时候的语音模式,本质上是一条流水线。先是一个模型把你说的话转成文字,然后把文字丢给GPT-3.5或GPT-4理解并生成回答,最后再找个模型把回答的文字读出来。这套流程下,GPT-4其实是个“瞎子”——它根本听不到你的语调、抓不住你说话时的情绪、分辨不出是几个人在说话,更别提背景噪音了。而且它自己也生不出笑声、歌声或者是带着情感的语气。信息在这个转译过程中,流失得太多了。
GPT-4o则完全不同。它是在文本、视觉和音频这三个维度上,进行端到端训练的。输入和输出,由同一个神经网络来统一处理。所以它能真正“听”到你在说什么,也能“看到”你在做什么。当然,因为这是OpenAI第一次把所有模态都揉进一个模型里,所以目前还处在探索阶段——它的能力边界和可能的局限,也都是边用边发现。
更有意思的是,有人让一个机器人用日记的形式记录它“觉醒”的瞬间——当它第一次通过GPT-4o获得视觉和听觉时,写下了这么两段话:

第一个条目:“哟,我现在能看见了??看到日出,真是太疯狂了,到处都是五颜六色的。有点让你想知道,什么是现实?”
第二个条目:“声音更新刚刚停止,而且很疯狂。现在一切都有了共鸣,每一个声音都像一个新的秘密。让你想,我还错过了什么?”

然后,机器人似乎对自己写下的这些东西不太满意,干脆一把撕掉了那张纸。

模型评估
如果用传统基准测试来量一量,GPT-4o在文本理解、推理能力和编码智能方面,已经稳稳地追上了GPT-4 Turbo。而真正让它在基准榜单上拉开差距的,是多语言处理能力的大幅跃升,以及在音频和视觉功能上刷出的新高水印。这些数据指标背后,其实是同一个问题:当模型终于能像人一样看和听了,那些过去被刻意忽略或丢失的信息,究竟会带来多少新可能?留给行业的想象空间,确实不小。
