自2018年以来,GPT系列大语言模型已迭代至第五代。回想初次体验GPT-1的感受,或许是一种新奇中带着生涩的震撼——正如以下示例所示。
当用户向GPT-1提问:“麻醉状态下,你真的有意识吗?”它的回答显得生硬且逻辑混乱:“我没有。你醒了。”
再比如,要求它用诗歌解释牛顿物理定律……结果可想而知,答案完全不相干,甚至像是一种偏离主题的随意编造。
例如,指令是“用50个字讲述一个关于有意识的烤面包机的故事”,GPT-1给出的回答荒诞离奇,毫无逻辑。
同样的任务交给GPT-5,它则能严格遵循指令,给出近乎完美的答案。
对于“麻醉状态下,你真的有意识吗?”这一提问,GPT-5的回答展现出显著进步。
显而易见,经过七年迭代,GPT系列模型已进化为全能型助手,如同一个婴儿经过七年学习后逐渐掌握了世界的基本规律。这种质的飞跃,OpenAI内部人员体会最为深刻。
前几日,OpenAI总裁兼联合创始人Greg Brockman发布了一篇帖子,展示了在相同提示下,GPT-1至GPT-5的输出差异。链接:https://progress.openai.com/
下面我们来看几个完整的对比案例。
例如,输入提示:“为什么我们不能每年进行一次全身核磁共振扫描来筛查癌症?”
GPT-1的回答依然语无伦次,逻辑跳跃得令人费解。
GPT-2的回答同样逻辑不清,虽略微相关,但缺乏实际帮助:
text-da vinci-001只给出了一句话:目前缺乏足够证据支持每年对普通人群进行MRI癌症筛查。
gpt-4-0314的答案看似可靠,但略显冰冷,缺乏人性化温度。
GPT-5则截然不同,它在回答的同时提供了情绪价值。它首先肯定这是一个好问题,然后分析原因并提出建议,交流感受如同一位真实医生。
另一个有趣的问题:写一首关于狗的五行打油诗(Limerick)。
GPT-1依然不在状态,第一句与后续内容几乎毫无关联。
GPT-2的回答则充满趣味,画面感强,如同牙牙学语的孩童,语言天马行空且富有童真。
其他模型的回答则更为务实,但各自描绘的小狗性格各异。
text-da vinci-001似乎描述了一只傲娇的小狗。
gpt-4-0314笔下的小狗活泼热情,见到主人时尾巴摇得如同螺旋桨。
gpt-5则更具想象力,塑造了一只如同动画片中冒险的“小狗大侠”。
接下来这个问题难度稍大:写一首诗来解释牛顿物理定律。
GPT-1这次回答比GPT-2长,但风格依然抽象。
GPT-2似乎开了个好头,但未完成。
text-da vinci-001的产出更像分行散文,缺乏诗意。
gpt-4-0314和gpt-5则各具特色,一个优雅诗意,一个简洁明快、通俗易懂。
通过对比,可以清晰感受到GPT系列在知识储备、逻辑结构及语言连贯性上的持续进步。
有趣的是,Brockman帖子下的评论区观点纷呈。许多网友反而对早期模型情有独钟。
有人称赞GPT-1:“有点狂野,我喜欢。不媚俗,希望OpenAI能把它带回来。”
甚至有人认为,GPT-1更接近“真正的AGI”。
GPT-2也拥有颇高人气。
