GPT-5编程能力迎来重大突破,或将彻底改变软件开发行业格局。
核心内容:
1. GPT-5在软件工程领域的显著性能提升
2. 与竞争对手Anthropic模型的直接对比表现
3. 自动化编程对AI行业发展的战略意义
这事儿说来很有意思。据The Information报道,OpenAI的GPT-5已经在路上了,而且早期反馈相当积极——至少有一位用过其未发布版本的人给出了极高的评价。这对OpenAI来说,算得上是一剂强心针。
要知道,自从去年11月OpenAI在「预训练」阶段遭遇收益递减之后,这家ChatGPT的创造者一直承受着不小的压力。整个行业都在盯着它,看它能不能拿出一个真正意义上的重大突破。而现在,GPT-5似乎正在给出答案。
至于GPT-5什么时候正式上线,无论是ChatGPT用户还是开发者,目前都还没个准信儿。不过,CEO Sam Altman已经开始公开谈论他对这个未发布版本的使用感受了,用他的原话说——
感到一阵眩晕,然后瘫坐在椅子上。
据一位使用过该模型的人透露,这个模型的核心设计思路,正是为了实现Altman的那个计划——
将传统的「GPT」品牌大型语言模型与公司的「o」系列推理模型整合到一个模型或聊天界面中。
这和Anthropic的混合Claude模型思路类似。用户很可能能够控制GPT-5对某个问题的「思考」程度,而模型本身也会根据问题的难度自动判断是否开启推理能力。举个例子,如果你问它「strawberry」这个词里有多少个「r」,即使你已经明确指示它要深度思考,它也不会浪费大量计算资源去琢磨这种简单问题。
据这位使用者称,和前几代模型相比,GPT-5在多个领域都表现出了明显改进,包括硬科学、在用户浏览器上完成任务,以及创意写作。但最值得关注的提升,出现在软件工程领域——这也是大型语言模型越来越有利可图的应用场景。
GPT-5不仅在学术和竞赛编程问题上表现更好,在现实工程师可能处理的更实际的编程任务上也有提升,比如在那些充满旧代码的大型复杂代码库中进行修改。这种细微差别,恰恰是过去OpenAI模型的短板,也是竞争对手Anthropic能够在许多应用开发者客户中保持领先地位的原因之一。
当然,OpenAI自己也很清楚这个问题,近几个月一直在下大力气提升模型的编码能力。一位使用过GPT-5的人表示,在他们测试的直接对比中,GPT-5的表现优于Anthropic的Claude Sonnet 4。
不过,这只是一个人的看法——别忘了Anthropic还有Claude Opus 4,用过的都知道这两货的区别。
从商业角度看,OpenAI能否自动化更难的编码任务并赢得软件开发者客户的青睐,这对其业务及其竞争对手的业务都有重要影响。Cursor和其他流行的编码助手每年向Anthropic支付数亿美元或更多费用,使用其Claude模型为编码应用提供支持。这些钱,本可以流向OpenAI。
此前还有报道提到,OpenAI的领导层将自动化编码,特别是实际编程任务的自动化,视为开发通用人工智能的关键组成部分。这个战略判断本身就说明了问题。
总的来说,GPT-5的强劲表现对OpenAI的芯片供应商Nvidia、建设数据中心的公司,以及那些对AI发展轨迹感到担忧的股权或债务投资者来说,似乎都是好消息——
尤其是在关于OpenAI、Google和其他公司的AI模型开发工作时不时遇到困难的报道之后。
但话说回来,还有几点需要注意。
我们仍不确定GPT-5到底是什么。它可能是一种路由器,根据问题将查询导向语言模型或推理模型,而不是使用一个能够处理两种类型的新开发的单一模型。如果是这样,那么观察GPT-5的性能可能无法帮助我们回答这个问题:
通过在预训练过程中扩大计算和数据规模,我们是否会继续看到显著改进?
事实上,我们已经知道,OpenAI早期想要最终命名为GPT-5的语言模型不够好,其中一个被降级为GPT-4.5,并逐渐淡出。可能大部分改进将来自推理模型的进步,而不是传统的语言模型,这意味着它们将发生在后训练阶段——即人类专家参与教导模型新技巧的时候。
即使这是真的,许多研究人员也表示,他们早就预料到预训练模型的改进会放缓。他们认为,改进AI模型的真正机会将来自后训练阶段的强化学习。这涉及「合成数据」——用来描述模型如何产生大量对困难问题的可能答案,以及引导它们解决这些问题的人类专家。
值得一提的是,据一位投资者透露,OpenAI高管曾告诉投资者,他们相信公司可以通过使用目前驱动其模型的结构(或多或少)达到GPT-8。这个信息,至少说明他们对当前的技术路线仍有信心。
