上周,红杉资本旗下播客邀请到一位重量级人物——微软首席技术官凯文·斯科特。他在访谈中再度力挺大型语言模型的“规模定律”,坚信这条路远没走到尽头,尽管圈内已有不少声音怀疑进步正在趋缓。要知道,正是这位斯科特在背后推动了微软与OpenAI那笔130亿美元的技术共享协议,他的表态自然分量十足。

斯科特直言:“有人说规模化的边际收益在递减,我不同意。我想让大家明白,这其实是一个指数级提升的过程。遗憾的是,你只能每隔几年才看到一次,因为建造超级计算机、再用它们训练模型,都需要时间。”这番话直接把矛头对准了那些认为大模型进步已经撞墙的人。
回溯一下,2020年OpenAI的研究人员首次系统阐述了LLM的“规模定律”——模型参数越多、训练数据越庞大、算力越强,语言模型的性能就会呈可预测的线性甚至指数提升。换句话说,只要持续堆料,能力自然能涨,根本不需要每次都搞算法上的大突破。这个定律至今仍是OpenAI研发理念的基石。
但质疑声从未停止。一些观察者注意到,从GPT-3到GPT-4,性能提升肉眼可见;可到了Gemini 1.5 Pro、Claude Opus以及GPT-4o这一代,进步似乎没那么大了。非正式的基准测试和业内口碑都传出一种感觉:大模型可能正在进入“边际收益递减”的阶段。人工智能领域著名的批评人士Gary Marcus今年4月就写道:“GPT-3明显优于GPT-2,GPT-4也明显强于GPT-3。但之后呢?”这句话精准戳中了当前焦虑的核心。
斯科特的立场其实不难理解。微软向OpenAI砸了上百亿美元,又在大力推销自家的Microsoft Copilot,如果公众开始相信大模型进步停滞,那整个商业逻辑都会被动摇。所以,维持“持续突破”的公众认知,对微软来说至关重要。哪怕技术真的遇到瓶颈,姿态上也必须保持信心。
另一位知名批评者Ed Zitron则更尖锐。他最近在博客里说,支持继续烧钱的人常常暗示“OpenAI手里藏着我们不知道的秘密武器,一项能瞬间击垮所有质疑的神秘技术”。他直接戳破:“真相并非如此。”这语气,摆明了就是不信还有什么隐藏大招。
话说回来,公众感觉进步放缓,可能也跟认知的时间窗口有关。OpenAI在2020年发布GPT-3之后,默默研发了三年才推出GPT-4。但大多数人是在2022年底通过ChatGPT(基于GPT-3.5)才第一次体验到强大语言模型,所以到2023年GPT-4一来,感觉是巨大的飞跃。而如今,大家已经开始期待GPT-5或者类似的“下一代”,但开发周期摆在那里,自然觉得等待漫长。
斯科特在采访中也承认,新模型往往需要数年才能开发,所以数据点的更新确实比较慢。但他对未来版本的改进信心满满,尤其强调目前模型表现不佳的地方正是突破的方向。“下一个突破即将到来,我无法确切地预测它何时出现,也不知道它会取得多大的进步,但它几乎肯定会改善现在那些不够完善的方面——比如成本太高、用起来太脆弱、让人不放心。所有这些方面都会改善:成本降下来,模型更稳定。到那时,我们就能实现更复杂的功能。这就是每一代大型语言模型通过规模化所取得的成就。”这番话说得相当具体,也透露了微软内部对下一步的预期。
整体来看,规模定律是否真的能持续,可能只有时间和下一轮模型才能给出答案。但至少,像斯科特这样的人,依然把赌注押在了“更大更强”这条路上。
