先说一个核心判断:在AI大模型赛道中,模型参数规模已不再是唯一的性能标杆。微软最新开源的Phi-2,仅凭27亿参数,就交出了一份令许多大模型相形见绌的成绩单。
微软官方宣称,这款仅有27亿参数的语言模型,其表现足以与尺寸大上25倍的模型一较高下,甚至在部分任务中还实现了反超。虽然听上去有些不可思议,但基准测试结果极具说服力:在多项综合评估中,Phi-2的表现超越了当前主流的Mistral 7B和Llama-2 13B。更令人惊讶的是,在需要多步推理的编码与数学任务上,Phi-2甚至优于比它大25倍的Llama-2-70B。放眼当下,它也毫不逊色于谷歌刚推出的Gemini Nano 2,整体状态甚至更占优势。


除了硬核的性能指标,Phi-2在“软实力”方面同样值得关注。与经过调整的同类开源模型相比,它的回答中“毒性”和各类偏差显著减少。对于正在探索AI安全、可解释性以及道德发展领域的研究人员而言,这无疑是一个更理想的起点。

还记得谷歌Gemini那个演示视频吗?视频中Gemini能够解决复杂的物理题,甚至像老师一样对学生进行纠错。微软的研究人员也拿同样的题目测试了Phi-2,结果发现,它不仅能同样正确地回答问题,而且在相同的提示词下也能完成纠错动作。这很有意思,说明小模型的推理能力已经迈入了一个新的高度。

Phi-2是微软“小语言模型(SLM)”家族的第三代产品。最初的Phi-1仅有13亿参数,主要针对基础的Python编码任务。到了9月份,微软将重点拓展到常识推理和语言理解,推出了Phi-1.5,同样只有13亿参数,但性能已经能与5倍大的模型抗衡。如今这个Phi-2,无疑将这个家族的天花板又推高了一大截。目前,Phi-2已通过Azure AI Studio的模型目录正式发布,想要尝鲜的同学可以前往体验了。
