谷歌上周发布了一份技术报告,核心信息非常有价值:他们对 Gemini 1.5 Pro 模型进行了专项数学推理训练,结果该模型的数学能力显著提升,甚至能够解答国际数学奥林匹克竞赛中的部分难题。这并非简单的刷分行为,而是有严谨的测试数据支撑。

训练方法是什么?谷歌将训练重点集中在数学场景上,随后通过三大基准来评估效果:MATH 基准、美国数学邀请赛(AIME),以及谷歌内部自建的 HiddenMath 基准。结果如何?数学专精版 Gemini 1.5 Pro 在这些测试中的表现,用谷歌的话来说——“与人类专家的水平相当”。与未经特训的标准版相比,它在 AIME 上解决的题目明显更多,其他基准的得分也同步提升。
谷歌官方列举的三个示例更具说服力:其中两道难题被数学专用版成功攻克,而标准版恰好倒在了其中一道上。这些题目考察的内容非常“硬核”——需要你回忆代数中的基本公式,并能灵活运用分段函数等数学规则,才能得出正确答案。
除了解题能力,谷歌还公布了完整的基准对比数据。结果显示,在全部五项测试中,Gemini 1.5 Pro 都稳定超越了 GPT-4 Turbo 和亚马逊的 Claude。具体到 MATH 基准:单个样本的准确率为 80.6%;如果对 256 个解题方案进行采样,再从中选出一个候选答案(即 rm@256 策略),准确率直接飙升至 91.1%。这一数字,已经向人类专家水平看齐。
