游乐游手机版
首页/AI热点日报/热点详情

谷歌Gemini 1.5 Pro数学版MATH基准准确率91.1%媲美人类专家

类型:热点整理2026-07-24
谷歌专训Gemini1 5Pro推出数学版,在MATH、AIME等基准测试中表现与人类专家相当,MATH准确率达91 1%(rm@256策略),超越GPT-4Turbo和Claude。

谷歌上周发布了一份技术报告,核心信息非常有价值:他们对 Gemini 1.5 Pro 模型进行了专项数学推理训练,结果该模型的数学能力显著提升,甚至能够解答国际数学奥林匹克竞赛中的部分难题。这并非简单的刷分行为,而是有严谨的测试数据支撑。

声称“媲美人类专家”,谷歌 Gemini 1.5 Pro 数学版“提智”:MATH 基准准确率 91.1%

训练方法是什么?谷歌将训练重点集中在数学场景上,随后通过三大基准来评估效果:MATH 基准、美国数学邀请赛(AIME),以及谷歌内部自建的 HiddenMath 基准。结果如何?数学专精版 Gemini 1.5 Pro 在这些测试中的表现,用谷歌的话来说——“与人类专家的水平相当”。与未经特训的标准版相比,它在 AIME 上解决的题目明显更多,其他基准的得分也同步提升。

谷歌官方列举的三个示例更具说服力:其中两道难题被数学专用版成功攻克,而标准版恰好倒在了其中一道上。这些题目考察的内容非常“硬核”——需要你回忆代数中的基本公式,并能灵活运用分段函数等数学规则,才能得出正确答案。

除了解题能力,谷歌还公布了完整的基准对比数据。结果显示,在全部五项测试中,Gemini 1.5 Pro 都稳定超越了 GPT-4 Turbo 和亚马逊的 Claude。具体到 MATH 基准:单个样本的准确率为 80.6%;如果对 256 个解题方案进行采样,再从中选出一个候选答案(即 rm@256 策略),准确率直接飙升至 91.1%。这一数字,已经向人类专家水平看齐。

来源:https://www.1ai.net/10768.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。