7月2日,欧洲AI公司Mistral AI抛出了一枚重磅冲击波:专门为数学形式化证明程序Lean 4打造的Leanstral 1.5模型正式开源,采用Apache-2.0许可。这个模型总参数量达到119B,但推理时只激活6B参数——典型的MoE架构,算力友好。

先看硬核指标。在miniF2F形式数学基准测试的验证集和测试集上,Leanstral 1.5直接拿下了100%的完成率——一个都不能少。PutnamBench数学竞赛问题集里,672道Lean 4问题,它解出了587道。对于FATE系列抽象代数基准测试,硕士级FATE-H达成率87%,博士级FATE-X也有34%,两项都是目前最佳。

真正让人眼前一亮的是成本优势。Mistral AI算了笔账:在PutnamBench数据集上,解决一道题的平均开支只有4美元。对比一下,Seed-Prover 1.5需要300美元以上,Aleph Prover也要54~68美元。这差距可不是一星半点,开源模型能做到这个性价比,行业里并不多见。
再来看实际场景的表现。在测试的57个代码库中,Leanstral 1.5标记出了47个违规属性,其中11个指向真实缺陷,更关键的是,有5个问题此前从未在GitHub上被报告过。这意味着它不仅能复现已知bug,还能挖出隐藏的漏洞——对形式化验证领域来说,这才是真正的价值所在。
