当全球AI竞赛还在大语言模型和图像生成上卷生卷死时,中国团队悄然在另一个基础性领域——几何逻辑推理,埋下了一颗重磅冲击波。近日,由北京通用人工智能研究院领衔,联合北大多个学院组成的跨学科团队,成功开发了一款名为“通矩模型”(TongGeometry)的自主AI系统。相关成果已经登上了国际顶刊《自然-机器智能》。业内共识是:这是全球首个真正意义上既能“自己出题”又能“自己解题”的通用AI,标志着我们在自动化逻辑推理这个硬核赛道上,实现了从追赶到并跑甚至领跑的关键跨越。

简单来说,过去AI做几何题,一直卡在两个瓶颈上。
第一个是“组合爆炸”。 几何证明不像算术,它需要添加辅助线、辅助圆,每多加一个元素,可能的组合方式就呈指数级增长。搜索空间大到离谱,传统方法很容易在里面绕晕。
第二个是“数据饥渴”。 高质量的几何题库就那么点,题型有限,覆盖不全。靠这点数据去训练一个大模型,很难指望它泛化出多强的推理能力,更别提举一反三了。
为了解决这些问题,团队设计了一套高鲁棒性的逻辑推理搜索框架。这个框架不简单,它把复杂的几何世界做了一次彻底的“结构化拆解”。其核心思路是:让AI在每个推理节点上,都能像人类数学家一样,进行有层次、有策略的探索。这样一来,大量低效甚至无效的盲目试错就被有效地规避了。
这里面最让我眼前一亮的,是团队原创的“规范化表示”技术。你可以把它理解为赋予模型一种“看穿表象”的能力。在几何世界里,同一个命题,图形旋转90度、镜像翻转一下或者比例缩放一点,看起来就是千变万化的。但通矩模型能自动识别并归并所有对称等价或拓扑同构的构型。好比不管一个三角形怎么在坐标系里转,系统都能稳稳地抓住那个不变的核心几何关系。正是通过对这种几何对称性与不变量的深度建模,系统把原始的搜索空间压缩了几个数量级。这才是效率提升的关键支点。
有意思的是,它在激发解题直觉时,还引入了一套基于数学美学的价值评估机制。这听起来有点玄乎,但原理很实在:系统内置了个“价值模型”,依托强化学习框架,实时评估每条推理路径的价值。它关注的不仅仅是结论对不对,更在意推导链条是不是精炼、结构是不是优美、步骤是不是经济。
论文第一作者张驰在解读时打了个比方,说当模型察觉到某个命题的证明难度远超其构造本身时,它就会触发类似人类数学家“灵光一现”的信号。这种由价值函数驱动的主动探索,让系统不仅能复现已有的解法,还能从海量可能中甄别出符合人类数学审美的新题。用张驰的话说,这真正实现了从“被动解题”到“主动创题”的范式跃迁——而在这方面,全球范围看,这确实是首例。
