小红书这次真是低调办大事!
刚刚,IMO 2026成绩正式揭晓,大模型领域的年度比拼达到了全新高度。令人意外的是,首个获得官方评卷满分的,竟然是小红书???
经IMO官方权威评定,小红书大模型dots-note-3.0在六道题目中全部作答正确,以满分成绩成功斩获金牌。这一成绩含金量几何?简单来说,这是中国大模型首次获得IMO官方金牌水平认证,同时也是继谷歌Gemini模型之后,全球第二个达到该成就的大模型。更值得关注的是——是满分!谷歌当年也只完成了5/6的题目……
太令人震撼了,这还是我们熟悉的小红书吗?首次亮相世界级竞赛,就实现了开门红~
进一步深挖发现,小红书大模型dots-note-3.0的解题方式同样令人眼前一亮:它仅依靠自然语言就完成了从读题、解析到撰写证明的全过程,最终答案不仅全部正确,还在部分题目上创新性地提出了非常规解法。
图片由AI生成
双CMO金牌得主刘涵祚在审阅后评价道:
模型最终给出了一条正确且优美的证明思路。这种解法结构紧凑、逻辑自然,即便放在IMO解答中,也属于较为简洁优雅的一类。
CMO金牌得主汪千桐也给出了类似的结论:
从数学审美的视角来看,小红书大模型dots-note-3.0的解答非常漂亮且优雅。常规解法已经足够巧妙,但dots直接攻克了题目中最难、也最核心的部分。
在他看来,dots的解题过程简洁明了且直击本质。看完之后,会觉得每一步都顺理成章,但真正面对题目时,人类选手很难想到从这个角度切入。换句话说,IMO满分金牌或许还远未触及小红书大模型dots-note-3.0能力的上限。
为什么当前的大模型需要IMO
首先科普一下,IMO究竟是什么,以及为何各大厂商都在争相将自家大模型送上考场。
IMO全称为国际数学奥林匹克竞赛,每年吸引全球最顶尖的中学生参与。陶哲轩等近半数当代菲尔兹奖得主均出身于IMO,谷歌联合创始人Sergey Brin也曾获得IMO金牌。比赛通常分两天进行,每天4.5小时需完成3道题,共计6道题,覆盖代数、组合、几何和数论四大方向。每题7分,满分42分。但仅有答案远远不够,参赛者必须提供逻辑完整、可接受逐步审查的证明过程才能得分。
对于大模型而言,这无疑是极高难度的挑战,却也是最直观的能力展示方式。以Gemini为例,2024年谷歌首次挑战IMO,最终仅获得28分的银牌成绩,当时系统还需将自然语言题目翻译成Lean等形式化语言,部分题目甚至耗时数天。第二年卷土重来,Gemini Deep Think直接采用自然语言端到端完成证明,在4.5小时内解决5道题,成功斩获金牌。
这背后是一次跨代的能力跃迁。从深层次看,数学是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中表现越突出,越能彰显其底层优势。
再举一个最近的例子,就在本周,Fable 5参与构造了一个雅可比猜想的反例。该猜想自1939年提出以来,悬而未决长达87年,连张益唐等顶尖数学家也在此折戟。此次发现的反例虽尚未经过正式同行评审,但标志着大模型现阶段的能力已足以参与真正的数学发现。而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。
此外,IMO相比Benchmark还有一个得天独厚的优势——未知性。每届比赛的赛题均由专家命制,在正式比赛前严格保密。这意味着模型不可能提前获取原题,实时参与当届比赛,也能确保模型无法进行针对性训练。
一位头部模型研究员对此给出了如下判断:
在当下的模型训练中,基本可以认为,互联网上一旦出现某些数据,很快就会被模型拿去训练,模型也就知道了。因此,要测试一个模型是否真正聪明,只能测试那些尚未公开的内容。
这正是同步参与官方IMO测评对于大模型而言最难复制的价值所在。
它考验的不是模型记住了多少题目和数学知识,而是当真正未知的问题首次出现时,模型能否独立理解、探索,并最终完成严密推理。
而且,仅有新题还不够,官方评测采用严格的当届赛事流程。每个比赛日学生考试结束后,模型团队才会收到当天题目,并须在规定期限内提交PDF答卷。模型将直接阅读英文题目并生成证明,工作人员仅负责保障系统运行。最终答卷由来自不同国家的IMO评审员,按照正式标准进行审阅。
本届新题、规定时间、完整证明、第三方专业评审——当这些条件同时满足,才使IMO成为目前难以通过背题和包装规避的能力大考。
一分未丢,比拿到金牌更难
正因如此,此次小红书大模型dots-note-3.0斩获金牌,且是满分,才显得格外引人注目。
六道题全部答对,首先证明了Agentic推理系统的稳定性。模型需要读懂自然语言条件,判断哪些信息真正关键,提出可能成立的中间结论,再将它们组织成一套完整证明。在整个过程中,任何条件被误读、任何推导跳步,都会留下可被评审直接指出的漏洞。小红书大模型dots-note-3.0能在六类不同问题中连续拿满,意味着其表现并非依赖某一道题上的偶然灵感。
其次,小红书大模型dots-note-3.0直接一步到位,采用自然语言端到端处理,意味着模型能够像人类选手一样直接理解题目、自主寻找路径,具备从问题理解到答案表达的完整闭环。这代表模型拥有可迁移的通用推理能力。
具体而言,在本次答题过程中,小红书大模型dots-note-3.0以智能体的方式,让模型使用自然语言结合python代码执行来推理解题。在推理过程中,还借助递归自我批判能力,审视自身论证,从而解决更多现实中的复杂任务。
图片由AI生成
不过,真正令人惊喜的,还是第三题所展现出的模型创新思维。这是一道组合博弈问题,网上关于本届IMO赛题讨论的常见解法,是先将原问题转化为图论中的连通性问题,再借助图论语言构建证明。这条路线本身已十分巧妙,但小红书大模型dots-note-3.0并未沿用,而是转而采用归纳法。小红书的解法抓住了问题最本质的结构,设计出了恰到好处的归纳对象与归纳命题。
这也解释了,为何CMO得主汪千桐会用漂亮和优雅来形容这套答案。小红书大模型dots-note-3.0对问题结构的剖析之深,让人自然而然地产生一种恍然大悟的感觉。
回到结果本身,模型能在本届拿下满分,实际上相当不易,可以从以下几个层面来看。
第一层,本届整套赛题的得分难度明显高于去年。2026年IMO金牌线为29分,去年则高达35分,短短一年时间,金牌线下降了6分,几乎相当于一整道题的分数。因此,这一届的金牌,相较于去年的Gemini,分量更重。
第二层,满分与金牌之间仍有差距,今年整整相差13分。29分意味着,选手完整解决4道题,再从剩余两道题中拿到1分,即可进入金牌区间。而小红书大模型dots-note-3.0全部投入,直接达到了这套试卷所能衡量的最高点。毕竟老话说得好,满分只是卷面的上限,并非它的上限。金牌固然代表进入全球最顶尖的一批,但满分则意味着在这批顶尖选手中,再完成一次极小概率的筛选。
小红书大模型dots-note-3.0即将开源
选择IMO作为起点,也是小红书非常明智的一步。如今行业内,要将大模型底层技术能力推广出去,通常有两个方向,一是Coding,另一个就是数学。原因也很简单:这两种任务的结果,难以通过语言包装蒙混过关,相比知识问答和主观评测,它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。IMO更是其中的佼佼者,知名度高、业内认可度也足够,直接呈现的是模型面对高难度未知问题时展现出的深度推理能力。
因此,对小红书而言,这是一次重要的技术亮相。
过去,外界对小红书的技术认知,更多集中在内容社区、推荐算法和内容理解方面。在基础模型领域,小红书究竟处于什么位置,一直缺少一份足够公开、权威且无需复杂解释的成绩单。参数规模难以直接等同于能力,常规Benchmark上的几个百分点,也难以让行业形成清晰认知。
IMO满分不同,42分就摆在那里,足以证明,小红书已经具备值得行业认真审视的基础模型能力。它用一枚IMO满分金牌,让行业第一次看清了自己的技术实力——基础模型领域,出现了一个值得关注的新玩家。
P.S.对应模型即将开源,敬请期待~
