国际数学奥林匹克竞赛(IMO)官方成绩近日揭晓,一款来自中国的大模型以满分成绩斩获金牌,引发科技界广泛关注。这款名为dots-note-3.0的模型由小红书团队开发,成为首个获得IMO官方金牌认证的中国大模型,同时也是全球第二个达到这一成就的模型,此前仅有谷歌的Gemini模型在竞赛中取得过金牌。
IMO被誉为数学界的“世界杯”,每年吸引全球最顶尖的中学生参与。竞赛题目涵盖代数、组合、几何和数论四个领域,要求参赛者在两天内完成六道高难度题目,每题满分7分,总分42分。与常规数学考试不同,IMO不仅要求答案正确,还必须提供逻辑严密、步骤完整的证明过程,这对人类选手和大模型都构成了极大挑战。
dots-note-3.0在本次竞赛中表现尤为突出,六道题目全部答对,以42分的满分成绩夺冠。这一成绩不仅超越了谷歌Gemini模型此前5/6的得分记录,更在解题方式上展现出创新性。该模型仅使用自然语言就完成了从读题、分析到证明的全过程,部分题目还提出了非常规解法,其证明思路被数学竞赛专家评价为“简洁优雅”“直击本质”。
双CMO金牌得主刘涵祚在分析模型解答后指出,dots-note-3.0的证明结构紧凑、逻辑自然,即使放在人类选手的解答中也属于上乘之作。另一位CMO金牌得主汪千桐则表示,该模型在组合博弈题的解答中展现了惊人的数学洞察力,其归纳法解法抓住了问题的本质结构,这种能力在人类选手中也极为罕见。
大模型参与IMO竞赛之所以备受关注,源于数学能力被视为衡量人工智能推理水平的核心指标。与常规基准测试不同,IMO题目每年由专家全新命制,赛前严格保密,确保模型无法通过提前训练获得优势。这种设置使得竞赛成为检验模型真实推理能力的理想场景——模型必须在完全未知的情况下,独立理解问题、探索解决方案并完成严密论证。
本届IMO竞赛的难度较往年显著提升,金牌分数线从去年的35分降至29分,降幅达6分。在这样的背景下,dots-note-3.0的满分表现更显难得。竞赛要求模型在规定时间内直接阅读英文题目并生成证明,最终答卷由来自不同国家的IMO评审员按照正式标准审阅,确保了评价的公正性和权威性。
从技术实现来看,dots-note-3.0采用了智能体架构,结合自然语言处理与Python代码执行进行推理。模型在解题过程中会运用递归自我批判机制,不断审视论证的合理性,这种能力使其能够处理更复杂的数学问题。特别是在组合博弈题的解答中,模型没有沿用常见的图论转化方法,而是创新性地设计了归纳对象与命题,展现了强大的抽象思维能力。
此次竞赛成绩标志着小红书在基础模型领域取得重要突破。长期以来,该公司在公众认知中主要与内容社区、推荐算法相关,基础模型能力鲜为外界所知。IMO满分金牌为小红书提供了技术实力的权威证明——在需要深度推理和创造性思维的数学竞赛中,其模型已达到全球顶尖水平。据悉,dots-note-3.0模型即将开源,这或将为人工智能研究社区带来新的发展动力。
