当前位置:首页 / 智造 / 正文

小红书AI模型首获国际数学奥赛满分:42分全对超金牌线13分

来源:互联网

2026年国际数学奥林匹克竞赛(IMO)近日公布成绩,小红书自研大模型dots-note-3.0在官方评卷中答对全部六道题,以42分满分获认证,成为全球首个在IMO官方评卷中获得满分的大模型。本届IMO于7月15日至16日在上海举行,共有来自120多个国家和地区的约685名参赛学生参加,题目涵盖代数、几何、数论和组合四个领域,每题7分,满分42分。

直接处理原始试题,无需人工翻译

小红书dots-note-3.0在收到题目后被置于与人类选手相同的解题约束下,由智能体化推理系统独立完成审题、构造思路和撰写证明,再由IMO组委会专业阅卷人评分。六道题均获7分满分,超过本届金牌线13分。测试期间严禁任何形式的人工干预,包括人为调整AI解题步骤、补充推理逻辑、提示思路或修正答案。

这是AI参赛方式的一次重要突破。2024年IMO中,谷歌DeepMind的AlphaProof和AlphaGeometry 2模型获得28分,相当于银牌水平,但需要人类专家手动将题目翻译为逻辑语言供AI处理。今年小红书的模型直接处理原始数学竞赛文件,无需人工翻译为特殊编程语言。

dots-note-3.0采用智能体框架,能够将自然语言推理和Python编程执行结合起来,对证明过程进行起草、测试和完善。小红书介绍,系统能仔细检查自身推理,质疑假设,并在提交最终方案前通过多步骤自我审查循环持续修正错误逻辑。dots-note-3.0目前处于测试阶段,是dot3系列中最为轻量的模型,该系列还包括jazz和aria两个更大量级版本。

从35分金牌线到42分满分

AI在IMO上的成绩逐年攀升。去年IMO中,谷歌DeepMind和OpenAI的AI模型均获得35分,达到金牌线水平,完成了6道题中的5道。今年小红书模型首次在官方评卷中拿到满分42分,将AI在数学竞赛中的表现提升至新高度。

本届IMO结束后,前谷歌工程师Deedy Das用同样6道题对其他前沿大模型进行了第三方测试。结果显示,Claude Fable 5、GPT-5.6 Sol和Kimi K3均成功解答全部6道题获满分。其中Claude Fable 5尝试一次即解出所有题目,耗时2.5小时花费51美元;GPT-5.6 Sol用时3.8小时,成本最低仅20美元;Kimi K3尝试5次历时17.4小时花费31美元。小红书表示将在不久的将来开源dots-note-3.0模型。

中国代表队在本届IMO中以232分斩获团体第一,其中三人取得42分满分。这也是中国模型与中国选手首次在IMO中同获满分金牌认证。

声明:

1、凡本网注明“来源:XXX(非科极网)”的作品,均转载自其它媒体,转载目的在于传递更多信息,丰富网络文化,此类稿件并不代表本网赞同其观点和对其真实性负责。

2、如因作品内容、版权和其他问题需要与本网联系的,请在该事由发生之日起30日内进行。