AI 在国际数学奥林匹克达到金牌水平
Google DeepMind 和 OpenAI 的实验模型在国际数学奥林匹克竞赛中,均在规定时间内用自然语言写出证明,解出六道题中的五道。DeepMind 的成绩经过了 IMO 官方评分。

发生了什么
2025 年 7 月 19 日(星期六),OpenAI 研究员 Alexander Wei 在社交平台 X 上宣布,公司的一个实验性推理模型在 2025 年 IMO 考题上拿到 35 分,达到金牌水平。
两天后的 7 月 21 日,Google DeepMind 发布博客,称其 Gemini Deep Think 的一个增强版本 同样解出 5 道题、得到 35 分,而且这个成绩是经 IMO 官方阅卷人认证的。IMO 主席 Gregor Dolinar 在 DeepMind 的公告中说:「我们可以确认,Google DeepMind 达到了这个人们期待已久的里程碑,在满分 42 分中拿到 35 分——这是金牌分数。」
据路透社报道,这是 AI 系统第一次在 IMO 上越过金牌分数线。
先了解:IMO 是什么
2025 年的 IMO 于 7 月 10 日至 20 日在澳大利亚昆士兰州的阳光海岸举行。根据 IMO 官网的数据:
- 参赛选手
- 630 人
- 参赛国家和地区
- 110 个
- 金牌(35 分及以上)
- 72 人
- 满分 42 分
- 5 人
来源:IMO 官网 2025 年届次页面。银牌线 28 分(104 人),铜牌线 19 分(145 人)。
也就是说,AI 拿到的 35 分,刚好等于当年的金牌线;同届有 72 名学生达到或超过这个分数,其中 5 人全部做对。
OpenAI 的分数由其邀请的三位前 IMO 奖牌得主评定,不是 IMO 官方评分。 来源:IMO 官网;Google DeepMind 博客,2025-07-21;法新社、路透社报道
两家公司各做到了什么
Google DeepMind。 一年前(2024 年),DeepMind 用两个专门做数学的系统 AlphaProof 和 AlphaGeometry 2 拿到银牌水平:解出 4 题,得 28 分。但那次需要专家先把题目从自然语言翻译成 Lean 这样的「形式化语言」,再把证明翻译回来,计算花了两到三天。
2025 年,DeepMind 换成了通用模型 Gemini 的「Deep Think」模式。公司说,模型从官方题目直接出发,用自然语言写出严格证明,全程在 4.5 小时的比赛时限内完成。它使用了「并行思考」:同时探索多种解题思路,再综合出最终答案,而不是只沿着一条思路走到底。DeepMind 还说明,这个版本额外用强化学习做了训练,给它提供了一批高质量的数学题解,并在指令里加了一些解 IMO 题的一般性提示。
IMO 阅卷人对它的评价是:解答「清晰、精确,大多数容易看懂」。
OpenAI。 据路透社报道,OpenAI 用的是一个专门为此打造的实验模型,重点在于大幅增加「测试时计算」:让模型思考更长时间,同时并行运行多条推理路线。OpenAI 研究员 Noam Brown 拒绝透露花了多少算力,只说「非常昂贵」。
Alexander Wei 写道:「我们按照与人类选手相同的规则,在 2025 年 IMO 题目上评测了模型」,「每道题的证明由三位前 IMO 奖牌得主独立评分」。他还表示,OpenAI 在几个月内不打算发布具备这种数学能力的产品。
各方怎么说
关于成绩的意义。 DeepMind 访问研究员、布朗大学数学教授 Junehyuk Jung 对路透社说,这意味着 AI 可能不到一年就能帮数学家攻克前沿的未解难题。「我认为,一旦我们能用自然语言解决高难度的推理问题,AI 和数学家之间的合作就有了可能。」他本人在 2003 年拿过 IMO 金牌。
关于公布时间的争议。 据路透社报道,今年是 IMO 第一次与部分 AI 公司正式合作,IMO 认证了包括 Google 在内这些公司的成绩,并要求它们在 7 月 28 日公布结果。DeepMind 首席执行官 Demis Hassabis 在 X 上说,DeepMind「尊重 IMO 理事会最初的要求」,等成绩经独立专家核实、学生们得到应有的喝彩之后才公布。OpenAI 则在 7 月 19 日(周六)就率先宣布,公司对路透社表示,它在闭幕式之后公布,得到了一位 IMO 理事会成员的许可。IMO 主席 Dolinar 对路透社说,主办方在周一允许合作公司公布结果。
关于学生。 法新社的报道标题是「人类在顶级数学竞赛中击败了 AI 的金牌分数」:两个模型都没有拿到满分,而 5 名年轻选手做到了。
需要注意的地方
- OpenAI 的成绩不是官方评分。 它没有参加 IMO 的官方合作评测,分数由其请来的前奖牌得主评定。DeepMind 的成绩由 IMO 阅卷人按学生的同一标准评分。
- 官方认证只覆盖答卷。 DeepMind 在博客中注明,IMO 确认了它提交的答案是完整、正确的解答,但这项审核「不包括验证我们的系统、流程或底层模型」。
- 算力和人工介入无法核实。 据法新社报道,IMO 主席 Dolinar 提醒,主办方无法核实 AI 模型用了多少算力,也无法确认是否有人参与。
- 条件和学生不完全一样。 DeepMind 说明,它给模型提供了精选的数学题解资料,并加入了解题提示;学生在考场上没有这些。
- 都是未发布的实验模型。 OpenAI 说几个月内不会发布同等能力的产品;DeepMind 说会先给数学家等受信任的测试者使用,再向 Google AI Ultra 订阅用户开放。
- 35 分刚好压线,而且两家都没有解出全部 6 题。
对普通人意味着什么
IMO 题目没有标准答案可套,需要一步步写出让专家信服的证明。AI 能在比赛时限内用普通文字完成这件事,说明「推理模型」在严谨逻辑上的能力进步很快。DeepMind 当时表示,这类模型未来会成为数学家、科学家和工程师的工具。
这条路后来走得很快。同年 9 月,AI 又在国际大学生程序设计竞赛世界总决赛上亮相(见《AI 在世界编程总决赛中解出全部 12 题》)。到 2026 年 9 月,OpenAI 宣布其内部模型找到了一个千禧年数学难题版本的证明,但也引发了关于功劳归属的激烈争议(见《OpenAI 公布千禧年数学难题证明,引发优先权争议》)。
对日常使用者来说,可以记住一点:竞赛成绩来自专门调校、投入大量算力的实验版本,日常聊天用的模型不一定有同样表现。做数学或逻辑题时,仍然需要自己检查 AI 给出的每一步。