有据可查的 AI 新闻、模型与产品English
新闻重大 研究2025年7月21日

AI 在国际数学奥林匹克达到金牌水平

Google DeepMind 和 OpenAI 的实验模型在国际数学奥林匹克竞赛中,均在规定时间内用自然语言写出证明,解出六道题中的五道。DeepMind 的成绩经过了 IMO 官方评分。

Google DeepMind 首席执行官 Demis Hassabis 在讲台上演讲
Google DeepMind 首席执行官 Demis Hassabis,摄于 2024 年 12 月诺贝尔奖演讲现场。资料照片。 照片:Jay Dixit / Wikimedia Commons,CC BY-SA 4.0

发生了什么

2025 年 7 月 19 日(星期六),OpenAI 研究员 Alexander Wei 在社交平台 X 上宣布,公司的一个实验性推理模型在 2025 年 IMO 考题上拿到 35 分,达到金牌水平。

两天后的 7 月 21 日,Google DeepMind 发布博客,称其 Gemini Deep Think 的一个增强版本 同样解出 5 道题、得到 35 分,而且这个成绩是经 IMO 官方阅卷人认证的。IMO 主席 Gregor Dolinar 在 DeepMind 的公告中说:「我们可以确认,Google DeepMind 达到了这个人们期待已久的里程碑,在满分 42 分中拿到 35 分——这是金牌分数。」

据路透社报道,这是 AI 系统第一次在 IMO 上越过金牌分数线。

先了解:IMO 是什么

2025 年的 IMO 于 7 月 10 日至 20 日在澳大利亚昆士兰州的阳光海岸举行。根据 IMO 官网的数据:

参赛选手
630 人
参赛国家和地区
110 个
金牌(35 分及以上)
72 人
满分 42 分
5 人

来源:IMO 官网 2025 年届次页面。银牌线 28 分(104 人),铜牌线 19 分(145 人)。

也就是说,AI 拿到的 35 分,刚好等于当年的金牌线;同届有 72 名学生达到或超过这个分数,其中 5 人全部做对。

2025 年 IMO:AI 的得分与各奖牌分数线满分 42 分
  • 学生最高分(5 人)42
  • Gemini Deep Think(官方评分)35
  • OpenAI 实验模型(非官方评分)35
  • 金牌线35
  • 银牌线28
  • 铜牌线19

OpenAI 的分数由其邀请的三位前 IMO 奖牌得主评定,不是 IMO 官方评分。 来源:IMO 官网;Google DeepMind 博客,2025-07-21;法新社、路透社报道

两家公司各做到了什么

Google DeepMind。 一年前(2024 年),DeepMind 用两个专门做数学的系统 AlphaProof 和 AlphaGeometry 2 拿到银牌水平:解出 4 题,得 28 分。但那次需要专家先把题目从自然语言翻译成 Lean 这样的「形式化语言」,再把证明翻译回来,计算花了两到三天。

2025 年,DeepMind 换成了通用模型 Gemini 的「Deep Think」模式。公司说,模型从官方题目直接出发,用自然语言写出严格证明,全程在 4.5 小时的比赛时限内完成。它使用了「并行思考」:同时探索多种解题思路,再综合出最终答案,而不是只沿着一条思路走到底。DeepMind 还说明,这个版本额外用强化学习做了训练,给它提供了一批高质量的数学题解,并在指令里加了一些解 IMO 题的一般性提示。

IMO 阅卷人对它的评价是:解答「清晰、精确,大多数容易看懂」。

OpenAI。 据路透社报道,OpenAI 用的是一个专门为此打造的实验模型,重点在于大幅增加「测试时计算」:让模型思考更长时间,同时并行运行多条推理路线。OpenAI 研究员 Noam Brown 拒绝透露花了多少算力,只说「非常昂贵」。

Alexander Wei 写道:「我们按照与人类选手相同的规则,在 2025 年 IMO 题目上评测了模型」,「每道题的证明由三位前 IMO 奖牌得主独立评分」。他还表示,OpenAI 在几个月内不打算发布具备这种数学能力的产品。

各方怎么说

关于成绩的意义。 DeepMind 访问研究员、布朗大学数学教授 Junehyuk Jung 对路透社说,这意味着 AI 可能不到一年就能帮数学家攻克前沿的未解难题。「我认为,一旦我们能用自然语言解决高难度的推理问题,AI 和数学家之间的合作就有了可能。」他本人在 2003 年拿过 IMO 金牌。

关于公布时间的争议。 据路透社报道,今年是 IMO 第一次与部分 AI 公司正式合作,IMO 认证了包括 Google 在内这些公司的成绩,并要求它们在 7 月 28 日公布结果。DeepMind 首席执行官 Demis Hassabis 在 X 上说,DeepMind「尊重 IMO 理事会最初的要求」,等成绩经独立专家核实、学生们得到应有的喝彩之后才公布。OpenAI 则在 7 月 19 日(周六)就率先宣布,公司对路透社表示,它在闭幕式之后公布,得到了一位 IMO 理事会成员的许可。IMO 主席 Dolinar 对路透社说,主办方在周一允许合作公司公布结果。

关于学生。 法新社的报道标题是「人类在顶级数学竞赛中击败了 AI 的金牌分数」:两个模型都没有拿到满分,而 5 名年轻选手做到了。

需要注意的地方

  • OpenAI 的成绩不是官方评分。 它没有参加 IMO 的官方合作评测,分数由其请来的前奖牌得主评定。DeepMind 的成绩由 IMO 阅卷人按学生的同一标准评分。
  • 官方认证只覆盖答卷。 DeepMind 在博客中注明,IMO 确认了它提交的答案是完整、正确的解答,但这项审核「不包括验证我们的系统、流程或底层模型」。
  • 算力和人工介入无法核实。 据法新社报道,IMO 主席 Dolinar 提醒,主办方无法核实 AI 模型用了多少算力,也无法确认是否有人参与。
  • 条件和学生不完全一样。 DeepMind 说明,它给模型提供了精选的数学题解资料,并加入了解题提示;学生在考场上没有这些。
  • 都是未发布的实验模型。 OpenAI 说几个月内不会发布同等能力的产品;DeepMind 说会先给数学家等受信任的测试者使用,再向 Google AI Ultra 订阅用户开放。
  • 35 分刚好压线,而且两家都没有解出全部 6 题。

对普通人意味着什么

IMO 题目没有标准答案可套,需要一步步写出让专家信服的证明。AI 能在比赛时限内用普通文字完成这件事,说明「推理模型」在严谨逻辑上的能力进步很快。DeepMind 当时表示,这类模型未来会成为数学家、科学家和工程师的工具。

这条路后来走得很快。同年 9 月,AI 又在国际大学生程序设计竞赛世界总决赛上亮相(见《AI 在世界编程总决赛中解出全部 12 题》)。到 2026 年 9 月,OpenAI 宣布其内部模型找到了一个千禧年数学难题版本的证明,但也引发了关于功劳归属的激烈争议(见《OpenAI 公布千禧年数学难题证明,引发优先权争议》)。

对日常使用者来说,可以记住一点:竞赛成绩来自专门调校、投入大量算力的实验版本,日常聊天用的模型不一定有同样表现。做数学或逻辑题时,仍然需要自己检查 AI 给出的每一步。

来源