返回首页
2025.07.22 01:47 约 3 分钟 全球动态 1.3万 阅读

搭载深度思考功能的 Gemini 进阶版在国际数学奥林匹克竞赛中正式达到金牌标准

国际数学奥林匹克竞赛(IMO)是全球最具声望的青年数学家赛事,自 1959 年起每年举办。每个参赛国派出六名大学预科阶段的精英数学家,角逐解决代数、组合数学、几何和数论领域的六道超高难度题目。排名前 50%的选手将获得奖牌,其中约 8%的参赛者能摘得象征最高荣誉的金牌。

近年来,IMO 也成为了人工智能系统向往的挑战场,用以检验其高阶数学解题与推理能力。去年,谷歌 DeepMind 将 AlphaProof 与 AlphaGeometry 2 系统达到银牌标准 ,成功破解六题中的四道并获得 28 分。这项突破通过专业形式语言的运用,证明人工智能已开始接近人类顶尖数学推理水平。

今年,我们成为首批由国际数学奥林匹克(IMO)协调员按照与学生解答相同的标准正式评分认证的模型团队之一。在认可本届学生参赛者卓越成就的同时,我们激动地宣布 Gemini 模型取得的突破性表现。

Gemini Deep Think 在 2025 年国际数学奥林匹克竞赛中取得突破性成绩

进阶版 GeminiDeep Think 完美解答了六道 IMO 试题中的五道,总分 35 分,达到金牌水平。完整解题过程可在线查阅此处 

“我们可以确认谷歌 DeepMind 已达成备受期待的里程碑——以 42 分满分获得 35 分,达到金牌标准。他们的解题方案在多方面令人惊叹,IMO 评审专家认为这些解答清晰准确,大部分都易于理解。”

国际数学奥林匹克主席格雷戈尔·多利纳教授

这一成就较去年突破性成果取得重大进展。在 2024 年国际数学奥林匹克竞赛中,AlphaGeometry 和 AlphaProof 需要专家先将自然语言问题转化为 Lean 等特定领域语言,证明过程也需反向转换,且需两到三天的计算时间。而今年,我们升级版的 Gemini 模型实现了自然语言的端到端运行,直接从官方题目描述生成严谨数学证明——全程不超过 4.5 小时竞赛时限。

搭载深度思考功能的 Gemini 进阶版在国际数学奥林匹克竞赛中正式达到金牌标准

深度思考模式的极致运用

我们通过升级版 Gemini 深度思考模式实现今年突破——这是针对复杂问题开发的增强推理模式,整合了包括平行思维在内的多项最新研究成果。该架构使模型能在给出最终答案前,同步探索并组合多种可能解法,而非遵循单一线性思维链。

为了充分发挥 Deep Think 的推理能力,我们采用新型强化学习技术对这一版 Gemini 进行了额外训练,使其能够更好地利用多步骤推理、问题解决和定理证明数据。我们还为 Gemini 提供了精选的高质量数学问题解法语料库,并在其指令中增加了应对国际数学奥林匹克竞赛(IMO)题目的通用提示与技巧。

在向 Google AI Ultra 订阅用户全面推出之前,我们将先向包括数学家在内的一组可信测试者开放这个 Deep Think 模型的试用版本。

人工智能与数学的未来

Google DeepMind 与数学界保持着持续合作,但我们仍处于起步阶段 ,尚未充分释放 AI 对数学研究的潜力。通过训练系统进行更灵活、更直观的推理,我们正逐步构建能够解决更复杂高等数学问题的人工智能。

尽管今年我们完全基于 Gemini 的自然语言处理技术展开研究,但我们在形式化系统 AlphaGeometry 和 AlphaProof 方面也持续取得进展。我们相信,将自然语言流畅性与严谨推理能力(包括形式化语言中的可验证推理)相结合的智能体,将成为数学家、科学家、工程师和研究人员的无价工具,帮助我们在通往通用人工智能的道路上推进人类知识边界。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读