有据可查的 AI 新闻、模型与产品English
新闻重要 模型2025年11月18日

Google 发布 Gemini 3

Gemini 3 发布后直接上线 Gemini 应用和 Google 搜索,发布时在多项推理评测中创下纪录。

Google DeepMind 首席执行官戴密斯·哈萨比斯在讲台上演讲
时任 Google DeepMind 首席执行官戴密斯·哈萨比斯在 2024 年诺贝尔奖讲座上演讲。Gemini 3 的发布文章由他和 DeepMind 首席技术官科雷·卡武克丘奥卢联合署名。资料照片。 照片:Jay Dixit / Wikimedia Commons,CC BY-SA 4.0

发生了什么

2025 年 11 月 18 日,Google 发布了新一代模型 Gemini 3。首个型号是 Gemini 3 Pro(预览版)。Google 和 Alphabet 首席执行官皮查伊在发布文章中写道:「这是我们第一次在发布当天就把 Gemini 放进搜索。」

发布当天的上线范围:

  • 所有人:Gemini 应用;
  • Google AI Pro 和 Ultra 订阅用户:Google 搜索的「AI 模式」;
  • 开发者:AI Studio 中的 Gemini API、Gemini CLI,以及新推出的编程平台 Google Antigravity;
  • 企业:Vertex AI 和 Gemini Enterprise。

据 TechCrunch 报道,这距离 Gemini 2.5 发布只有七个月,距离 OpenAI 发布 GPT-5.1 不到一周,距离 Anthropic 发布 Claude Sonnet 4.5 约两个月,「提醒人们前沿模型的开发速度有多快」。

背景:Gemini 走到第三代

Gemini 是 Google DeepMind 开发的模型系列,也是 Google 的 AI 助手应用的名字。皮查伊在文章中回顾:第一代 Gemini 的突破是「原生多模态」(同时理解文字、图片、音频、视频)和超长上下文;第二代奠定了「智能体」能力的基础,其中 Gemini 2.5 Pro 在 LMArena 排行榜上排名第一超过六个月。

发布时,Google 公布的规模数据是:Gemini 应用每月用户超过 6.5 亿,搜索中的「AI 概览」每月有 20 亿用户,1300 万开发者用过 Google 的生成式模型。

它有多强

Google 在发布时公布了与 Gemini 2.5 Pro、Anthropic 的 Claude Sonnet 4.5 和 OpenAI 的 GPT-5.1 的对比(详见其评测说明)。差距最大的是两项高难度推理测试。

人类最后的考试(不使用工具)正确率,越高越好
  • Gemini 3 Deep Think41.0%
  • Gemini 3 Pro37.5%
  • GPT-5.126.5%
  • Gemini 2.5 Pro21.6%
  • Claude Sonnet 4.513.7%

Gemini 分数由 Google 自测;Gemini 2.5 Pro 和 Claude Sonnet 4.5 的分数取自 Scale AI 排行榜,GPT-5.1 取自 Artificial Analysis。 来源:Google DeepMind《Gemini 3 Pro 评测方法与结果》,2025-11

ARC-AGI-2:从没见过的图形推理谜题正确率,越高越好;经 ARC Prize 验证
  • Gemini 3 Deep Think45.1%
  • Gemini 3 Pro31.1%
  • GPT-5.117.6%
  • Claude Sonnet 4.513.6%
  • Gemini 2.5 Pro4.9%

Deep Think 的成绩允许执行代码。 来源:Google《A new era of intelligence with Gemini 3》及评测方法文件,2025-11-18

其他几项 Google 公布的成绩:

评测 测的是什么 Gemini 3 Pro 对比
GPQA Diamond 研究生水平的科学题 91.9% GPT-5.1:88.1%
MathArena Apex 极难的数学竞赛题 23.4% Claude Sonnet 4.5:1.6%
Terminal-Bench 2.0 在命令行中独立完成任务 54.2% GPT-5.1:47.6%
SWE-bench Verified 修复真实软件项目的问题 76.2% Claude Sonnet 4.5:77.2%
Vending-Bench 2 模拟经营自动售货机生意一整年,看最后赚多少 5478 美元 Claude Sonnet 4.5:3839 美元

注意最后第二行:在业界常用的编程测试 SWE-bench Verified 上,Gemini 3 Pro 略低于 Claude Sonnet 4.5(77.2%)和 GPT-5.1(76.3%)。

TechCrunch 指出,Gemini 3 在「人类最后的考试」上的成绩是当时的最高纪录,此前的最高分是 GPT-5 Pro 的 31.64%(TechCrunch 报道的 Gemini 3 分数为 37.4%,与 Google 公布的 37.5% 略有出入)。

它能做什么

Google 在发布文章中举了一些例子(均为 Google 自己的演示):

  • 学习:把不同语言的手写菜谱识别、翻译,整理成一本可以分享的家庭食谱;把论文或很长的视频讲座变成互动式闪卡和图解;分析你打匹克球的视频,指出问题并给出训练计划。
  • 搜索中的「生成式界面」:在 AI 模式里提问时,Gemini 3 会根据问题当场生成可视化排版、互动工具和模拟演示,而不只是一段文字。
  • 写代码:Google 称它是自己「做过的最好的氛围编程(vibe coding,即用日常语言描述需求、让 AI 写出整个程序)模型」,演示中生成了复古 3D 太空飞船游戏、可玩的科幻场景和互动网页。
  • 替你办事:Google AI Ultra 订阅用户可以在 Gemini 应用里试用「Gemini Agent」,让它完成多步骤任务,例如整理 Gmail 收件箱、预订本地服务。

安全方面

Google 称 Gemini 3 是它「迄今最安全的模型」,接受了 Google 所有 AI 模型中最全面的安全评估:更少「讨好」用户(即更少附和用户的错误观点),更能抵抗「提示词注入」攻击,也更能防止被用于网络攻击。除了内部测试,Google 还让英国 AI 安全研究所等机构提前使用,并请 Apollo、Vaultis、Dreadnode 等机构做了独立评估。

更强的 Deep Think 模式则没有在当天开放:Google 说要多花时间做安全评估、听取安全测试者的意见,之后几周再向 Ultra 订阅用户开放。

需要注意的地方

  • 成绩由 Google 发布。 Gemini 的分数是 Google 自己测的;对手的分数大多来自对手自报或第三方排行榜,测试设置不完全相同(Google 的评测说明中写明了每项的来源)。
  • 不是每项都领先。 在 SWE-bench Verified 上,它略低于 Claude Sonnet 4.5 和 GPT-5.1。
  • 「预览版」:发布的是 Gemini 3 Pro 预览版,之后仍在不断更新。
  • 这已经是将近一年前的模型。 此后 Google 又推出了 Gemini 3 Flash(2025 年 12 月,成为 Gemini 应用的默认模型)和 Gemini 3.1 Pro(2026 年 2 月,ARC-AGI-2 达 77.1%);原定的 Gemini 3.5 Pro 最终取消,下一代旗舰是 2026 年 9 月发布的 Gemini 4 Argon。

对普通人意味着什么

  • 用 Gemini 应用就能用上:发布当天,所有用户都能在 Gemini 应用中使用 Gemini 3。各套餐的价格见本站 Gemini 产品页。
  • 搜索也变了:订阅 Google AI Pro 或 Ultra 的用户在搜索的 AI 模式中会得到由 Gemini 3 生成的答案和互动界面。
  • 写代码的人:可以在 AI Studio、Gemini CLI、Antigravity,以及 Cursor、GitHub、JetBrains、Replit 等第三方工具里使用。

模型摘要

开发方
Google DeepMind
获取方式
Gemini 应用、Google 搜索 AI 模式、API

公布的评测成绩

Humanity's Last Exam (no tools)37.5%Deep Think 模式:41.0%
GPQA Diamond91.9%
LMArena1501 Elo
ARC-AGI-245.1%Deep Think 模式,允许执行代码

数据口径:Google 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。

来源