Google 发布 Gemini 3
Gemini 3 发布后直接上线 Gemini 应用和 Google 搜索,发布时在多项推理评测中创下纪录。

发生了什么
2025 年 11 月 18 日,Google 发布了新一代模型 Gemini 3。首个型号是 Gemini 3 Pro(预览版)。Google 和 Alphabet 首席执行官皮查伊在发布文章中写道:「这是我们第一次在发布当天就把 Gemini 放进搜索。」
发布当天的上线范围:
- 所有人:Gemini 应用;
- Google AI Pro 和 Ultra 订阅用户:Google 搜索的「AI 模式」;
- 开发者:AI Studio 中的 Gemini API、Gemini CLI,以及新推出的编程平台 Google Antigravity;
- 企业:Vertex AI 和 Gemini Enterprise。
据 TechCrunch 报道,这距离 Gemini 2.5 发布只有七个月,距离 OpenAI 发布 GPT-5.1 不到一周,距离 Anthropic 发布 Claude Sonnet 4.5 约两个月,「提醒人们前沿模型的开发速度有多快」。
背景:Gemini 走到第三代
Gemini 是 Google DeepMind 开发的模型系列,也是 Google 的 AI 助手应用的名字。皮查伊在文章中回顾:第一代 Gemini 的突破是「原生多模态」(同时理解文字、图片、音频、视频)和超长上下文;第二代奠定了「智能体」能力的基础,其中 Gemini 2.5 Pro 在 LMArena 排行榜上排名第一超过六个月。
发布时,Google 公布的规模数据是:Gemini 应用每月用户超过 6.5 亿,搜索中的「AI 概览」每月有 20 亿用户,1300 万开发者用过 Google 的生成式模型。
它有多强
Google 在发布时公布了与 Gemini 2.5 Pro、Anthropic 的 Claude Sonnet 4.5 和 OpenAI 的 GPT-5.1 的对比(详见其评测说明)。差距最大的是两项高难度推理测试。
Gemini 分数由 Google 自测;Gemini 2.5 Pro 和 Claude Sonnet 4.5 的分数取自 Scale AI 排行榜,GPT-5.1 取自 Artificial Analysis。 来源:Google DeepMind《Gemini 3 Pro 评测方法与结果》,2025-11
Deep Think 的成绩允许执行代码。 来源:Google《A new era of intelligence with Gemini 3》及评测方法文件,2025-11-18
其他几项 Google 公布的成绩:
| 评测 | 测的是什么 | Gemini 3 Pro | 对比 |
|---|---|---|---|
| GPQA Diamond | 研究生水平的科学题 | 91.9% | GPT-5.1:88.1% |
| MathArena Apex | 极难的数学竞赛题 | 23.4% | Claude Sonnet 4.5:1.6% |
| Terminal-Bench 2.0 | 在命令行中独立完成任务 | 54.2% | GPT-5.1:47.6% |
| SWE-bench Verified | 修复真实软件项目的问题 | 76.2% | Claude Sonnet 4.5:77.2% |
| Vending-Bench 2 | 模拟经营自动售货机生意一整年,看最后赚多少 | 5478 美元 | Claude Sonnet 4.5:3839 美元 |
注意最后第二行:在业界常用的编程测试 SWE-bench Verified 上,Gemini 3 Pro 略低于 Claude Sonnet 4.5(77.2%)和 GPT-5.1(76.3%)。
TechCrunch 指出,Gemini 3 在「人类最后的考试」上的成绩是当时的最高纪录,此前的最高分是 GPT-5 Pro 的 31.64%(TechCrunch 报道的 Gemini 3 分数为 37.4%,与 Google 公布的 37.5% 略有出入)。
它能做什么
Google 在发布文章中举了一些例子(均为 Google 自己的演示):
- 学习:把不同语言的手写菜谱识别、翻译,整理成一本可以分享的家庭食谱;把论文或很长的视频讲座变成互动式闪卡和图解;分析你打匹克球的视频,指出问题并给出训练计划。
- 搜索中的「生成式界面」:在 AI 模式里提问时,Gemini 3 会根据问题当场生成可视化排版、互动工具和模拟演示,而不只是一段文字。
- 写代码:Google 称它是自己「做过的最好的氛围编程(vibe coding,即用日常语言描述需求、让 AI 写出整个程序)模型」,演示中生成了复古 3D 太空飞船游戏、可玩的科幻场景和互动网页。
- 替你办事:Google AI Ultra 订阅用户可以在 Gemini 应用里试用「Gemini Agent」,让它完成多步骤任务,例如整理 Gmail 收件箱、预订本地服务。
安全方面
Google 称 Gemini 3 是它「迄今最安全的模型」,接受了 Google 所有 AI 模型中最全面的安全评估:更少「讨好」用户(即更少附和用户的错误观点),更能抵抗「提示词注入」攻击,也更能防止被用于网络攻击。除了内部测试,Google 还让英国 AI 安全研究所等机构提前使用,并请 Apollo、Vaultis、Dreadnode 等机构做了独立评估。
更强的 Deep Think 模式则没有在当天开放:Google 说要多花时间做安全评估、听取安全测试者的意见,之后几周再向 Ultra 订阅用户开放。
需要注意的地方
- 成绩由 Google 发布。 Gemini 的分数是 Google 自己测的;对手的分数大多来自对手自报或第三方排行榜,测试设置不完全相同(Google 的评测说明中写明了每项的来源)。
- 不是每项都领先。 在 SWE-bench Verified 上,它略低于 Claude Sonnet 4.5 和 GPT-5.1。
- 「预览版」:发布的是 Gemini 3 Pro 预览版,之后仍在不断更新。
- 这已经是将近一年前的模型。 此后 Google 又推出了 Gemini 3 Flash(2025 年 12 月,成为 Gemini 应用的默认模型)和 Gemini 3.1 Pro(2026 年 2 月,ARC-AGI-2 达 77.1%);原定的 Gemini 3.5 Pro 最终取消,下一代旗舰是 2026 年 9 月发布的 Gemini 4 Argon。
对普通人意味着什么
- 用 Gemini 应用就能用上:发布当天,所有用户都能在 Gemini 应用中使用 Gemini 3。各套餐的价格见本站 Gemini 产品页。
- 搜索也变了:订阅 Google AI Pro 或 Ultra 的用户在搜索的 AI 模式中会得到由 Gemini 3 生成的答案和互动界面。
- 写代码的人:可以在 AI Studio、Gemini CLI、Antigravity,以及 Cursor、GitHub、JetBrains、Replit 等第三方工具里使用。
模型摘要
- 开发方
- Google DeepMind
- 获取方式
- Gemini 应用、Google 搜索 AI 模式、API
公布的评测成绩
| Humanity's Last Exam (no tools) | 37.5% | Deep Think 模式:41.0% |
| GPQA Diamond | 91.9% | |
| LMArena | 1501 Elo | |
| ARC-AGI-2 | 45.1% | Deep Think 模式,允许执行代码 |
数据口径:Google 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。