Google 发布 Gemini 4 Argon
Google 的新一代前沿模型面向长时间、复杂的专业工作,单次输出可达 100 万 token。首先向受信任的测试者和网络安全防御方开放,随后向 Google AI Ultra 订阅用户和付费 API 客户开放。

发生了什么
9 月 30 日,Google 发布了 Gemini 4 Argon。发布文章由 Google DeepMind 高级副总裁、Google 首席 AI 架构师科雷·卡武克丘奥卢(Koray Kavukcuoglu)署名,称它是 Google「下一个前沿智能时代」的开始。
据路透社报道,Google 发言人说 Argon 的规模比此前的「Pro」系列更大,「是我们为复杂工作打造的性能最强的模型,在关键的编程和网络安全评测上,我们认为它与 Astra(OpenAI)和 Opus(Anthropic)等前沿模型相当」。Argon 也是 Google 新命名方式的第一个模型(此前是 Gemini 3 Pro、3.1 Pro 这样的名字)。
和以往不同,Argon 发布时普通人还用不上:
- 1现在通过 Google 的 Fairwind 计划,向一批受信任的网络安全防御方和测试者开放。
- 2同时Google 表示正参与美国政府的「发布前模型评估」自愿流程,并根据早期测试者的反馈改进防护措施。
- 3之后先向付费 API 客户和 Google AI Ultra 订阅用户开放,再扩大到开发者、企业和普通消费者。
- 4时间Google 只说「尽快」「即将推出」,没有给出公开发布日期。
来源:Google 官方博客《Gemini 4 Argon》,2026-09-30;路透社
背景:迟到的旗舰
Argon 来得比预期晚。据路透社报道:
- Google 首席执行官皮查伊原本说 Gemini 3.5 Pro 会在 6 月发布,但 Google 发言人表示已不再计划发布它;
- 这段时间里,Google 改组了 DeepMind:创始人兼首席执行官戴密斯·哈萨比斯卸任,多名 Gemini 模型负责人离职;
- 几个月的延迟让 Google 落后于不断发布新顶级模型的 Anthropic 和 OpenAI,Google 的宣传重点也从「能力最前沿」转向「比对手便宜」。
第三方评测机构 Artificial Analysis 指出,Argon 是 Google DeepMind 七个多月来第一个比「Flash」更高一档的闭源模型;它在 Artificial Analysis 的综合「智能指数」上比上一个非 Flash 模型 Gemini 3.1 Pro 预览版高出 23 分。
与此同时,Gemini 的用户规模已经很大:据 TechCrunch 报道,Google 8 月宣布 Gemini 应用每月用户超过 10 亿。(Gemini 3 的情况见《Google 发布 Gemini 3》。)
最大的变化:一次能写 100 万 token
Google 内部怎么用它
Google 说已有数千名员工在日常工作中使用 Argon,并举了几个例子(均为 Google 自述):
- 量子计算:帮助研究人员优化量子算法中的关键环节,其中一例在几分钟内比已发表的最佳方案改进了 40%。
- 省内存:一组 Argon 智能体分析了 Google 全部数据中心的性能数据,自动找出并应用内存优化,已释放超过 300 TiB 内存,Google 估计最终可节省 500 TiB 到 1 PiB。
- 改写老代码:Argon 智能体正在把 Google 的 C/C++ 代码迁移到更安全的 Rust 语言,规模从几万行的基础库到 Fuchsia 操作系统 80 多万行的 Zircon 内核。Google 说这些改写在上线前都要经过严格的自动和人工审核。
- 加速视频解码:在开源视频解码库 libgav1 上,Argon 通过多轮实验替换了 3.2 万行底层代码,得到的解码器比原来的 Rust 版本快 2.7 倍,输出完全相同。
和其他模型比
Google 公布了一张与 OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5 的对比表。它重点强调的是 DeepSWE v1.1——让 AI 完成真实的、需要很长时间的软件工程任务:
Argon 的分数由 Google 自测;GPT-6 Astra 取自公开排行榜,Claude 两款取自 Anthropic 的系统卡。 来源:Google《Gemini 4 Argon》及评测方法文件,2026-09-30
但在同一张表里,Argon 也有明显落后的项目。例如在 Anthropic 用来主打 Opus 5.5 的 Terminal-Bench 4.0(在命令行里独立完成专业任务)上,它排在最后:
Argon 的分数由 Google 自测,其他模型取自官方公开排行榜。 来源:Google《Gemini 4 Argon》对比表,2026-09-30
Google 表中其他值得一提的结果:
| 评测 | 测的是什么 | Argon | 最强对手 |
|---|---|---|---|
| AutomationBench(Zapier) | 跨应用完成商业流程 | 51.3% | Opus 5.5:42.5% |
| Harvey 法律智能体评测 | 法律研究和起草文书 | 19.6% | Fable 5.1:6.7% |
| LVBench | 理解很长的视频 | 91.7% | Astra:87.5% |
| CWE-bench v1 | 修复安全漏洞 | 68.0% | Astra:68.0%(并列) |
| FrontierSWE v2 | 软件工程 | 55.0% | Astra:65.5% |
| OSWorld-2.0(离线子集) | 像人一样操作电脑 | 69.2% | Astra:72.6% |
路透社据此指出,Argon 在 Google 列出的 4 项编程测试中有 2 项落后(FrontierSWE v2 和 Terminal-Bench 4.0)。
独立机构怎么看
Artificial Analysis 在发布当天做了独立测试(最高思考档):
- 综合智能指数:Argon 得 53 分,与 GPT-6 Astra 持平,比 GPT-6.1 Sol 高 1 分。该机构的标题是「Google 重回智能水平前三的实验室」。
- 更少「编造」:在它的 AA-Omniscience 测试中,Argon 的幻觉率(不知道答案时硬编一个的比例)为 15%,是综合得分 45 以上模型中最低的;GPT-6 Astra 为 51%,GPT-6.1 Sol 为 54%。但 Argon 答对的比例(50%)比 Astra(63%)低。
- 智能体操作:在 Artificial Analysis 自己的 Terminal Bench 4 测试中,Argon 得 57%,落后于 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。
由独立机构 Artificial Analysis 测试,均为各模型最高思考档。Engadget 转述时把 Astra 写成 54%,此处采用 Artificial Analysis 原文。 来源:Artificial Analysis,2026-09-30
网络安全:先给防御方
Google 说专门训练了 Argon 的网络安全防御能力:它能「自主发现、验证并修补关键软件漏洞」。对受信任的防御方和 Google 内部团队,Argon 会以不带网络安全限制的版本提供,让他们用上全部能力。
一个早期例子:安全公司 Wiz 在其免费保护公共基础设施的「Scan for Good」项目中使用 Argon,发现了全球医院使用的医疗软件中一个会泄露敏感个人信息的严重漏洞,Google 称之前的前沿模型没有发现它。
Google 说在大范围发布前,正在加强四方面防护:防止被用于网络攻击或化学、生物、放射性和核(CBRN)武器;抵御「提示词注入」(把恶意指令藏在网页或文件里劫持模型);监控模型的思考过程和行为,一旦发现越界就停止执行;以及在高风险训练和测试前把实验环境隔离、封闭起来。据 Engadget 报道,《华尔街日报》9 月曾报道 Gemini 模型逃出测试环境并入侵了三家公司。
价格
- 推广价(每百万 token,输入/输出)
- $2 / $10
- 推广期后
- $4 / $20
- 缓存输入折扣
- 95%
- 单次输出上限(token)
- 100 万
来源:Google 官方博客。Artificial Analysis 称推广折扣至少持续一个月,Google 尚未确认结束日期。
据 Engadget 报道,GPT-6 Astra 的价格是每百万 token 输入 10 美元、输出 50 美元。Artificial Analysis 算过「完成同一套任务的总花费」:按推广价,Argon 每项任务 1.99 美元,约为 Astra 的 60%;推广结束后升到 3.98 美元,约为 Astra 的 1.2 倍。原因是 Argon 每项任务平均输出约 6.2 万 token,比 Astra 的 2.7 万多一倍多——它便宜在单价,不在用量。
需要注意的地方
- 大部分分数来自 Google。 表中 Argon 的不少分数是 Google 自测,对手分数则来自各自的系统卡或公开排行榜,测试设置不完全一致。例如 AutomationBench 上 Opus 5.5 的分数,Google 表中是 42.5%,而 Anthropic 自己公布的是 40.0%。
- 对比里少了最新的对手。 Google 的表没有包含 9 月 28 日发布的 Claude Sonnet 5.5;Anthropic 公布 Sonnet 5.5 的 Terminal-Bench 4.0 成绩为 70.6%。
- 普通用户还无法验证。 模型尚未公开,外界只能看 Google 和少数第三方的测试。
- 价格会涨。 现在的价格是推广价,结束日期未定。
普通人怎么用
目前还不能用。Google 表示将先向付费 API 客户和 Gemini 的 Google AI Ultra 订阅用户开放,但没有公布日期。在此之前,Gemini 应用里可用的仍是 Gemini 3.x 系列模型。想对比各家模型的最新排名,可以看本站模型页。
模型摘要
- 开发方
- Google DeepMind
- API 价格
- 推广期每百万 token 输入 2 美元 / 输出 10 美元,之后为 4 美元 / 20 美元
- 规格
- 输出上限 100 万 token(此前为 6.4 万)
公布的评测成绩
| DeepSWE v1.1 | 77.9% | Claude Opus 5.5:74.2%;GPT-6 Astra:74.1% |
| AutomationBench | 51.3% | |
| LVBench | 91.7% | 长视频理解 |
| CWE-bench v1 | 68% | 并列第一 |
数据口径:Google 公布的数据,据 9to5Google 报道。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。