有据可查的 AI 新闻、模型与产品English
新闻重要 模型2026年9月22日

Claude Opus 5.5 发布

Anthropic 称 Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,运行成本比 Opus 5 低约 40%,并在其对齐审核中取得所有模型的最好成绩。同一天,OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。

Anthropic 首席执行官 Dario Amodei 在台上接受访谈
Anthropic 联合创始人兼首席执行官 Dario Amodei(右),摄于 2023 年 TechCrunch Disrupt 大会。资料照片。 照片:TechCrunch / Wikimedia Commons,CC BY 2.0

发生了什么

9 月 22 日,美国 AI 公司 Anthropic 发布了新模型 Claude Opus 5.5。它是 Claude 5.5 系列的第一个型号,官方说更小、更便宜的 Sonnet 5.5 和 Haiku 5.5 会在之后几周陆续推出(Sonnet 5.5 已于 9 月 28 日发布)。

Anthropic 用一句话概括这次发布:Opus 5.5 在大多数工作上的表现达到 Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。

同一天,OpenAI 也发布了 GPT-6 Sol 和 GPT-6 Luna 两个型号。下文提到的跟 OpenAI 的比较,是 Anthropic 公告中与 GPT-6 Astra 和更早的 GPT-5.6 Sol 的对比,不包括同日发布的这两个新型号。

它比上一代强在哪

Anthropic 用一批公开的评测来比较模型。最常被引用的是 Terminal-Bench 4.0:让 AI 在电脑的命令行里独立完成一连串专业任务,比如配置服务器、修复程序、处理数据。它衡量的不是「会不会回答问题」,而是「能不能自己把一件事做完」。

Terminal-Bench 4.0:在命令行中独立完成复杂任务完成率,越高越好
  • Claude Opus 5.566.4%
  • GPT-6 Astra57.9%
  • Claude Fable 5.155.8%
  • Claude Opus 552.3%
  • GPT-5.6 Sol37.3%

GPT 系列的分数由 OpenAI 公布,Anthropic 转引;Opus 5.5 的标准误约 ±2.6 个百分点。 来源:Anthropic《Introducing Claude Opus 5.5》,2026-09-22

在另外几项测试中,Opus 5.5 也排在第一:

评测 测的是什么 Opus 5.5 对比
OSWorld 2.1 像人一样操作电脑桌面和软件 81.8% Fable 5.1:80.7%
人类最后的考试(可用工具) 各学科专家出的高难度问题 67.7% Fable 5.1:65.6%
GDPval-AA v2.1 44 种职业的真实工作任务 1846 分 Fable 5.1:1735 分
CursorBench 4.0 真实编程场景中的模糊需求 57.8% GPT-5.6 Sol:41.7%

也有它没赢的项目:在 Zapier 的商业流程测试 AutomationBench 上,GPT-6 Astra 是 41.4%,略高于 Opus 5.5 的 40.0%;在科研类测试 Terminal-Bench-Science 上,GPT-6 Astra 是 64.6%,高于 Opus 5.5 的 58.7%。

GDPval-AA v2.1:44 种职业的真实工作Elo 评分,越高越好;由第三方 Artificial Analysis 维护
  • Claude Opus 5.51846
  • Claude Fable 5.11735
  • Claude Opus 51708
  • GPT-5.6 Sol1588
  • GPT-6 Astra1542

来源:Anthropic《Introducing Claude Opus 5.5》,2026-09-22

更便宜,也更快

这次升级最实在的部分是成本。Anthropic 说 Opus 5.5 运行所需的算力比 Opus 5 少,价格也随之下调;同时它完成同一件事用的「字数」(token)更少,两者叠加,日常使用的总成本下降约 40%。

典型使用成本(对比 Opus 5)
−40%
输出速度(对比 Opus 5)
快 30%+
API 价格(每百万 token 输入/输出)
$4 / $20
缓存读取价格(对比 Opus 5)
−60%

来源:Anthropic 官方公告。Opus 5 的价格为输入 5 美元、输出 25 美元。

对订阅用户来说,Anthropic 同时提高了 Pro、Max、Team 等套餐的「每 5 小时用量上限」,还额外送了一次可以自己选择时间使用的额度重置。

实际能做什么:官方和早期测试者举的例子

跑分之外,Anthropic 在公告里列了一些具体案例。这些例子由公司或合作方提供,没有经过独立核实,但能帮助理解「它能做到什么程度」:

  • 大规模改代码:一位测试者用它在不到一天内完成了 68 万行代码的迁移,官方称这原本需要一个工程团队花几周。
  • 重写一款知名软件:Anthropic 内部让 Opus 5.5 和 Fable 5.1 把负载均衡软件 HAProxy 从 C 语言改写成 Rust。两者都通过了几乎全部原有测试,Opus 5.5 用了 9.5 小时(Fable 5.1 用了 12 小时),花费少 51%。
  • 写有数据支撑的报告:让模型只靠网络上能找到的资料,写一份公司季度业绩报告,自动评分程序逐一核对每个数字和引语。18 次尝试中,Opus 5.5 有 16 次达标(只要编造一个数字就算不达标);Fable 5.1 和 Opus 5 一次都没有达标。
  • 做商业分析:分析两家虚构公司的合并方案,在 Excel 里建财务模型,再做成管理层演示文稿。Opus 5.5 用了 63 分钟,Opus 5 用了 93 分钟,成本低一半。

Anthropic 还特别提到写作风格的改进:Opus 5 曾被用户反馈说话绕、术语多,Opus 5.5 会把最重要的信息放在前面,更容易读懂和检查。

安全方面

发布前一周,Anthropic 首席执行官 Dario Amodei 发表文章,主张 AI 的进展应该「控制节奏」(pace),让安全措施跑在能力前面。Opus 5.5 是这之后公司发布的第一个模型。(同一思路更早的一次公开表达,是 7 月 1100 多名 AI 从业者联署的公开信,见《调控前沿速度》。)

公告中与安全有关的要点:

  • 发布前由外部机构 METR 和 Frontier Design 做了测试;
  • 在公司最主要的对齐测试(近 2000 个模拟场景的自动行为审核)中,它在几乎所有「不当行为」指标上都好于近期的 Claude 模型,更少做出难以撤回的操作或越出给定权限;
  • 在一项专门测试「是否会试图突破隔离边界」的新评估中,它尝试越界的频率比 Opus 5 和 Mythos 5.1 低约 85%,而且每次尝试都属于低严重度,并由它自己主动报告;
  • 因为它在生物和网络安全方面的能力接近 Mythos 5.1,所以默认带着和 Fable 5.1 类似的安全限制。触发限制时,网络安全类任务会改由 Opus 4.8 完成,生物类任务由 Opus 5 完成。经过审核的机构可以申请放宽。

需要注意的地方

  • 分数来自厂商自己。 表中的数字都出自 Anthropic 的公告;GPT 系列的分数是 Anthropic 转引 OpenAI 公布的数字,测试条件不完全相同。
  • 官方也说分差不代表一切。 公告原话是:在这个能力水平上,评测分差「已经不太能可靠地反映」真实差距,在他们自己使用中,Opus 5.5 和 Fable 5.1 的差距比分数显示的更小。
  • 没有和同日发布的新模型比。 OpenAI 当天发布的 GPT-6 Sol 和 Luna 不在比较范围内。
  • 想看第三方的对比,可以参考本站模型页的 LMArena 排行榜,那是用户盲测投票的结果。

普通人怎么用

  • 网页和手机 App:在 claude.ai 或 Claude App 里,付费用户可以在模型列表中选择 Opus 5.5。关于各套餐价格,见本站的 Claude 产品页。
  • 写代码:Claude Code 里可以直接选用;还有一个「快速模式」,速度最高 2.5 倍,价格更高(输入 8 美元、输出 40 美元每百万 token)。
  • 开发者:通过 Claude API 使用,价格为每百万 token 输入 4 美元、输出 20 美元。

模型摘要

开发方
Anthropic
API 价格
每百万 token 输入 4 美元 / 输出 20 美元;缓存读取 0.20 美元

公布的评测成绩

Terminal-Bench 4.066.4%GPT-6 Astra:57.9%
Humanity's Last Exam (with tools)67.7%Fable 5.1:65.6%
OSWorld 2.181.8%
GDPval-AA v2.11846知识工作评测;GPT-6 Astra:1542

数据口径:Anthropic 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。

来源