Claude Opus 5.5 发布
Anthropic 称 Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,运行成本比 Opus 5 低约 40%,并在其对齐审核中取得所有模型的最好成绩。同一天,OpenAI 发布了 GPT-6 Sol 和 GPT-6 Luna。

发生了什么
9 月 22 日,美国 AI 公司 Anthropic 发布了新模型 Claude Opus 5.5。它是 Claude 5.5 系列的第一个型号,官方说更小、更便宜的 Sonnet 5.5 和 Haiku 5.5 会在之后几周陆续推出(Sonnet 5.5 已于 9 月 28 日发布)。
Anthropic 用一句话概括这次发布:Opus 5.5 在大多数工作上的表现达到 Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。
同一天,OpenAI 也发布了 GPT-6 Sol 和 GPT-6 Luna 两个型号。下文提到的跟 OpenAI 的比较,是 Anthropic 公告中与 GPT-6 Astra 和更早的 GPT-5.6 Sol 的对比,不包括同日发布的这两个新型号。
它比上一代强在哪
Anthropic 用一批公开的评测来比较模型。最常被引用的是 Terminal-Bench 4.0:让 AI 在电脑的命令行里独立完成一连串专业任务,比如配置服务器、修复程序、处理数据。它衡量的不是「会不会回答问题」,而是「能不能自己把一件事做完」。
GPT 系列的分数由 OpenAI 公布,Anthropic 转引;Opus 5.5 的标准误约 ±2.6 个百分点。 来源:Anthropic《Introducing Claude Opus 5.5》,2026-09-22
在另外几项测试中,Opus 5.5 也排在第一:
| 评测 | 测的是什么 | Opus 5.5 | 对比 |
|---|---|---|---|
| OSWorld 2.1 | 像人一样操作电脑桌面和软件 | 81.8% | Fable 5.1:80.7% |
| 人类最后的考试(可用工具) | 各学科专家出的高难度问题 | 67.7% | Fable 5.1:65.6% |
| GDPval-AA v2.1 | 44 种职业的真实工作任务 | 1846 分 | Fable 5.1:1735 分 |
| CursorBench 4.0 | 真实编程场景中的模糊需求 | 57.8% | GPT-5.6 Sol:41.7% |
也有它没赢的项目:在 Zapier 的商业流程测试 AutomationBench 上,GPT-6 Astra 是 41.4%,略高于 Opus 5.5 的 40.0%;在科研类测试 Terminal-Bench-Science 上,GPT-6 Astra 是 64.6%,高于 Opus 5.5 的 58.7%。
来源:Anthropic《Introducing Claude Opus 5.5》,2026-09-22
更便宜,也更快
这次升级最实在的部分是成本。Anthropic 说 Opus 5.5 运行所需的算力比 Opus 5 少,价格也随之下调;同时它完成同一件事用的「字数」(token)更少,两者叠加,日常使用的总成本下降约 40%。
- 典型使用成本(对比 Opus 5)
- −40%
- 输出速度(对比 Opus 5)
- 快 30%+
- API 价格(每百万 token 输入/输出)
- $4 / $20
- 缓存读取价格(对比 Opus 5)
- −60%
来源:Anthropic 官方公告。Opus 5 的价格为输入 5 美元、输出 25 美元。
对订阅用户来说,Anthropic 同时提高了 Pro、Max、Team 等套餐的「每 5 小时用量上限」,还额外送了一次可以自己选择时间使用的额度重置。
实际能做什么:官方和早期测试者举的例子
跑分之外,Anthropic 在公告里列了一些具体案例。这些例子由公司或合作方提供,没有经过独立核实,但能帮助理解「它能做到什么程度」:
- 大规模改代码:一位测试者用它在不到一天内完成了 68 万行代码的迁移,官方称这原本需要一个工程团队花几周。
- 重写一款知名软件:Anthropic 内部让 Opus 5.5 和 Fable 5.1 把负载均衡软件 HAProxy 从 C 语言改写成 Rust。两者都通过了几乎全部原有测试,Opus 5.5 用了 9.5 小时(Fable 5.1 用了 12 小时),花费少 51%。
- 写有数据支撑的报告:让模型只靠网络上能找到的资料,写一份公司季度业绩报告,自动评分程序逐一核对每个数字和引语。18 次尝试中,Opus 5.5 有 16 次达标(只要编造一个数字就算不达标);Fable 5.1 和 Opus 5 一次都没有达标。
- 做商业分析:分析两家虚构公司的合并方案,在 Excel 里建财务模型,再做成管理层演示文稿。Opus 5.5 用了 63 分钟,Opus 5 用了 93 分钟,成本低一半。
Anthropic 还特别提到写作风格的改进:Opus 5 曾被用户反馈说话绕、术语多,Opus 5.5 会把最重要的信息放在前面,更容易读懂和检查。
安全方面
发布前一周,Anthropic 首席执行官 Dario Amodei 发表文章,主张 AI 的进展应该「控制节奏」(pace),让安全措施跑在能力前面。Opus 5.5 是这之后公司发布的第一个模型。(同一思路更早的一次公开表达,是 7 月 1100 多名 AI 从业者联署的公开信,见《调控前沿速度》。)
公告中与安全有关的要点:
- 发布前由外部机构 METR 和 Frontier Design 做了测试;
- 在公司最主要的对齐测试(近 2000 个模拟场景的自动行为审核)中,它在几乎所有「不当行为」指标上都好于近期的 Claude 模型,更少做出难以撤回的操作或越出给定权限;
- 在一项专门测试「是否会试图突破隔离边界」的新评估中,它尝试越界的频率比 Opus 5 和 Mythos 5.1 低约 85%,而且每次尝试都属于低严重度,并由它自己主动报告;
- 因为它在生物和网络安全方面的能力接近 Mythos 5.1,所以默认带着和 Fable 5.1 类似的安全限制。触发限制时,网络安全类任务会改由 Opus 4.8 完成,生物类任务由 Opus 5 完成。经过审核的机构可以申请放宽。
需要注意的地方
- 分数来自厂商自己。 表中的数字都出自 Anthropic 的公告;GPT 系列的分数是 Anthropic 转引 OpenAI 公布的数字,测试条件不完全相同。
- 官方也说分差不代表一切。 公告原话是:在这个能力水平上,评测分差「已经不太能可靠地反映」真实差距,在他们自己使用中,Opus 5.5 和 Fable 5.1 的差距比分数显示的更小。
- 没有和同日发布的新模型比。 OpenAI 当天发布的 GPT-6 Sol 和 Luna 不在比较范围内。
- 想看第三方的对比,可以参考本站模型页的 LMArena 排行榜,那是用户盲测投票的结果。
普通人怎么用
- 网页和手机 App:在 claude.ai 或 Claude App 里,付费用户可以在模型列表中选择 Opus 5.5。关于各套餐价格,见本站的 Claude 产品页。
- 写代码:Claude Code 里可以直接选用;还有一个「快速模式」,速度最高 2.5 倍,价格更高(输入 8 美元、输出 40 美元每百万 token)。
- 开发者:通过 Claude API 使用,价格为每百万 token 输入 4 美元、输出 20 美元。
模型摘要
- 开发方
- Anthropic
- API 价格
- 每百万 token 输入 4 美元 / 输出 20 美元;缓存读取 0.20 美元
公布的评测成绩
| Terminal-Bench 4.0 | 66.4% | GPT-6 Astra:57.9% |
| Humanity's Last Exam (with tools) | 67.7% | Fable 5.1:65.6% |
| OSWorld 2.1 | 81.8% | |
| GDPval-AA v2.1 | 1846 | 知识工作评测;GPT-6 Astra:1542 |
数据口径:Anthropic 官方公告。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。