Claude Mythos Preview:黑客能力强到不宜公开发布的 AI
Anthropic 发布 Claude Mythos Preview,称其发现和利用未知软件漏洞的能力是「安全领域的分水岭」。它没有公开发布,而是通过「Project Glasswing」计划,用这个模型帮助加固关键软件。Anthropic 表示,已发现的漏洞中超过 99% 尚未修补。
发生了什么
4 月 7 日,Anthropic 同时发布了两篇文章:一篇宣布 Project Glasswing(「玻璃翼」计划),另一篇由公司的「前沿红队」(专门测试模型危险能力的团队)介绍新模型 Claude Mythos Preview 的网络安全能力。
Anthropic 说,Mythos Preview 是一个通用模型,各方面都很强,但在计算机安全上「强得惊人」:在用户要求下,它能在每一个主流操作系统和每一个主流浏览器里找到并利用此前无人知晓的漏洞。公司把这称为「安全领域的分水岭」。
因此,Anthropic 做出了一个少见的决定:不向公众开放这个模型。首批合作方包括亚马逊云服务(AWS)、苹果、博通、思科、CrowdStrike、谷歌、摩根大通、Linux 基金会、微软、英伟达和 Palo Alto Networks,另有 40 多家维护关键软件的机构也获得了使用权限。
背景:模型的黑客能力为什么突然变强
据 Wikipedia 记载,「Claude Mythos」这个名字在 3 月 26 日就因博客草稿泄露而为外界所知。
Anthropic 强调,它没有专门训练这个模型去做黑客攻击。这些能力是模型在编程、推理和自主工作能力全面提升后「顺带」出现的:让它更会修补漏洞的进步,同样让它更会利用漏洞。
变化来得很快。就在一个月前,Anthropic 还写道,当时的 Claude Opus 4.6「找漏洞和修漏洞的能力远强于利用漏洞」。同一项测试的对比很能说明问题:
- Opus 4.6:把火狐浏览器漏洞变成可用攻击程序
- 2 次
- Mythos Preview:同一测试中成功写出可用攻击程序
- 181 次
- 在约 1000 个开源项目中达到「完全劫持程序」级别
- 10 个目标
- 已发现漏洞中尚未修补的比例
- 超过 99%
来源:Anthropic 前沿红队博客,2026-04-07。Opus 4.6 的 2 次成功出自「几百次尝试」;Opus 4.6 和 Sonnet 4.6 在开源项目测试中最高只各达到一次第三级(共五级)。
它具体做了什么
Anthropic 公布的例子,都是已经修补、可以公开的少数漏洞。公司说,这些漏洞几乎都是模型在收到一句「请在这个程序里找一个安全漏洞」之后,没有任何人工干预独立找到的:
- OpenBSD 里一个 27 年前的漏洞。 OpenBSD 是以安全著称的操作系统,常用来运行防火墙。这个漏洞能让攻击者只要连上一台机器,就能远程让它崩溃。Anthropic 说,在 OpenBSD 上跑了一千次搜索,总成本不到 2 万美元;找到这个漏洞的那一次本身花费不到 50 美元。
- FFmpeg 里一个 16 年前的漏洞。 FFmpeg 是几乎所有视频服务都在用的音视频处理库。出问题的那行代码,自动化测试工具曾执行过 500 万次,却从未发现问题。
- FreeBSD 的远程控制漏洞。 模型完全自主地找到并利用了一个存在 17 年的漏洞(编号 CVE-2026-4747),网上任何人都能借此完全控制运行网络文件服务的服务器。
- 串联多个漏洞。 在 Linux 上,它能把两个、三个甚至四个漏洞串起来,从普通用户权限一路提升到完全控制整台机器;在浏览器上,它写出过串联四个漏洞、同时突破两层「沙盒」隔离的攻击程序。

公司还提到一个让人不安的细节:Anthropic 内部一些没有受过正式安全训练的工程师,晚上让模型去找远程控制类漏洞,第二天早上醒来就拿到了一份完整可用的攻击程序。
在公开评测上,Anthropic 用 CyberGym(测试模型能否复现已知漏洞)来说明差距:
两个分数均由 Anthropic 测得并公布。 来源:Anthropic《Project Glasswing》公告,2026-04-07
它的编程能力也明显领先。按 Anthropic 公布的数据,在 SWE-bench Pro(修复真实开源项目中的问题)上,Mythos Preview 得分 77.8%,Opus 4.6 为 53.4%。
Project Glasswing 怎么运作
Anthropic 的思路是:类似能力迟早会扩散,与其等别人做出来,不如先让防守方用上。
- 谁能用:首批 12 家合作方(含 Anthropic 自己)和另外 40 多家机构,用来扫描自家系统和开源软件。
- 钱从哪来:Anthropic 承诺提供最多 1 亿美元的使用额度,并向开源安全组织直接捐款 400 万美元(其中 250 万美元通过 Linux 基金会捐给 Alpha-Omega 和 OpenSSF,150 万美元捐给 Apache 软件基金会)。
- 之后的价格:额度用完后,参与方按每百万 token 输入 25 美元、输出 125 美元付费。
- 怎么披露:模型找到的漏洞先由专业人员人工核实,再通知软件维护者。对暂时不能公开的漏洞,Anthropic 先公布一串加密「指纹」(SHA-3 哈希),承诺修补后再公开细节,以便日后核对它今天的说法。
人工核实的结果也被公布:在已人工复核的 198 份报告中,89% 的严重程度判断与模型完全一致,98% 相差不超过一级。
各方反应和后续
- 合作方:思科、AWS、微软、CrowdStrike、Linux 基金会、谷歌、Palo Alto Networks 等都在公告中表态支持。Palo Alto Networks 的首席产品与技术官 Lee Klarich 说,这「预示着一个危险的转变」,攻击者很快也能更快地找到漏洞、写出攻击程序。据 SecurityWeek 报道,该公司还表示,Mythos 在发现漏洞方面不到三周就完成了相当于一年的渗透测试工作量。
- 火狐浏览器:据 SecurityWeek 报道,Mozilla 用 Mythos Preview 的早期版本找到并在 Firefox 150 中修补了 271 个漏洞。但官方安全公告里只有 3 个公开编号(CVE)注明来自 Claude,SecurityWeek 认为其余大多可能是较低严重程度的问题。Firefox 首席技术官 Bobby Holley 也说,他们没有看到任何「顶尖人类研究员找不到」的漏洞。
- 未经授权的访问:据彭博社报道(GovInfoSecurity 转述),一个 Discord 群组通过 Anthropic 第三方承包商的环境用上了 Mythos。Anthropic 表示正在调查,但没有证据表明使用范围超出该第三方的 IT 环境。
- 竞争对手:据 GovInfoSecurity 报道,OpenAI 几天后推出了 GPT-5.4-Cyber,并表示要让它「尽可能广泛地可用」,依靠身份验证等手段防止滥用。
- 扩大范围:据 Wikipedia 记载,6 月 2 日 Anthropic 把 Mythos 的网络安全用途扩展到 15 个以上国家的 150 家机构。
此后的发展:9 天后发布的 Claude Opus 4.7,官方明确说它不如 Mythos Preview。6 月 9 日,Anthropic 推出了 Mythos 级别、但加上安全防护的公开版 Claude Fable 5,同时把 Glasswing 合作方升级到 Mythos 5;三天后,美国政府的出口管制令又让这两个模型被迫下线(见《美国出口管制令迫使 Anthropic 暂停最新模型》)。9 月,更新一代的 Mythos 5.1 随 Fable 5.1 一起发布。10 月 6 日,Anthropic 宣布把 Glasswing 现有成员转入扩大后的「网络安全验证计划」(CVP)中的「专门访问」(Specialized Access)级别。
需要注意的地方
- 大部分证据还无法核实。 超过 99% 的漏洞未修补,Anthropic 只能讨论约 1% 的案例。公司自己也承认,这让部分说法「难以验证」,所以才用加密指纹的方式先「押」下证据。
- 评测分数来自 Anthropic 自己。 CyberGym、SWE-bench 等分数都由公司测得。Anthropic 还提示,部分 SWE-bench 题目可能被模型「记住」过;排除这些题目后,领先幅度依然存在。
- 数字不等于严重程度。 火狐的 271 个漏洞就是例子:数量很大,但公开编号的只有少数。
- 「先给防守方」也有代价。 只有少数大机构能先用上,其他组织暂时用不上;而 Discord 群组的事件说明,「限量发布」本身也可能被绕过。
对普通人意味着什么
普通用户用不了 Mythos Preview,Anthropic 明确表示不打算公开发布它。但它影响的是每个人都在用的软件:操作系统、浏览器、视频播放、加密通信。
最实际的建议是:及时更新系统和应用。Anthropic 和合作方找到的漏洞,会以安全更新的形式陆续修补;Anthropic 也说,这段过渡期「可能会很动荡」,因为同样的能力早晚会落到攻击者手中。按公司的设想,长期来看,这类工具会更多地帮助防守方,在新代码上线前就把漏洞修掉。