模型、产品和公司
ChatGPT 和 GPT-6 是什么关系?Haiku、Sonnet、Opus 谁大谁小?开源模型有什么用?排行榜怎么看?一章理清 AI 世界的「名字」。
模型和产品不是一回事
模型是训练出来的那个「大脑」,本质上是一个巨大的数字文件,比如 Claude Opus 5.5、GPT-6 Astra。产品是你实际打开使用的东西,比如 Claude App、ChatGPT 网站。产品在模型外面加了很多东西:
- 聊天界面、手机 App、语音;
- 工具:联网搜索、读文件、运行代码、生成图片、操作电脑;
- 记忆、项目、连接你的邮箱和网盘;
- 套餐、用量上限、隐私规则、地区限制。
所以「Claude」既是公司的产品名,也是模型系列名;你在 Claude App 里选择「Opus 5.5」,才是在选模型。ChatGPT 也一样:按 OpenAI 2026 年 10 月的版本说明,ChatGPT 付费版(Plus、Pro、Business、Enterprise)的日常对话用的是 GPT-6 Sol,免费版和 Go 版用的是 GPT-6 Luna,而 Pro 用户的「深度推理」选项用的是最强的 GPT-6 Astra(见《ChatGPT 推出交互式回答,GPT-6 开始向更多用户开放》)。同样叫 ChatGPT,背后的模型可能完全不同。
为什么一家公司有好几档模型
就像咖啡分小杯、中杯、大杯,AI 公司也把模型按「能力和价格」分档。小模型反应快、便宜,适合大量简单任务;大模型更强,但更慢、更贵。名字里的数字通常代表代际(5.5、6),名字代表档位。
截至 2026 年 10 月,三家美国公司的主要档位如下(价格为开发者 API 价格,每百万 token 输入 / 输出,美元;订阅用户不按这个付费):
| 公司 | 小而快 | 日常主力 | 旗舰及以上 |
|---|---|---|---|
| Anthropic | Haiku 5.5(0.10 / 0.50 起) | Sonnet 5.5(2 / 10) | Opus 5.5(4 / 20);更高一档 Fable 5.1(10 / 50) |
| OpenAI | GPT-6 Luna(0.10 / 0.50) | GPT-6.1 Sol(2 / 10) | GPT-6 Astra(10 / 50) |
| Gemini 3.5 Flash-Lite(0.30 / 2.50) | Gemini 3.8 Flash(0.75 / 3.75,2027 年起翻倍) | Gemini 4 Argon(推广价 2 / 10,之后 4 / 20;尚未公开) |
几点说明:
- Anthropic:从小到大是 Haiku、Sonnet、Opus。2026 年起又多了更高一档:Fable 和 Mythos 是同一个模型,Fable 面向公众、带额外安全限制,Mythos 限制更少,只给经过审核的网络安全和生命科学机构使用。Anthropic 官方建议大多数任务先用 Opus 5.5。
- OpenAI:命名从小到大是 Luna(月亮)、Terra(地球)、Sol(太阳)、Astra(星辰)。截至 10 月,OpenAI 官方模型页上 GPT-6 这一代列出的是 Luna、6.1 Sol 和 Astra 三档,没有列出 Terra。
- Google:一直用 Flash-Lite、Flash(快)和 Pro(强)分档,还有可以在手机上运行的 Nano。2026 年 9 月发布的 Gemini 4 Argon 是新命名方式的第一个模型,取代「Pro」这类名字。截至 10 月初它只向少数测试者开放,Gemini App 仍在用 3.x 系列模型。
- 中国公司也类似:DeepSeek V4 分 Pro 和 Flash;阿里的 Qwen 有开放的小模型,也有不公开的 Max、Plus 版本。
Haiku 5.5 的提示超过 10 万 token 时价格更高;Gemini 3.8 Flash 为 2026 年底前的价格。价格常变,以官网为准。 来源:Anthropic、OpenAI、Google 官方价格与模型页面,2026-10-08 查阅
档位高不等于一定更好。 新一代的中档常常追上上一代的顶档:Anthropic 说 Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,价格却低得多;独立机构 Artificial Analysis 的命令行任务测试中,Sonnet 5.5(64%)甚至高于 Opus 5.5(60%)。除了换档,很多模型还能调「思考力度」,这是另一个兼顾速度和质量的旋钮(见上一章)。
主要的公司和产品
| 公司 | 聊天产品 | 模型系列 | 所在国家 |
|---|---|---|---|
| OpenAI | ChatGPT | GPT(GPT-6 Astra / Sol / Luna) | 美国 |
| Anthropic | Claude | Claude(Haiku / Sonnet / Opus / Fable) | 美国 |
| Gemini | Gemini(Flash 系列、Argon) | 美国 | |
| Meta | Meta AI | Muse(此前为 Llama) | 美国 |
| SpaceXAI(原 xAI) | Grok | Grok | 美国 |
| 深度求索 | DeepSeek | DeepSeek V4 / V4.1 | 中国 |
| 阿里巴巴 | 通义千问 | Qwen | 中国 |
| 月之暗面 | Kimi | Kimi K3 | 中国 |
| 字节跳动 | 豆包 | 豆包大模型 | 中国 |
| Mistral AI | Mistral Vibe(原 Le Chat) | Mistral | 法国 |
规模上差别很大:ChatGPT 在 2026 年 2 月达到 9 亿周活跃用户;豆包是中国最受欢迎的聊天助手,到 2026 年 5 月有 3.3 亿用户。还有一类产品不自己训练基础模型,而是在别人的模型上做应用,比如本站产品页里的很多写作、编程和办公工具。
开放权重和封闭模型
封闭模型只能通过公司自己的 App 或 API 使用,比如 GPT-6、Claude、Gemini。你看不到模型本身,所有请求都发到这家公司的服务器。
开放权重模型则把训练好的模型文件公开发布,任何人都能下载、在自己的电脑或服务器上运行、修改。2025 年 1 月 DeepSeek-R1 以宽松的 MIT 许可证开放后,开放模型引起了全球关注。截至 2026 年 10 月,几个主要的开放模型:
- DeepSeek V4 / V4.1:MIT 许可证,可商用、可修改。
- Kimi K3(月之暗面,2026 年 7 月):2.8 万亿参数,是最大的开放权重模型;但许可证要求年收入超过 2000 万美元的公司把它作为服务提供给客户前,先与月之暗面签合同。
- Qwen3.8(阿里巴巴):2.4 万亿参数;大模型对年收入超过 5000 万美元的服务商要求分成,蒸馏出的 270 亿参数小版本用更宽松的 Apache 许可证。
- Llama(Meta):曾是最有名的开放模型,但它的许可证限制了超大公司的使用,被一些研究者批评不算真正「开源」。2026 年 4 月起,Meta 的聊天产品改用新的 Muse 系列,LMArena 把它标为不公开的专有模型。
这对你有什么影响
| 你关心的 | 封闭模型 | 开放权重模型 |
|---|---|---|
| 能力 | 目前最强的模型都是封闭的 | 紧随其后,差距不大 |
| 价格 | 按官方价格付费 | 可自己部署,或找更便宜的服务商 |
| 隐私 | 数据发到这家公司 | 自己运行时,数据不出你的服务器 |
| 门槛 | 注册即用 | 大模型需要昂贵的硬件和技术能力 |
| 安全限制 | 由公司统一控制 | 下载后可被他人修改甚至移除 |
要注意的是:用一家公司的官方 App,和下载它的开放模型自己运行,是两回事。 比如 DeepSeek 官方 App 遵守中国的内容审查规定,美国国防部、澳大利亚政府等已禁止在公务设备上使用 DeepSeek 产品;但下载模型自己运行,数据不会发送到 DeepSeek 的服务器。
开放模型和最强封闭模型的差距有多大?在 LMArena 的文字综合榜上(数据截至 2026 年 10 月 2 日),最高的封闭模型 Gemini 4 Argon 得 1525 分(投票还少,属于初步结果),最高的开放模型 Kimi K3 得 1488 分。据 Fortune 报道,DeepSeek 在 V4 技术报告中估计,它比最前沿的模型落后约三到六个月。
怎么看跑分和排行榜
几乎每次发布新模型,公司都会贴出一张「我们第一」的成绩表。读这些数字时,先分清两类:
厂商自己公布的成绩。 由发布模型的公司测试,往往挑选自己擅长的项目,测试条件也不一定相同。几个本站报道过的例子:
- 同一个测试,不同公司报的分数不一样:Anthropic 公布 Opus 5.5 在 AutomationBench 上是 40.0%,Google 的对比表里写的却是 42.5%。
- 工具和条件影响巨大:OpenAI 公布 GPT-6 Astra 在 ARC-AGI-3 上用增强版辅助工具得 99.9%,用标准条件只有 66%。
- 算法不同,结果也不同:2025 年 xAI 公布 Grok 3 的对比图时,一名 OpenAI 员工指出,图中 Grok 3 的成绩用的是「跑 64 次取最常见答案」,对手却只算了单次成绩。
- 厂商自己也承认局限:Anthropic 在 Opus 5.5 公告中说,在这个能力水平上,评测分差已经不太能可靠地反映真实差距。
独立机构的测试。 由与模型无关的第三方用统一方法测,可比性更好。例如 Artificial Analysis 的综合「智能指数」中,Gemini 4 Argon 和 GPT-6 Astra 同为 53 分,GPT-6.1 Sol 是 52 分。
读任何一个分数,都可以问自己四个问题:谁测的?测的是什么任务?和谁比、在什么条件下比?这个任务和我要做的事像不像?
怎么选
没有「最好的 AI」,只有更适合某件事的。几个实用原则:
- 先用你已经有的。 日常提问、写作、翻译,主流产品的免费版通常都够用。遇到某类任务明显做不好,再考虑换。
- 用自己的真实任务测试。 挑三到五件你常做的事(一封难写的邮件、一份要读的报告、一个表格),同样的要求发给两三个产品,比较哪个返工最少。这比任何排行榜都可靠。
- 先用中档,不够再升级。 日常任务用默认模型或中档模型;复杂编程、长篇分析、需要严谨推理时,再换旗舰模型或调高思考力度。
- 看你的生态。 每天用 Gmail 和 Google 文档,Gemini 接入更顺;公司用微软办公套件,Copilot 可能已经包含在内。
- 看隐私和地区。 处理工作资料前,先看公司规定和产品的数据政策(见隐私与安全);有些功能在部分国家和地区不可用。
- 算一算钱。 订阅还是按用量付费、额度够不够用,见AI 怎么收费。
| 你想做的事 | 可以先看 |
|---|---|
| 日常问答、写作 | 你已有的 ChatGPT、Claude、Gemini、豆包、DeepSeek 等 |
| 查资料、要出处 | 带联网搜索和引用的产品,如 Perplexity |
| 编程、做网站 | Claude Code、Codex、Cursor,以及 LMArena 的编程和网页开发榜 |
| 数据不能出公司 | 企业版产品,或在自己服务器上部署开放权重模型 |
来源
- Anthropic:Claude 模型概览(型号、价格、上下文、退役日期)
- OpenAI API:模型列表(GPT-6 Astra、6.1 Sol、Luna)
- OpenAI:ChatGPT 版本说明
- Google:Gemini API 模型列表
- Google:Gemini API 价格
- Google:Gemini 4 Argon 发布公告
- Artificial Analysis:Gemini 4 Argon 独立评测
- Anthropic:Claude Opus 5.5 发布公告
- Fortune:OpenAI 发布 GPT-6 Astra
- DeepSeek:V4 发布说明
- Fortune:DeepSeek 发布 V4(2026-04-24)
- LMArena 排行榜(数据截至 2026-10-02)
- Wikipedia:ChatGPT
- Wikipedia:DeepSeek
- Wikipedia:Kimi
- Wikipedia:Qwen
- Wikipedia:Llama
- Wikipedia:Grok
- Wikipedia:Doubao
- Wikipedia:Mistral AI