有据可查的 AI 新闻、模型与产品English
指南 基础知识 · 第 2 章

模型、产品和公司

ChatGPT 和 GPT-6 是什么关系?Haiku、Sonnet、Opus 谁大谁小?开源模型有什么用?排行榜怎么看?一章理清 AI 世界的「名字」。

模型和产品不是一回事

模型是训练出来的那个「大脑」,本质上是一个巨大的数字文件,比如 Claude Opus 5.5、GPT-6 Astra。产品是你实际打开使用的东西,比如 Claude App、ChatGPT 网站。产品在模型外面加了很多东西:

  • 聊天界面、手机 App、语音;
  • 工具:联网搜索、读文件、运行代码、生成图片、操作电脑;
  • 记忆、项目、连接你的邮箱和网盘;
  • 套餐、用量上限、隐私规则、地区限制。

所以「Claude」既是公司的产品名,也是模型系列名;你在 Claude App 里选择「Opus 5.5」,才是在选模型。ChatGPT 也一样:按 OpenAI 2026 年 10 月的版本说明,ChatGPT 付费版(Plus、Pro、Business、Enterprise)的日常对话用的是 GPT-6 Sol,免费版和 Go 版用的是 GPT-6 Luna,而 Pro 用户的「深度推理」选项用的是最强的 GPT-6 Astra(见《ChatGPT 推出交互式回答,GPT-6 开始向更多用户开放》)。同样叫 ChatGPT,背后的模型可能完全不同。

为什么一家公司有好几档模型

就像咖啡分小杯、中杯、大杯,AI 公司也把模型按「能力和价格」分档。小模型反应快、便宜,适合大量简单任务;大模型更强,但更慢、更贵。名字里的数字通常代表代际(5.5、6),名字代表档位。

截至 2026 年 10 月,三家美国公司的主要档位如下(价格为开发者 API 价格,每百万 token 输入 / 输出,美元;订阅用户不按这个付费):

公司 小而快 日常主力 旗舰及以上
Anthropic Haiku 5.5(0.10 / 0.50 起) Sonnet 5.5(2 / 10) Opus 5.5(4 / 20);更高一档 Fable 5.1(10 / 50)
OpenAI GPT-6 Luna(0.10 / 0.50) GPT-6.1 Sol(2 / 10) GPT-6 Astra(10 / 50)
Google Gemini 3.5 Flash-Lite(0.30 / 2.50) Gemini 3.8 Flash(0.75 / 3.75,2027 年起翻倍) Gemini 4 Argon(推广价 2 / 10,之后 4 / 20;尚未公开)

几点说明:

  • Anthropic:从小到大是 Haiku、Sonnet、Opus。2026 年起又多了更高一档:Fable 和 Mythos 是同一个模型,Fable 面向公众、带额外安全限制,Mythos 限制更少,只给经过审核的网络安全和生命科学机构使用。Anthropic 官方建议大多数任务先用 Opus 5.5。
  • OpenAI:命名从小到大是 Luna(月亮)、Terra(地球)、Sol(太阳)、Astra(星辰)。截至 10 月,OpenAI 官方模型页上 GPT-6 这一代列出的是 Luna、6.1 Sol 和 Astra 三档,没有列出 Terra。
  • Google:一直用 Flash-Lite、Flash(快)和 Pro(强)分档,还有可以在手机上运行的 Nano。2026 年 9 月发布的 Gemini 4 Argon 是新命名方式的第一个模型,取代「Pro」这类名字。截至 10 月初它只向少数测试者开放,Gemini App 仍在用 3.x 系列模型。
  • 中国公司也类似:DeepSeek V4 分 Pro 和 Flash;阿里的 Qwen 有开放的小模型,也有不公开的 Max、Plus 版本。
API 输出价格:每百万 token(美元)截至 2026 年 10 月;越短越便宜
  • GPT-6 Luna$0.50
  • Claude Haiku 5.5$0.50 起
  • Gemini 3.8 Flash$3.75
  • Claude Sonnet 5.5$10
  • GPT-6.1 Sol$10
  • Claude Opus 5.5$20
  • Claude Fable 5.1$50
  • GPT-6 Astra$50

Haiku 5.5 的提示超过 10 万 token 时价格更高;Gemini 3.8 Flash 为 2026 年底前的价格。价格常变,以官网为准。 来源:Anthropic、OpenAI、Google 官方价格与模型页面,2026-10-08 查阅

档位高不等于一定更好。 新一代的中档常常追上上一代的顶档:Anthropic 说 Opus 5.5 在大多数工作上达到 Fable 5.1 的水平,价格却低得多;独立机构 Artificial Analysis 的命令行任务测试中,Sonnet 5.5(64%)甚至高于 Opus 5.5(60%)。除了换档,很多模型还能调「思考力度」,这是另一个兼顾速度和质量的旋钮(见上一章)。

主要的公司和产品

公司 聊天产品 模型系列 所在国家
OpenAI ChatGPT GPT(GPT-6 Astra / Sol / Luna) 美国
Anthropic Claude Claude(Haiku / Sonnet / Opus / Fable) 美国
Google Gemini Gemini(Flash 系列、Argon) 美国
Meta Meta AI Muse(此前为 Llama) 美国
SpaceXAI(原 xAI) Grok Grok 美国
深度求索 DeepSeek DeepSeek V4 / V4.1 中国
阿里巴巴 通义千问 Qwen 中国
月之暗面 Kimi Kimi K3 中国
字节跳动 豆包 豆包大模型 中国
Mistral AI Mistral Vibe(原 Le Chat) Mistral 法国

规模上差别很大:ChatGPT 在 2026 年 2 月达到 9 亿周活跃用户;豆包是中国最受欢迎的聊天助手,到 2026 年 5 月有 3.3 亿用户。还有一类产品不自己训练基础模型,而是在别人的模型上做应用,比如本站产品页里的很多写作、编程和办公工具。

开放权重和封闭模型

封闭模型只能通过公司自己的 App 或 API 使用,比如 GPT-6、Claude、Gemini。你看不到模型本身,所有请求都发到这家公司的服务器。

开放权重模型则把训练好的模型文件公开发布,任何人都能下载、在自己的电脑或服务器上运行、修改。2025 年 1 月 DeepSeek-R1 以宽松的 MIT 许可证开放后,开放模型引起了全球关注。截至 2026 年 10 月,几个主要的开放模型:

  • DeepSeek V4 / V4.1:MIT 许可证,可商用、可修改。
  • Kimi K3(月之暗面,2026 年 7 月):2.8 万亿参数,是最大的开放权重模型;但许可证要求年收入超过 2000 万美元的公司把它作为服务提供给客户前,先与月之暗面签合同。
  • Qwen3.8(阿里巴巴):2.4 万亿参数;大模型对年收入超过 5000 万美元的服务商要求分成,蒸馏出的 270 亿参数小版本用更宽松的 Apache 许可证。
  • Llama(Meta):曾是最有名的开放模型,但它的许可证限制了超大公司的使用,被一些研究者批评不算真正「开源」。2026 年 4 月起,Meta 的聊天产品改用新的 Muse 系列,LMArena 把它标为不公开的专有模型。

这对你有什么影响

你关心的 封闭模型 开放权重模型
能力 目前最强的模型都是封闭的 紧随其后,差距不大
价格 按官方价格付费 可自己部署,或找更便宜的服务商
隐私 数据发到这家公司 自己运行时,数据不出你的服务器
门槛 注册即用 大模型需要昂贵的硬件和技术能力
安全限制 由公司统一控制 下载后可被他人修改甚至移除

要注意的是:用一家公司的官方 App,和下载它的开放模型自己运行,是两回事。 比如 DeepSeek 官方 App 遵守中国的内容审查规定,美国国防部、澳大利亚政府等已禁止在公务设备上使用 DeepSeek 产品;但下载模型自己运行,数据不会发送到 DeepSeek 的服务器。

开放模型和最强封闭模型的差距有多大?在 LMArena 的文字综合榜上(数据截至 2026 年 10 月 2 日),最高的封闭模型 Gemini 4 Argon 得 1525 分(投票还少,属于初步结果),最高的开放模型 Kimi K3 得 1488 分。据 Fortune 报道,DeepSeek 在 V4 技术报告中估计,它比最前沿的模型落后约三到六个月。

怎么看跑分和排行榜

几乎每次发布新模型,公司都会贴出一张「我们第一」的成绩表。读这些数字时,先分清两类:

厂商自己公布的成绩。 由发布模型的公司测试,往往挑选自己擅长的项目,测试条件也不一定相同。几个本站报道过的例子:

  • 同一个测试,不同公司报的分数不一样:Anthropic 公布 Opus 5.5 在 AutomationBench 上是 40.0%,Google 的对比表里写的却是 42.5%。
  • 工具和条件影响巨大:OpenAI 公布 GPT-6 Astra 在 ARC-AGI-3 上用增强版辅助工具得 99.9%,用标准条件只有 66%。
  • 算法不同,结果也不同:2025 年 xAI 公布 Grok 3 的对比图时,一名 OpenAI 员工指出,图中 Grok 3 的成绩用的是「跑 64 次取最常见答案」,对手却只算了单次成绩。
  • 厂商自己也承认局限:Anthropic 在 Opus 5.5 公告中说,在这个能力水平上,评测分差已经不太能可靠地反映真实差距。

独立机构的测试。 由与模型无关的第三方用统一方法测,可比性更好。例如 Artificial Analysis 的综合「智能指数」中,Gemini 4 Argon 和 GPT-6 Astra 同为 53 分,GPT-6.1 Sol 是 52 分。

读任何一个分数,都可以问自己四个问题:谁测的?测的是什么任务?和谁比、在什么条件下比?这个任务和我要做的事像不像?

怎么选

没有「最好的 AI」,只有更适合某件事的。几个实用原则:

  1. 先用你已经有的。 日常提问、写作、翻译,主流产品的免费版通常都够用。遇到某类任务明显做不好,再考虑换。
  2. 用自己的真实任务测试。 挑三到五件你常做的事(一封难写的邮件、一份要读的报告、一个表格),同样的要求发给两三个产品,比较哪个返工最少。这比任何排行榜都可靠。
  3. 先用中档,不够再升级。 日常任务用默认模型或中档模型;复杂编程、长篇分析、需要严谨推理时,再换旗舰模型或调高思考力度。
  4. 看你的生态。 每天用 Gmail 和 Google 文档,Gemini 接入更顺;公司用微软办公套件,Copilot 可能已经包含在内。
  5. 看隐私和地区。 处理工作资料前,先看公司规定和产品的数据政策(见隐私与安全);有些功能在部分国家和地区不可用。
  6. 算一算钱。 订阅还是按用量付费、额度够不够用,见AI 怎么收费。
你想做的事 可以先看
日常问答、写作 你已有的 ChatGPT、Claude、Gemini、豆包、DeepSeek 等
查资料、要出处 带联网搜索和引用的产品,如 Perplexity
编程、做网站 Claude Code、Codex、Cursor,以及 LMArena 的编程和网页开发榜
数据不能出公司 企业版产品,或在自己服务器上部署开放权重模型

更多按用途分类的产品,见产品页;最新的模型排名,见模型页。

来源