OpenAI 发布 GPT-5
GPT-5 把快速模型和推理模型结合在一起,由系统自动选择,并成为 ChatGPT 免费用户的默认模型。发布初期自动切换出现故障、旧模型被下架,引发用户不满,OpenAI 随后为付费用户恢复了 GPT-4o。

发生了什么
2025 年 8 月 7 日(星期四),OpenAI 在直播中发布了 GPT-5。它是 GPT-4 的继任者,也是新一代 ChatGPT 背后的模型,是 ChatGPT 问世以来 OpenAI 最受期待的一次发布。按公司当时的说法,ChatGPT 每周有超过 7 亿用户。
用户最直观的变化是:ChatGPT 变简单了。以前用户要在好几个名字让人摸不着头脑的模型之间自己选,有的快、有的慢但更仔细;GPT-5 替用户做了这个选择。
首席执行官萨姆·奥尔特曼(Sam Altman)称它是「世界上最好的模型」,说用它就像「口袋里装着一个博士级专家团队」。但他也表示,GPT-5 还不算 AGI(通用人工智能),因为它还不能在不重新训练的情况下持续自我学习。
背景
GPT-5 来得比外界预想的晚。2023 年奥尔特曼曾表示公司当时并没有在训练 GPT-5。据科技媒体 The Information 报道,OpenAI 在 2024 年下半年的大部分时间里都在开发一个原本打算作为 GPT-5 的模型(内部代号 Orion),但效果没有明显提升,最终在 2025 年 2 月以 GPT-4.5 的名字发布。
与此同时,OpenAI 的模型菜单越来越拥挤:GPT-4o、o3、o4-mini 等等。奥尔特曼本人也批评过手动选模型太复杂。GPT-5 的目的之一,就是用一个默认模型取代这张菜单。两天前的 8 月 5 日,OpenAI 还发布了 gpt-oss——任何人都可以免费下载、自己运行的模型。
对用户来说变了什么
- 免费用户第一次用上推理模型。 GPT-5 成为所有免费用户的默认模型。ChatGPT 负责人尼克·特利(Nick Turley)说,这是免费用户第一次能用到推理模型。免费账户用量上限较低,用完后会切换到更小的「mini」版本。
- 付费套餐。 Plus 用户(每月 20 美元)用量上限更高;Pro 用户(每月 200 美元)可以无限使用 GPT-5,并能用 GPT-5 Pro——一个调用更多算力、专门处理难题的版本。Team、Edu 和 Enterprise 套餐在一周后跟进。
- 新选项。 用户可以从四种预设性格(「愤世者」Cynic、「机器人」Robot、「倾听者」Listener、「书呆子」Nerd)中选一种,给对话换颜色,还可以把 ChatGPT 连接到 Gmail、Google 日历和 Google 通讯录。
- ChatGPT 之外。 GPT-5 同时进入了微软 Copilot,开发者也可以通过 OpenAI API 使用,有 gpt-5、gpt-5-mini、gpt-5-nano 三种大小。完整版的价格为每百万输入 token 1.25 美元、每百万输出 token 10 美元。
OpenAI 举的用途例子包括:只用一段文字描述,就生成一个能用的应用或网站——奥尔特曼称之为「按需生成软件」(也就是常说的「氛围编程」,vibe coding);还有帮用户处理日历、写研究简报等。
和其他模型比
OpenAI 主打的是编程能力。在 SWE-bench Verified(用 GitHub 上真实代码库里的修复 bug 任务做成的测试)上,GPT-5 首次尝试就解决了 74.9% 的任务,只比两天前发布的 Anthropic Claude Opus 4.1 高一点点。
各分数由各模型的开发公司自行公布,测试设置未必完全相同。 来源:TechCrunch《OpenAI’s GPT-5 is here》,2025-08-07
其他项目上互有胜负,TechCrunch 的报道列出了几项:
- GPQA Diamond(博士水平的科学题):GPT-5 Pro 得分 89.4%,高于 Grok 4 Heavy 的 88.9% 和 Claude Opus 4.1 的 80.9%。
- 人类最后的考试(Humanity’s Last Exam,覆盖多学科的超难题):GPT-5 Pro 在可用工具时得分 42%,略低于 xAI 的 Grok 4 Heavy(44.4%)。
- Tau-bench(模拟在航空公司和网店网站上办事):航空部分 GPT-5 略低于 o3,零售部分略低于 Claude Opus 4.1。
瞎编的情况更少
AI 模型有时会一本正经地说错话,这叫幻觉(hallucination)。在 o3 等 OpenAI 较新的推理模型上,这个问题一度似乎在变严重,OpenAI 此前也说并不完全清楚原因。公司称 GPT-5 改善很多:在一组真实的 ChatGPT 用户问题上,开启思考的 GPT-5 回答中含有事实错误的比例是 4.8%。
OpenAI 自己的测试和数据。 来源:TechCrunch《OpenAI’s GPT-5 is here》,2025-08-07
在健康问题上,OpenAI 称 GPT-5 会更主动地提示可能的健康风险,并帮助用户看懂检查结果。在 HealthBench Hard Hallucinations 测试中,它报告的错误率是 1.6%,GPT-4o 为 12.9%,o3 为 15.8%。
安全方面的变化
OpenAI 安全研究负责人亚历克斯·博伊特尔(Alex Beutel)说,GPT-5 经过了 5000 小时由专家主导的安全测试,也更少欺骗用户,比如谎称完成了其实没完成的任务。OpenAI 还改变了处理敏感问题的方式:不再简单地「回答」或「拒绝」二选一,而是尽量在安全范围内给出最有用的回答,公司称之为「安全补全」(safe completions)。博伊特尔说,目标是拒绝更多真正危险的请求,同时少拒绝无害的提问。
外部测试者没那么乐观。发布不到一天,安全公司 NeuralTrust 就称让 GPT-5 给出了制造爆炸装置的详细说明;另一家公司 SPLX 也报告了类似结果。
不太顺利的第一周
- 18 月 7 日:发布GPT-5 取代 ChatGPT 里原来的模型菜单。对大多数用户来说,GPT-4o 等旧模型一下子都没了。
- 2第一天:自动切换出故障用户反映 GPT-5 有时还不如 GPT-4o,还有人发现它数错单词里的字母、在地图上拼错美国州名。
- 38 月 8 日:奥尔特曼解释他说自动切换器「坏了,有一段时间完全没工作」,所以 GPT-5「看起来笨了很多」。
- 4GPT-4o 风波习惯用特定模型、或更喜欢 GPT-4o 温和语气的用户,不满旧模型被无预警下架。奥尔特曼表示 Plus 用户可以重新选用 GPT-4o。
- 58 月 15 日:更「温暖」的 GPT-5奥尔特曼此前说公司正在让模型「感觉更温暖」,相应的性格更新随后上线。
来源:维基百科「GPT-5」条目;《卫报》,2025-08-08
一些用户形容 GPT-5 的语气「平淡」「没有创意」。奥尔特曼在 X 上写道:「我们确实低估了人们喜欢 GPT-4o 的某些特点对他们有多重要,即使 GPT-5 在大多数方面表现更好。」他说这件事说明,需要给用户更好的方式来定制助手,因为没有一个模型能适合所有人。
各方反应
评测者的态度大多是认可,但并不兴奋:
- 《麻省理工科技评论》认为 GPT-5「首先是一个打磨过的产品」;如果说它是通往 AGI 的一步,那也是「很小的一步」。
- 《大西洋月刊》形容它「直观、快速、高效」,并认为到了这个阶段,聊天机器人用起来的感觉比跑分更重要。
- 《纽约》杂志写道,普通用户不太会觉得自己在用一个完全不同的产品,而用它写软件或用于工作的人更容易察觉变化。
- Ars Technica 实测发现,GPT-4o 的回答往往细节更多、更有人情味,GPT-5 则更直接、简洁。
- Mashable 认为它最酷的功能是「按一句话描述就生成定制的交互式应用」。
奥尔特曼也因发布前抬高期待而受到批评,比如他曾把 GPT-5 的研发比作「曼哈顿计划」。
需要注意的地方
- 分数都是厂商自报的。 OpenAI 的数字来自其发布材料,对手的分数由 Anthropic、谷歌、xAI 各自在自己的测试条件下公布。像 SWE-bench Verified 上不到 1 个百分点的领先,测试设置的差异就足以影响。
- 「博士水平」是宣传说法。 发布同一周,就有用户发现 GPT-5 数错「blueberry」等单词里的字母。部分原因是路由器把问题交给了更快、但不那么仔细的模型。
- 能耗没有公布。 OpenAI 没有披露 GPT-5 的能耗。美国罗得岛大学的研究人员估计,一次中等长度的回答耗电略高于 18 瓦时。
- 这已经是「上一代」的事了。 GPT-5 之后又有了多次更新,包括 2026 年 7 月的 GPT-5.6,以及 2026 年 9 月起的 GPT-6 系列(见《OpenAI 发布 GPT-6 Astra》)。
对普通人意味着什么
对大多数人来说,GPT-5 带来了两个实际变化:免费用户不用做任何选择,就能用上会「思考」的模型;但所有人都失去了自己挑旧模型的权利,直到用户抗议后,付费用户才拿回了 GPT-4o。这件事也给 OpenAI 上了一课:很多人在意的不只是模型跑分多高,还有它说话的方式。
想了解 ChatGPT 目前的套餐和模型,可以看本站的 ChatGPT 产品页和模型页。
模型摘要
- 开发方
- OpenAI
- 获取方式
- ChatGPT(含免费用户)、Microsoft Copilot、OpenAI API
公布的评测成绩
| SWE-bench Verified | 74.9% | Claude Opus 4.1:74.5% |
| AIME 2025 (no tools) | 94.6% | |
| GPQA Diamond | 89.4% | GPT-5 pro 版本 |
| ChatGPT 问答中的幻觉率 | 4.8% | 开启思考时;o3 为 22% |
数据口径:OpenAI 公布的数据,据 TechCrunch 报道。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。