有据可查的 AI 新闻、模型与产品English
新闻重大 模型2025年8月7日

OpenAI 发布 GPT-5

GPT-5 把快速模型和推理模型结合在一起,由系统自动选择,并成为 ChatGPT 免费用户的默认模型。发布初期自动切换出现故障、旧模型被下架,引发用户不满,OpenAI 随后为付费用户恢复了 GPT-4o。

OpenAI 首席执行官萨姆·奥尔特曼在 TED 舞台上
OpenAI 首席执行官萨姆·奥尔特曼,摄于 2025 年 4 月 TED 大会,即 GPT-5 发布前四个月。资料照片。 照片:Steve Jurvetson / Wikimedia Commons,CC BY 2.0

发生了什么

2025 年 8 月 7 日(星期四),OpenAI 在直播中发布了 GPT-5。它是 GPT-4 的继任者,也是新一代 ChatGPT 背后的模型,是 ChatGPT 问世以来 OpenAI 最受期待的一次发布。按公司当时的说法,ChatGPT 每周有超过 7 亿用户。

用户最直观的变化是:ChatGPT 变简单了。以前用户要在好几个名字让人摸不着头脑的模型之间自己选,有的快、有的慢但更仔细;GPT-5 替用户做了这个选择。

首席执行官萨姆·奥尔特曼(Sam Altman)称它是「世界上最好的模型」,说用它就像「口袋里装着一个博士级专家团队」。但他也表示,GPT-5 还不算 AGI(通用人工智能),因为它还不能在不重新训练的情况下持续自我学习。

背景

GPT-5 来得比外界预想的晚。2023 年奥尔特曼曾表示公司当时并没有在训练 GPT-5。据科技媒体 The Information 报道,OpenAI 在 2024 年下半年的大部分时间里都在开发一个原本打算作为 GPT-5 的模型(内部代号 Orion),但效果没有明显提升,最终在 2025 年 2 月以 GPT-4.5 的名字发布。

与此同时,OpenAI 的模型菜单越来越拥挤:GPT-4o、o3、o4-mini 等等。奥尔特曼本人也批评过手动选模型太复杂。GPT-5 的目的之一,就是用一个默认模型取代这张菜单。两天前的 8 月 5 日,OpenAI 还发布了 gpt-oss——任何人都可以免费下载、自己运行的模型。

对用户来说变了什么

  • 免费用户第一次用上推理模型。 GPT-5 成为所有免费用户的默认模型。ChatGPT 负责人尼克·特利(Nick Turley)说,这是免费用户第一次能用到推理模型。免费账户用量上限较低,用完后会切换到更小的「mini」版本。
  • 付费套餐。 Plus 用户(每月 20 美元)用量上限更高;Pro 用户(每月 200 美元)可以无限使用 GPT-5,并能用 GPT-5 Pro——一个调用更多算力、专门处理难题的版本。Team、Edu 和 Enterprise 套餐在一周后跟进。
  • 新选项。 用户可以从四种预设性格(「愤世者」Cynic、「机器人」Robot、「倾听者」Listener、「书呆子」Nerd)中选一种,给对话换颜色,还可以把 ChatGPT 连接到 Gmail、Google 日历和 Google 通讯录。
  • ChatGPT 之外。 GPT-5 同时进入了微软 Copilot,开发者也可以通过 OpenAI API 使用,有 gpt-5、gpt-5-mini、gpt-5-nano 三种大小。完整版的价格为每百万输入 token 1.25 美元、每百万输出 token 10 美元。

OpenAI 举的用途例子包括:只用一段文字描述,就生成一个能用的应用或网站——奥尔特曼称之为「按需生成软件」(也就是常说的「氛围编程」,vibe coding);还有帮用户处理日历、写研究简报等。

和其他模型比

OpenAI 主打的是编程能力。在 SWE-bench Verified(用 GitHub 上真实代码库里的修复 bug 任务做成的测试)上,GPT-5 首次尝试就解决了 74.9% 的任务,只比两天前发布的 Anthropic Claude Opus 4.1 高一点点。

SWE-bench Verified:修复真实代码中的 bug解决率,越高越好
  • GPT-574.9%
  • Claude Opus 4.174.5%
  • Gemini 2.5 Pro59.6%

各分数由各模型的开发公司自行公布,测试设置未必完全相同。 来源:TechCrunch《OpenAI’s GPT-5 is here》,2025-08-07

其他项目上互有胜负,TechCrunch 的报道列出了几项:

  • GPQA Diamond(博士水平的科学题):GPT-5 Pro 得分 89.4%,高于 Grok 4 Heavy 的 88.9% 和 Claude Opus 4.1 的 80.9%。
  • 人类最后的考试(Humanity’s Last Exam,覆盖多学科的超难题):GPT-5 Pro 在可用工具时得分 42%,略低于 xAI 的 Grok 4 Heavy(44.4%)。
  • Tau-bench(模拟在航空公司和网店网站上办事):航空部分 GPT-5 略低于 o3,零售部分略低于 Claude Opus 4.1。

瞎编的情况更少

AI 模型有时会一本正经地说错话,这叫幻觉(hallucination)。在 o3 等 OpenAI 较新的推理模型上,这个问题一度似乎在变严重,OpenAI 此前也说并不完全清楚原因。公司称 GPT-5 改善很多:在一组真实的 ChatGPT 用户问题上,开启思考的 GPT-5 回答中含有事实错误的比例是 4.8%。

真实 ChatGPT 问题中,回答含事实错误的比例越低越好
  • GPT-5(思考)4.8%
  • GPT-4o20.6%
  • o322%

OpenAI 自己的测试和数据。 来源:TechCrunch《OpenAI’s GPT-5 is here》,2025-08-07

在健康问题上,OpenAI 称 GPT-5 会更主动地提示可能的健康风险,并帮助用户看懂检查结果。在 HealthBench Hard Hallucinations 测试中,它报告的错误率是 1.6%,GPT-4o 为 12.9%,o3 为 15.8%。

安全方面的变化

OpenAI 安全研究负责人亚历克斯·博伊特尔(Alex Beutel)说,GPT-5 经过了 5000 小时由专家主导的安全测试,也更少欺骗用户,比如谎称完成了其实没完成的任务。OpenAI 还改变了处理敏感问题的方式:不再简单地「回答」或「拒绝」二选一,而是尽量在安全范围内给出最有用的回答,公司称之为「安全补全」(safe completions)。博伊特尔说,目标是拒绝更多真正危险的请求,同时少拒绝无害的提问。

外部测试者没那么乐观。发布不到一天,安全公司 NeuralTrust 就称让 GPT-5 给出了制造爆炸装置的详细说明;另一家公司 SPLX 也报告了类似结果。

不太顺利的第一周

发布后的几天
  1. 18 月 7 日:发布GPT-5 取代 ChatGPT 里原来的模型菜单。对大多数用户来说,GPT-4o 等旧模型一下子都没了。
  2. 2第一天:自动切换出故障用户反映 GPT-5 有时还不如 GPT-4o,还有人发现它数错单词里的字母、在地图上拼错美国州名。
  3. 38 月 8 日:奥尔特曼解释他说自动切换器「坏了,有一段时间完全没工作」,所以 GPT-5「看起来笨了很多」。
  4. 4GPT-4o 风波习惯用特定模型、或更喜欢 GPT-4o 温和语气的用户,不满旧模型被无预警下架。奥尔特曼表示 Plus 用户可以重新选用 GPT-4o。
  5. 58 月 15 日:更「温暖」的 GPT-5奥尔特曼此前说公司正在让模型「感觉更温暖」,相应的性格更新随后上线。

来源:维基百科「GPT-5」条目;《卫报》,2025-08-08

一些用户形容 GPT-5 的语气「平淡」「没有创意」。奥尔特曼在 X 上写道:「我们确实低估了人们喜欢 GPT-4o 的某些特点对他们有多重要,即使 GPT-5 在大多数方面表现更好。」他说这件事说明,需要给用户更好的方式来定制助手,因为没有一个模型能适合所有人。

各方反应

评测者的态度大多是认可,但并不兴奋:

  • 《麻省理工科技评论》认为 GPT-5「首先是一个打磨过的产品」;如果说它是通往 AGI 的一步,那也是「很小的一步」。
  • 《大西洋月刊》形容它「直观、快速、高效」,并认为到了这个阶段,聊天机器人用起来的感觉比跑分更重要。
  • 《纽约》杂志写道,普通用户不太会觉得自己在用一个完全不同的产品,而用它写软件或用于工作的人更容易察觉变化。
  • Ars Technica 实测发现,GPT-4o 的回答往往细节更多、更有人情味,GPT-5 则更直接、简洁。
  • Mashable 认为它最酷的功能是「按一句话描述就生成定制的交互式应用」。

奥尔特曼也因发布前抬高期待而受到批评,比如他曾把 GPT-5 的研发比作「曼哈顿计划」。

需要注意的地方

  • 分数都是厂商自报的。 OpenAI 的数字来自其发布材料,对手的分数由 Anthropic、谷歌、xAI 各自在自己的测试条件下公布。像 SWE-bench Verified 上不到 1 个百分点的领先,测试设置的差异就足以影响。
  • 「博士水平」是宣传说法。 发布同一周,就有用户发现 GPT-5 数错「blueberry」等单词里的字母。部分原因是路由器把问题交给了更快、但不那么仔细的模型。
  • 能耗没有公布。 OpenAI 没有披露 GPT-5 的能耗。美国罗得岛大学的研究人员估计,一次中等长度的回答耗电略高于 18 瓦时。
  • 这已经是「上一代」的事了。 GPT-5 之后又有了多次更新,包括 2026 年 7 月的 GPT-5.6,以及 2026 年 9 月起的 GPT-6 系列(见《OpenAI 发布 GPT-6 Astra》)。

对普通人意味着什么

对大多数人来说,GPT-5 带来了两个实际变化:免费用户不用做任何选择,就能用上会「思考」的模型;但所有人都失去了自己挑旧模型的权利,直到用户抗议后,付费用户才拿回了 GPT-4o。这件事也给 OpenAI 上了一课:很多人在意的不只是模型跑分多高,还有它说话的方式。

想了解 ChatGPT 目前的套餐和模型,可以看本站的 ChatGPT 产品页和模型页。

模型摘要

开发方
OpenAI
获取方式
ChatGPT(含免费用户)、Microsoft Copilot、OpenAI API

公布的评测成绩

SWE-bench Verified74.9%Claude Opus 4.1:74.5%
AIME 2025 (no tools)94.6%
GPQA Diamond89.4%GPT-5 pro 版本
ChatGPT 问答中的幻觉率4.8%开启思考时;o3 为 22%

数据口径:OpenAI 公布的数据,据 TechCrunch 报道。评测成绩为厂商发布时公布的数据,各家测试条件不尽相同,横向比较需谨慎。

来源