AI 是怎么工作的
从「预测下一个词」讲起:模型怎么训练出来、一次能看多少内容、为什么会说错,以及它怎样从聊天变成能动手做事的智能体。
大语言模型:一台「接着往下写」的机器
ChatGPT、Claude、Gemini、DeepSeek 这些聊天助手,核心都是一个大语言模型(Large Language Model,LLM)。它做的事情说起来很简单:给它一段文字,它预测下一小段最可能是什么,写出来,再把新写的内容接上去,继续预测下一段,一直到写完。
你在输入法里打「床前明月光,疑是地上」,它会提示「霜」。大语言模型做的是同一类事,只是规模大得多:它见过的文字多到几乎覆盖了公开互联网、书籍和代码,所以它不只会接诗句,还能接着写邮件、解释概念、写程序。
它说话流畅,并不是因为它像人一样「理解」了世界,而是因为它从海量文字中学到了词语、事实、推理步骤之间极其复杂的规律。这些规律足以让它完成很多真正有用的工作,但也解释了它为什么有时会编造:它的本职是写出「看起来对」的文字,而不是查证事实。
几乎所有主流大语言模型都基于 2017 年 Google 研究人员提出的 Transformer 架构。
一个模型是怎么做出来的
做一个模型分两大阶段:先「读书」(预训练),再「学规矩」(后训练)。
- 1收集文字网页、书籍、代码等海量文本。DeepSeek 说 V4 的预训练用了超过 32 万亿个 token。
- 2预训练一遍遍猜下一个 token,猜错就调整参数。这步最贵:OpenAI 说 GPT-6 Astra 用了超过 10 万块 GPU。
- 3学会回答先用人写的示范教它按指令做事,再让人给它的回答排序,用这些偏好继续训练(RLHF)。
- 4推理训练在数学、编程等能自动判对错的任务上,用强化学习奖励做对的过程,练出「推理模型」。
- 5测试与发布内外部机构测试危险能力和不当行为,加上安全限制后开放给用户。
来源:InstructGPT 论文(2022)、DeepSeek-R1 与 V4 技术资料、Fortune 对 GPT-6 Astra 的报道
后训练的效果很显著。OpenAI 2022 年的 InstructGPT 研究发现:经过人类反馈调教、只有 13 亿参数的小模型,回答反而比没调教过的 1750 亿参数的 GPT-3 更受评审者欢迎。今天的聊天助手「好说话」,很大程度上靠的是这一步。
训练和使用是两回事
训练一个模型要花几个月和巨额算力,做完之后模型就定型了。你每次提问,只是在「使用」这个定型的模型,专业上叫推理(inference)。这带来三个常被误解的事实:
- 它不会因为跟你聊天就变聪明。 你纠正它一次,它在这段对话里会照做,但模型本身没有改变。一些产品有「记忆」功能,那是把你的偏好记成笔记,下次自动附上,并不是重新训练。
- 它的知识有截止日期。 模型只知道训练数据里有的东西。比如 Anthropic 公布 Claude Opus 5.5 的可靠知识截止于 2026 年 6 月,OpenAI 公布 GPT-6 Astra 的知识截止于 2026 年 4 月 30 日。更新的消息要靠联网搜索。
- 你的对话可能被用来训练下一代模型。 这取决于产品和你的设置,见隐私与安全一章。
你发出一条消息之后,发生了什么
- 1打包上下文App 把系统设定、记忆、之前的对话、上传的文件和你的新问题拼成一份输入,切成 token 送进模型。
- 2先思考(可选)推理模型先写一段草稿,拆解问题、检查思路。
- 3用工具(可选)需要时去联网搜索、运行代码或读文件,结果放回上下文。
- 4逐字生成一个 token 接一个 token 地写出回答,所以文字是「流」出来的。
- 5下一轮重来你接着问时,整段对话(包括它刚才的回答)会再次整个送进去。
根据 Anthropic 上下文窗口文档整理
最后一步很关键:模型本身不「记得」上一句话,是 App 每次把整段对话重新发给它。对话越长,每次要处理的内容越多,这就引出了下一个概念。
上下文窗口:AI 一次能看多少
上下文窗口(context window)是模型一次能处理的全部内容上限,包括你发的所有东西和它写出的回答。Anthropic 把它比作模型的「工作记忆」:它和模型训练时读过的海量资料不是一回事,而是这一次对话里摆在它眼前的东西。
截至 2026 年 10 月,各家官方文档列出的数字(开发者通过 API 使用时):
| 模型 | 上下文窗口 | 单次最多输出 |
|---|---|---|
| Claude Opus 5.5 / Sonnet 5.5 / Haiku 5.5 / Fable 5.1 | 100 万 token | 12.8 万 token |
| GPT-6 Astra / GPT-6.1 Sol / GPT-6 Luna | 105 万 token | 12.8 万 token |
| Gemini 3.8 Flash | 约 105 万 token(1,048,576) | 约 6.6 万 token(65,536) |
| DeepSeek V4 系列 | 100 万 token | — |
Google 的说法可以帮你想象 100 万 token 有多大:大约 5 万行代码、8 本普通长度的英文小说,或 200 多期播客的文字稿。
为什么这很重要
- 超出就会「忘」。 对话太长时,App 会自动丢掉或压缩最早的内容。你会发现它忽然不记得开头定好的要求。
- 塞得多不等于读得好。 Anthropic 的文档明确提醒:内容越多,模型的准确度和回忆能力会下降。把一本书全丢进去,不如告诉它重点看哪几章。
- 它影响价格。 对开发者来说,每次请求都按 token 计费,长对话的成本会越滚越大,详见AI 怎么收费。
实用做法:换话题就开新对话;长对话里把关键要求再说一遍;上传长文件时,先告诉它你要解决什么问题。
为什么 AI 会一本正经地胡说
AI 编造事实、引用不存在的论文、给出错误数字,这叫幻觉(hallucination)。原因有三层:
- 它的本职是写出像样的文字。 一个看起来合理的人名、页码或数字,对模型来说和真的没有本质区别。
- 训练方式鼓励它猜。 2025 年一篇题为《语言模型为什么会产生幻觉》的论文指出:就像考生遇到难题时蒙一个答案能多得分,大多数评测对「不知道」不给分,于是模型学会了在没把握时也给出答案。
- 知识有截止日期,也有盲区。 它没学过的东西,常常会用「最像的东西」补上。
新模型在改善,但差异很大,而且少说错往往伴随着少回答。独立评测机构 Artificial Analysis 在 2026 年 9 月测了「不确定时编造答案」的比例:
同一测试中,Gemini 4 Argon 答对 50% 的题,GPT-6 Astra 答对 63%:少编造的模型,也更常选择不答。 来源:Artificial Analysis,2026-09-30
厂商自己的数据也显示进步:OpenAI 说 GPT-5 开启思考时,在真实 ChatGPT 问题中的答案出错率为 4.8%,而更早的 o3 是 22%。但无论哪个数字,都不是零。
怎样减少幻觉
- 允许它说「不知道」。 在提问里写明「不确定就直说」,Anthropic 的文档说这一招能明显减少编造。
- 给它原材料。 把文件、网页或数据直接给它,要求「只根据这份材料回答」。这也是「检索增强生成」(RAG)的思路。
- 要它给出处,并且自己点开。 要求每条结论附上原文引语或链接;找不到依据的就删掉。
- 开启联网搜索,尤其是问近期的事。
- 重点核对人名、数字、日期、引文,以及任何涉及健康、钱和法律的内容。
- 换个问法再问一次,或者问另一个 AI。几次回答不一致,往往说明它在猜。
具体做法可以参考教程《把一份长文档,变成能核对的重点》。
推理模型:先想再答
早期的聊天模型一拿到问题就开始写答案。2024 年 9 月,OpenAI 发布 o1,它会先在内部写一长段推理过程,把问题拆开、试错、检查,然后才给出答案。2025 年 1 月,DeepSeek-R1 公开了权重和训练方法,证明只靠强化学习就能练出这种能力。此后 Google 的 Gemini 2.5、Anthropic 的 Claude 3.7 Sonnet 也加入了「思考」功能,推理成了前沿模型的标配。
到 2026 年,大多数旗舰模型都能自己决定想多久,并提供一个「思考力度」的旋钮:
- GPT-6 Astra 可选 low、medium、high、xhigh、max 五档;
- Gemini 3.8 Flash 可选 low、medium、high;
- DeepSeek V4 有「不思考」「High」「Max」三档;
- Claude 当前的模型采用「自适应思考」,由模型按任务难度决定思考多少。
思考越多,数学、编程、多步骤分析通常越准,但也更慢、更贵:思考过程同样消耗 token,开发者要按输出 token 付费,订阅用户则更快用完额度。查个简单事实、改一句话,用快速模式就够了;做复杂计算、写程序、分析长材料时,再让它多想一会儿。
多模态:看图、听声音、看视频
「多模态」指模型能处理文字以外的信息。2024 年 5 月发布的 GPT-4o 是一个转折点:同一个模型同时处理文字、声音和图片,可以像打电话一样实时语音对话。
现在的情况大致是:
- 看图几乎是标配。 Anthropic 说所有当前 Claude 模型都支持图片输入;OpenAI 说其最新模型都支持文字和图片输入。拍一张表格、截图或作业题给它,它就能读。
- 看视频、听音频取决于模型。 Google 的 Gemini 3.8 Flash 可以直接输入文字、图片、视频、音频和 PDF。ChatGPT 在 2026 年 10 月为付费用户加入了音频文件上传,可转写和总结录音。
- 「能看」不等于「能画」。 生成图片、视频、语音通常由专门的模型完成,比如 Google 的 Nano Banana 和 Gemini Omni、OpenAI 的 GPT-Image。聊天 App 会在背后替你调用它们,所以你感觉是同一个 AI 在做。
图片和声音同样要换算成 token,会占用上下文窗口;模型对图里的小字、复杂图表也会看错,关键数字仍要核对。
从聊天机器人到智能体
只会聊天的 AI,只能告诉你怎么做。智能体(agent)则能自己动手:它会规划步骤,调用工具,看结果,再决定下一步,直到把任务完成。
关键的几步:
- 工具调用。 模型可以决定「现在需要搜索」或「运行这段代码」,由 App 执行后把结果交还给它。联网搜索、深度研究都建立在这上面。
- 连接你的应用。 2024 年 11 月,Anthropic 发布模型上下文协议(MCP),一个让 AI 连接外部数据和工具的开放标准。它的官方介绍把 MCP 比作 AI 应用的「USB-C 接口」,现在 Claude、ChatGPT 等都支持。
- 操作电脑。 2024 年 10 月,Claude 首次学会操作电脑:看屏幕截图、移动鼠标、点击、打字。之后有 OpenAI 的 Operator,2026 年 9 月的 GPT-6 Astra 把操作电脑作为主打能力。
- 在后台持续工作。 编程智能体如 Codex 和 Claude Code 能在代码库里自己读代码、改代码、跑测试;OpenAI 9 月推出的 Dots 带有自己的云端电脑,可以在对话之外继续做事。
能力进步很快。Anthropic 公布的 OSWorld 2.1 测试中(让 AI 像人一样操作桌面软件),Claude Opus 5.5 完成了 81.8% 的任务。但这是厂商自测的成绩,真实环境更复杂。
使用智能体时:只给完成任务所需的权限和账号;付款、提交表单、发送邮件、删除文件之前,让它停下来等你确认;在它工作时看一看它在做什么。
记住这几点
- AI 写的是「最可能的下一段文字」,流畅不等于正确。
- 它的知识停在训练截止日;新消息要靠搜索,你的纠正不会改变模型本身。
- 上下文窗口有上限,长对话会「忘」;换话题开新对话,关键要求反复说。
- 难题让它多想,简单事用快速模式。
- 让它动手之前,先想清楚给它哪些权限;关键步骤由你确认。
下一章讲模型、产品和公司:ChatGPT 和 GPT-6 是什么关系,各家公司的大中小模型怎么分,排行榜又该怎么看。
来源
- Vaswani 等:Attention Is All You Need(Transformer 论文)
- Ouyang 等:用人类反馈训练语言模型遵循指令(InstructGPT 论文)
- DeepSeek-R1 技术报告
- DeepSeek-V4-Pro 模型说明(Hugging Face)
- Fortune:OpenAI 发布 GPT-6 Astra(2026-09-03)
- Anthropic:Claude 模型概览
- Anthropic:上下文窗口
- Claude 帮助中心:付费套餐的上下文窗口有多大
- OpenAI API:模型列表
- Google:Gemini 3.8 Flash 模型说明
- Google:长上下文
- Kalai 等:Why Language Models Hallucinate
- TechCrunch:OpenAI 发布 GPT-5(含幻觉率数据)
- Artificial Analysis:Gemini 4 Argon 独立评测
- Anthropic:减少幻觉
- Anthropic:电脑操作(computer use)工具说明
- 模型上下文协议(MCP)简介