DeepSeek V4:开源且支持 100 万 token 上下文
DeepSeek 开源发布两个规格的 V4 模型,称更大的 Pro 版在数学、科学和编程上可与顶级闭源模型相媲美。
发生了什么
2026 年 4 月 24 日(周五),DeepSeek 在官方发布说明中宣布「DeepSeek-V4 预览版正式上线并开源」,口号是「欢迎进入高性价比的 100 万上下文时代」。这是它在 2025 年初凭 R1 震动全球之后,又一次大版本更新。
这次有两个型号:
- V4-Pro:总参数 1.6 万亿,每次回答启用 490 亿。DeepSeek 称其性能「可与世界顶级闭源模型相媲美」。
- V4-Flash:总参数 2840 亿,每次启用 130 亿。更小、更快、更便宜,DeepSeek 称它的推理能力接近 Pro 版,在简单的智能体任务上与 Pro 版相当。
两者的权重都放在 Hugging Face 上供下载,采用 MIT 许可证。发布当天就可以在 chat.deepseek.com 的「专家模式」和「快速模式」里使用,API 也同步更新。
它有什么新东西
根据 V4 的模型说明,技术上的主要变化有:
- 新的注意力机制:DeepSeek 设计了两种压缩方式结合的「混合注意力」。在 100 万 token 的长度下,V4-Pro 处理每个 token 所需的计算量只有上一代 V3.2 的 27%,用来暂存上下文的内存(KV 缓存)只有 10%。这正是它能把 100 万上下文设为「标配」的原因。
- 更多训练数据:两个模型都在超过 32 万亿 token 的数据上预训练。
- 三档思考强度:「不思考」(快速作答,适合日常小事)、「高」(慢一些但更准)和「最高」(Max,尽可能深入推理)。
- 为智能体优化:DeepSeek 说 V4 可以直接接入 Claude Code、OpenClaw、OpenCode 等编程智能体工具,公司内部的编程工作也已经在用它。
和其他模型比
DeepSeek 在模型说明里把 V4-Pro 的最高思考档(V4-Pro-Max)和几款前沿模型放在一起比较。下面两项分别代表「知识推理」和「智能体操作」:
所有分数由 DeepSeek 公布;V4-Pro 为最高思考档,其他模型为各自的高思考档。 来源:DeepSeek-V4-Pro 模型说明(Hugging Face),2026-04
所有分数由 DeepSeek 公布。 来源:DeepSeek-V4-Pro 模型说明(Hugging Face),2026-04
可以看到,V4-Pro 在这些测试里处在「前沿闭源模型」和「其他开源模型」之间。DeepSeek 自己的说法也比较克制:发布说明称它在世界知识上「领先所有现有开源模型,仅次于 Gemini 3.1 Pro」;据《财富》报道,技术报告写道 V4「略逊于 GPT-5.4 和 Gemini 3.1 Pro,表明其发展轨迹大约落后最先进的前沿模型三到六个月」。
价格:最大的卖点
- V4-Pro 每百万输出 token
- $3.48
- V4-Flash 每百万输出 token
- $0.28
- OpenAI(同等用量)
- $30
- Anthropic(同等用量)
- $25
来源:《财富》2026-04-24 报道。价格为发布时数据,此后 DeepSeek 已调整产品线和价格。
《财富》指出,这与行业趋势相反:当时 OpenAI 和 Anthropic 都在提价或收紧用量限制。DeepSeek 还表示,随着华为扩大昇腾 950 芯片的产量,V4-Pro 的价格有望在年内进一步下调。
与华为芯片的关系
V4 发布当天,华为宣布其昇腾(Ascend)AI 芯片「全面支持」DeepSeek 的模型。据《财富》报道,DeepSeek 表示训练新模型时用到了昇腾处理器;为华为代工昇腾芯片的中芯国际,股价当天在香港上涨 10%,而 DeepSeek 的两家国内竞争对手 MiniMax 和 Knowledge Atlas 股价下跌超过 9%。
发布之后:V4 很快被替换
V4 的更新节奏很快,现在通过 DeepSeek 使用的已经不是 4 月那个版本了:
- 14 月 24 日V4-Pro 和 V4-Flash 预览版发布并开源。
- 27 月 24 日旧的 API 名称 deepseek-chat 和 deepseek-reasoner 停用(此前已转由 V4-Flash 处理)。
- 37 月 31 日 / 8 月 13 日据维基百科,V4-Flash 和 V4-Pro 的正式版先后发布。
- 49 月 10 日V4.1-Flash 上线:总参数 5520 亿,原生支持看图,DeepSeek 称其多项测试成绩超过 V4-Pro,API 降价。
- 59 月 14 日起所有 V4-Pro 请求改由 V4.1-Flash 处理,按 Flash 价格收费,直到 V4.1-Pro 推出。
来源:DeepSeek 官方 API 文档与发布说明;维基百科
需要注意的地方
- 分数和对比都是 DeepSeek 自己公布的,对手模型的分数也是 DeepSeek 测或引用的,测试条件不一定相同。对比对象是 4 月时的模型(如 Claude Opus 4.6、GPT-5.4),并非现在最新的型号。
- 「预览版」:4 月发布的是预览版,正式版直到 7、8 月才推出,V4-Pro 在 9 月已开始被淘汰。
- 蒸馏争议仍在:据《财富》报道,V4 发布前一天,美国白宫科技顾问克拉齐奥斯指控中国 AI 公司进行「工业规模」的技术复制;OpenAI 和 Anthropic 也指控包括 DeepSeek 在内的中国公司进行「非法」蒸馏。中国外交部称这些说法「毫无根据」。
- 官方渠道:DeepSeek 在发布说明中特别提醒,只有其官方账号发布的消息才代表公司立场。
- 审查与隐私:DeepSeek 官方应用遵守中国的内容审查规定;美国国防部、澳大利亚政府等已禁止在政府设备上使用 DeepSeek 产品。下载权重自行部署则不经过 DeepSeek 的服务器。
普通人怎么用
- 网页和应用:在 chat.deepseek.com 或 DeepSeek 应用中免费使用,可选「专家模式」或「快速模式」。详见本站 DeepSeek 产品页。
- 开发者:DeepSeek API 兼容 OpenAI 和 Anthropic 的接口格式,可以直接接入 Claude Code 等工具。目前推荐的模型名是 deepseek-flash(即 V4.1-Flash)。
- 自己部署:V4 系列和 V4.1-Flash 的权重都可以在 Hugging Face 下载。
模型摘要
- 开发方
- DeepSeek
- 获取方式
- 开源权重;DeepSeek 应用与 API
- 规格
- V4-Pro:总参数 1.6 万亿,激活 490 亿。V4-Flash:总参数 2840 亿,激活 130 亿。上下文 100 万 token。
数据口径:DeepSeek 官方发布说明