DeepSeek-V4 是一个面向复杂任务的大模型系列。目前提供两个主要版本:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。它们都支持 100 万 Token 的超长上下文,意味着一次可以处理更长的代码、更大的文档和更多参考资料。
简单理解,Pro 更像“高性能版”,更适合复杂推理、代码任务、研究分析和需要多步思考的工作;Flash 更像“高效率版”,速度更快、部署压力更小,适合希望兼顾效果和成本的场景。两者的区别,不只是参数大小,而是针对不同使用需求做了明确分工。
DeepSeek-V4 的价值,不只是“能看更长的内容”,而是能把长上下文真正用于实际工作。比如读完整个代码仓库、分析很长的合同、整理研究资料、或者在多个文档之间找答案。对用户来说,更直接的意义是:减少频繁切分资料、来回补充上下文的麻烦,让模型更容易保持前后一致。
DeepSeek-V4 系列在架构和优化方面进行了几项关键升级:
- 混合注意力架构: 一种结合压缩稀疏注意力(CSA)和重压缩注意力(HCA)的混合注意力机制,显著提升了长上下文的处理效率。在 100 万 Token 的上下文设置下,DeepSeek-V4-Pro 的单 Token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%,KV 缓存仅为 10%。
- 流形约束超连接 (mHC): mHC 被引入用于加强传统的残差连接,在保持模型表达能力的同时,增强跨层信号传播的稳定性。
- Muon 优化器: Muon 优化器被用于实现更快的收敛速度和更高的训练稳定性。
如果这些名词看起来有点技术化,可以把它们理解成三件事:第一,让模型在阅读超长内容时更省资源;第二,让模型在层数很深、规模很大时依然保持稳定;第三,让训练过程更快、更稳。对普通用户来说,最终体现出来的就是更长的上下文、更稳的输出,以及在复杂任务中更可靠的表现。
在训练层面,DeepSeek-V4 使用了超过 32T 的高质量数据,并通过多阶段训练继续强化代码、数学、知识问答和长文本理解等能力。可以把这个过程理解为:先分别把不同能力练强,再尽量整合到同一个模型里。这样做的好处是,模型不只是“单项分高”,而是在真实任务里更均衡、更全面。
从最终体验来看,V4 系列想解决的是一个很实际的问题:用户既希望模型聪明,也希望它快、稳、成本可控。DeepSeek-V4-Pro-Max 代表这一系列的性能上限,适合追求最强结果的场景;DeepSeek-V4-Flash-Max 则说明,即使是更轻量的版本,只要给足思考空间,也能在不少复杂任务上取得很强的效果。
DeepSeek V4型号
下面这张表可以快速看清各版本的定位:Base 更偏基础模型,Pro 更强、Flash 更轻更快。
| 模型 | 总参数量 | 激活参数量 | 上下文长度 | 精度 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-Base | 284B | 13B | 1M | FP8 Mixed |
| DeepSeek-V4-Flash | 284B | 13B | 1M | FP4 + FP8 Mixed* |
| DeepSeek-V4-Pro-Base | 1.6T | 49B | 1M | FP8 Mixed |
| DeepSeek-V4-Pro | 1.6T | 49B | 1M | FP4 + FP8 Mixed* |
*FP4 + FP8 Mixed: MoE 专家参数使用 FP4 精度;大多数其他参数使用 FP8。
推理模式
DeepSeek-V4 提供三种推理模式,可以把它理解成三种“思考深度”:
| 推理模式 | 特点 | 典型用例 | 响应格式 |
|---|---|---|---|
| Non-think | 快速、直观的响应 | 日常任务、低风险决策 | </think> 摘要 |
| Think High | 有意识的逻辑分析,较慢但更准确 | 复杂问题解决、规划 | <think> 思考过程 </think> 摘要 |
| Think Max | 将推理能力发挥到极致 | 探索模型推理能力的边界 | 特殊系统提示 + <think> 思考过程 </think> 摘要 |
如果只是日常问答、简单查询,Non-think 就足够;如果是写代码、做分析、写方案,Think High 会更稳;如果面对特别复杂的问题,Think Max 更适合。对用户来说,这不是抽象的技术选项,而是在“回答速度”和“回答质量”之间做选择。
DeepSeek模型对比
这部分主要看基础模型本身的能力差异,也就是不额外强调“深度思考模式”时,各版本的基本水平。
| 评测基准 (指标) | # Shots | DeepSeek-V3.2-Base | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base |
|---|---|---|---|---|
| 架构 | – | MoE | MoE | MoE |
| 激活参数量 | – | 37B | 13B | 49B |
| 总参数量 | – | 671B | 284B | 1.6T |
| 世界知识 | ||||
| AGIEval (EM) | 0-shot | 80.1 | 82.6 | 83.1 |
| MMLU (EM) | 5-shot | 87.8 | 88.7 | 90.1 |
| MMLU-Redux (EM) | 5-shot | 87.5 | 89.4 | 90.8 |
| MMLU-Pro (EM) | 5-shot | 65.5 | 68.3 | 73.5 |
| MMMLU (EM) | 5-shot | 87.9 | 88.8 | 90.3 |
| C-Eval (EM) | 5-shot | 90.4 | 92.1 | 93.1 |
| CMMLU (EM) | 5-shot | 88.9 | 90.4 | 90.8 |
| MultiLoKo (EM) | 5-shot | 38.7 | 42.2 | 51.1 |
| Simple-QA verified (EM) | 25-shot | 28.3 | 30.1 | 55.2 |
| SuperGPQA (EM) | 5-shot | 45.0 | 46.5 | 53.9 |
| FACTS Parametric (EM) | 25-shot | 27.1 | 33.9 | 62.6 |
| TriviaQA (EM) | 5-shot | 83.3 | 82.8 | 85.6 |
| 语言与推理 | ||||
| BBH (EM) | 3-shot | 87.6 | 86.9 | 87.5 |
| DROP (F1) | 1-shot | 88.2 | 88.6 | 88.7 |
| HellaSwag (EM) | 0-shot | 86.4 | 85.7 | 88.0 |
| WinoGrande (EM) | 0-shot | 78.9 | 79.5 | 81.5 |
| CLUEWSC (EM) | 5-shot | 83.5 | 82.2 | 85.2 |
| 代码与数学 | ||||
| BigCodeBench (Pass@1) | 3-shot | 63.9 | 56.8 | 59.2 |
| HumanEval (Pass@1) | 0-shot | 62.8 | 69.5 | 76.8 |
| GSM8K (EM) | 8-shot | 91.1 | 90.8 | 92.6 |
| MATH (EM) | 4-shot | 60.5 | 57.4 | 64.5 |
| MGSM (EM) | 8-shot | 81.3 | 85.7 | 84.4 |
| CMath (EM) | 3-shot | 92.6 | 93.6 | 90.9 |
| 长上下文 | ||||
| LongBench-V2 (EM) | 1-shot | 40.2 | 44.7 | 51.5 |
V4系列模型对比
这部分更适合看同一系列里,不同推理模式对结果的影响。简单说,就是看“给模型更多思考时间之后,能力会提升多少”。
| 评测基准 (指标) | V4-Flash Non-Think | V4-Flash High | V4-Flash Max | V4-Pro Non-Think | V4-Pro High | V4-Pro Max |
|---|---|---|---|---|---|---|
| 知识与推理 | ||||||
| MMLU-Pro (EM) | 83.0 | 86.4 | 86.2 | 82.9 | 87.1 | 87.5 |
| SimpleQA-Verified (Pass@1) | 23.1 | 28.9 | 34.1 | 45.0 | 46.2 | 57.9 |
| Chinese-SimpleQA (Pass@1) | 71.5 | 73.2 | 78.9 | 75.8 | 77.7 | 84.4 |
| GPQA Diamond (Pass@1) | 71.2 | 87.4 | 88.1 | 72.9 | 89.1 | 90.1 |
| HLE (Pass@1) | 8.1 | 29.4 | 34.8 | 7.7 | 34.5 | 37.7 |
| LiveCodeBench (Pass@1) | 55.2 | 88.4 | 91.6 | 56.8 | 89.8 | 93.5 |
| Codeforces (Rating) | – | 2816 | 3052 | – | 2919 | 3206 |
| HMMT 2026 Feb (Pass@1) | 40.8 | 91.9 | 94.8 | 31.7 | 94.0 | 95.2 |
| IMOAnswerBench (Pass@1) | 41.9 | 85.1 | 88.4 | 35.3 | 88.0 | 89.8 |
| Apex (Pass@1) | 1.0 | 19.1 | 33.0 | 0.4 | 27.4 | 38.3 |
| Apex Shortlist (Pass@1) | 9.3 | 72.1 | 85.7 | 9.2 | 85.5 | 90.2 |
| 长上下文 | ||||||
| MRCR 1M (MMR) | 37.5 | 76.9 | 78.7 | 44.7 | 83.3 | 83.5 |
| CorpusQA 1M (ACC) | 15.5 | 59.3 | 60.5 | 35.6 | 56.5 | 62.0 |
| 智能体能力 | ||||||
| Terminal Bench 2.0 (Acc) | 49.1 | 56.6 | 56.9 | 59.1 | 63.3 | 67.9 |
| SWE Verified (Resolved) | 73.7 | 78.6 | 79.0 | 73.6 | 79.4 | 80.6 |
| SWE Pro (Resolved) | 49.1 | 52.3 | 52.6 | 52.1 | 54.4 | 55.4 |
| SWE Multilingual (Resolved) | 69.7 | 70.2 | 73.3 | 69.8 | 74.1 | 76.2 |
| BrowseComp (Pass@1) | – | 53.5 | 73.2 | – | 80.4 | 83.4 |
| HLE w/ tools (Pass@1) | – | 40.3 | 45.1 | – | 44.7 | 48.2 |
| MCPAtlas (Pass@1) | 64.0 | 67.4 | 69.0 | 69.4 | 74.2 | 73.6 |
| GDPval-AA (Elo) | – | – | 1395 | – | – | 1554 |
| Toolathlon (Pass@1) | 40.7 | 43.5 | 47.8 | 46.3 | 49.0 | 51.8 |
顶尖模型对比
这部分用来观察 DeepSeek-V4-Pro-Max 和其他顶尖模型的大致位置。它不一定代表所有场景下的绝对胜负,但可以帮助用户快速判断:V4 在代码、长上下文和工具使用任务里,已经进入了非常有竞争力的区间。
| 评测基准 (指标) | Opus-4.6 Max | GPT-5.4 xHigh | Gemini-3.1-Pro High | K2.6 Thinking | GLM-5.1 Thinking | DS-V4-Pro Max |
|---|---|---|---|---|---|---|
| 知识与推理 | ||||||
| MMLU-Pro (EM) | 89.1 | 87.5 | 91.0 | 87.1 | 86.0 | 87.5 |
| SimpleQA-Verified (Pass@1) | 46.2 | 45.3 | 75.6 | 36.9 | 38.1 | 57.9 |
| Chinese-SimpleQA (Pass@1) | 76.4 | 76.8 | 85.9 | 75.9 | 75.0 | 84.4 |
| GPQA Diamond (Pass@1) | 91.3 | 93.0 | 94.3 | 90.5 | 86.2 | 90.1 |
| HLE (Pass@1) | 40.0 | 39.8 | 44.4 | 36.4 | 34.7 | 37.7 |
| LiveCodeBench (Pass@1) | 88.8 | – | 91.7 | 89.6 | – | 93.5 |
| Codeforces (Rating) | – | 3168 | 3052 | – | – | 3206 |
| HMMT 2026 Feb (Pass@1) | 96.2 | 97.7 | 94.7 | 92.7 | 89.4 | 95.2 |
| IMOAnswerBench (Pass@1) | 75.3 | 91.4 | 81.0 | 86.0 | 83.8 | 89.8 |
| Apex (Pass@1) | 34.5 | 54.1 | 60.9 | 24.0 | 11.5 | 38.3 |
| Apex Shortlist (Pass@1) | 85.9 | 78.1 | 89.1 | 75.5 | 72.4 | 90.2 |
| 长上下文 | ||||||
| MRCR 1M (MMR) | 92.9 | – | 76.3 | – | – | 83.5 |
| CorpusQA 1M (ACC) | 71.7 | – | 53.8 | – | – | 62.0 |
| 智能体能力 | ||||||
| Terminal Bench 2.0 (Acc) | 65.4 | 75.1 | 68.5 | 66.7 | 63.5 | 67.9 |
| SWE Verified (Resolved) | 80.8 | – | 80.6 | 80.2 | – | 80.6 |
| SWE Pro (Resolved) | 57.3 | 57.7 | 54.2 | 58.6 | 58.4 | 55.4 |
| SWE Multilingual (Resolved) | 77.5 | – | – | 76.7 | 73.3 | 76.2 |
| BrowseComp (Pass@1) | 83.7 | 82.7 | 85.9 | 83.2 | 79.3 | 83.4 |
| HLE w/ tools (Pass@1) | 53.1 | 52.0 | 51.6 | 54.0 | 50.4 | 48.2 |
| GDPval-AA (Elo) | 1619 | 1674 | 1314 | 1482 | 1535 | 1554 |
| MCPAtlas Public (Pass@1) | 73.8 | 67.2 | 69.2 | 66.6 | 71.8 | 73.6 |
| Toolathlon (Pass@1) | 47.2 | 54.6 | 48.8 | 50.0 | 40.7 | 51.8 |
综合来看,DeepSeek-V4 的特点不是只在某一个榜单上领先,而是在代码、长上下文、推理和工具使用这些更接近真实工作的任务里都表现出较强竞争力。对于普通用户来说,可以把它理解为:它不只是一个“聊天模型”,而是更适合处理复杂工作流的模型。
© 版权声明
若无特殊声明,本站所有文章版权均归灵境网原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。
相关文章
暂无评论...