HyperAIHyperAI

Command Palette

Search for a command to run...

DeepSeek-V4:迈向高效百万 Token 上下文智能

一键部署 DeepSeek-V4-Flash-0731

跳转至 Notebook

摘要

我们发布了 DeepSeek-V4 系列的预览版本,包含两个强大的混合专家(MoE)语言模型——DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 的上下文长度。DeepSeek-V4 系列在架构和优化方面引入了多项关键升级:(1)混合注意力架构,结合了压缩稀疏注意力(CSA)和重度压缩注意力(HCA),以提升长上下文效率;(2)流形约束超连接(mHC),增强了传统的残差连接;(3)Muon 优化器,用于实现更快的收敛和更高的训练稳定性。我们在超过 32T 多样化且高质量的 Token 上对两个模型进行了预训练,随后通过全面的后训练流程释放并进一步增强其能力。DeepSeek-V4-Pro-Max 是 DeepSeek-V4-Pro 的最大推理努力模式,重新定义了开放模型的最先进水平,在核心任务上超越了其前代模型。同时,DeepSeek-V4 系列在长上下文场景中表现出极高的效率。在百万 Token 上下文设定下,与 DeepSeek-V3.2 相比,DeepSeek-V4-Pro 的单 Token 推理 FLOPs 仅为其 27%,KV 缓存仅为其 10%。这使我们能够常规地支持百万 Token 上下文,从而使长周期任务和进一步的测试时扩展更加可行。

一句话总结

DeepSeek-AI 推出了 DeepSeek-V4-Pro(1.6T1.6\text{T}1.6T 参数,49B49\text{B}49B 激活)和 DeepSeek-V4-Flash(284B284\text{B}284B 参数,13B13\text{B}13B 激活),这两款混合专家模型采用混合注意力架构,融合了压缩稀疏注意力和重度压缩注意力、流形约束超连接以及 Muon 优化器,支持百万 token 上下文,而单 token 推理 FLOPs 仅为 DeepSeek-V3.2 的 27%27\%27%,KV 缓存仅为其 10%10\%10%,从而重新定义了开放模型的最先进水平。

核心贡献

  • DeepSeek-V4 系列引入了混合注意力架构,结合了压缩稀疏注意力和重度压缩注意力,在一百万 token 上下文下,将单 token 推理 FLOPs 降至 DeepSeek-V3.2 的 27%,KV 缓存降至 10%。
  • DeepSeek-V4-Pro-Max 在知识基准上大幅超越先前的开源模型,并在推理性能上接近前沿闭源模型,从而重新定义了开放模型的最先进水平。
  • 该架构融合了流形约束超连接以增强残差连接,以及 Muon 优化器以加速收敛,两个模型均在超过 32T token 的数据上进行了预训练。

引言

大型语言模型中测试时扩展的日益普及推动了性能的显著提升,但标准注意力的二次复杂度为 agentic 工作流、跨文档分析和其他长周期任务所需的超长上下文带来了严重瓶颈。包括早期 DeepSeek 版本在内的先前架构,在上下文长度向数百万 token 延伸时难以保持效率,限制了实际部署和进一步的扩展收益。

作者推出了 DeepSeek-V4 系列,这是两款模型(DeepSeek-V4-Pro 具有 49B 激活参数,DeepSeek-V4-Flash 具有 13B 激活参数)的预览,旨在打破这一效率障碍。其核心贡献是一种混合注意力机制,结合了压缩稀疏注意力和重度压缩注意力,该机制在序列维度上大幅压缩 KV 缓存,同时保持建模保真度。配合流形约束超连接、Muon 优化器以及广泛的基础设施优化(融合 MoE 内核、FP4 量化感知训练、异构 KV 缓存存储),该架构原生支持一百万 token 上下文,而推理 FLOPs 仅为前代模型的 10%,KV 缓存大小仅为 7%。

数据集

作者在 DeepSeek-V3 所用数据的基础上构建了 DeepSeek-V4 预训练语料库,重点关注更高的多样性、更好的质量和更长的有效上下文。最终语料库超过 32 万亿 token,涵盖多个高质量类别。

数据集构建的关键细节:

  • 网络数据:额外的过滤移除了批量自动生成和模板化内容,以降低模型崩溃的风险。
  • 数学与编程:这些仍是核心组成部分。通过在中期训练阶段引入 agentic 数据,编码能力得到进一步增强。
  • 多语言数据:构建了更大的多语言语料库,以改善不同文化中长尾知识的覆盖。
  • 长文档:特别强调科学论文、技术报告和其他具有独特学术价值的材料。
  • Tokenization:tokenizer 继承了 DeepSeek-V3 的 128K 词汇量,并添加了一些用于上下文构建的特殊 token。token 拆分和 Fill-in-Middle (FIM) 策略也得以保留。
  • 打包与掩码:来自不同来源的文档被打包成适当的序列,以最小化样本截断。与 DeepSeek-V3 不同,预训练使用了样本级注意力掩码。

预处理后的数据直接用于模型预训练,来源混合和打包策略旨在支持更长的上下文学习和跨领域稳定训练。

方法

DeepSeek-V4 系列保留了先前迭代中建立的基础 Transformer 架构和多 token 预测 (MTP) 模块,同时引入了重大架构升级,以增强长上下文效率和训练稳定性。整体框架集成了混合注意力机制、增强的残差连接和优化的混合专家 (MoE) 组件。

作者在前馈网络 (FFN) 中采用了 DeepSeekMoE 范式,利用细粒度路由专家和共享专家。一项关键修改是将计算亲和度得分的激活函数从 Sigmoid 改为 Sqrt(Softplus())\text{Sqrt}(\text{Softplus}(\cdot))Sqrt(Softplus())。为了在无辅助损失的情况下确保负载均衡,采用了无辅助损失策略,并辅以序列级平衡损失。此外,初始 Transformer 块使用哈希路由,目标专家由基于输入 token ID 的预定义哈希函数确定。

为了增强相邻 Transformer 块之间的常规残差连接,模型引入了流形约束超连接 (mHC)。标准超连接 (HC) 将残差流宽度扩展 nhcn_{\text{hc}}nhc 倍,使残差宽度与实际隐藏大小解耦。更新规则表述为:

Xl+1=BlXl+ClFl(AlXl)X_{l+1} = B_l X_l + C_l \mathcal{F}_l(A_l X_l)Xl+1=BlXl+ClFl(AlXl)

其中 Fl\mathcal{F}_lFl 表示层函数。mHC 的核心创新在于将残差映射矩阵 BlB_lBl 约束在双随机矩阵(Birkhoff 多面体)M\mathcal{M}M 的流形上。这一约束确保谱范数 Bl2\|B_l\|_2Bl2 不超过 1,使残差变换非扩张,并增强前向和后向传播中的数值稳定性。参数动态生成,并使用 Sinkhorn-Knopp 算法投影到流形上。

为了解决超长上下文中注意力的计算瓶颈,作者设计了一种混合注意力架构,结合了压缩稀疏注意力 (CSA) 和重度压缩注意力 (HCA)。

CSA 压缩键值 (KV) 缓存并应用稀疏注意力。它首先使用可学习的压缩权重和位置偏置,将每 mmm 个 token 压缩为一个条目。然后,“闪电索引器”选择 top-kkk 个压缩 KV 条目用于核心注意力。核心注意力以多查询注意力 (MQA) 方式运行,共享键和值,随后进行分组输出投影以管理计算成本。

HCA 采用更激进的压缩策略,将每 mm'm 个 token(其中 mmm' \gg mmm)的 KV 缓存合并为一个条目,且不进行重叠压缩。与 CSA 不同,HCA 不使用稀疏选择;而是对重度压缩的条目执行密集注意力。两种机制都包含一个补充的滑动窗口注意力分支,以有效保持因果性和建模局部依赖。

这种混合方法的效率非常显著。通过利用混合精度存储(RoPE 维度使用 BF16,其他使用 FP8)以及闪电索引器使用 FP4 精度,KV 缓存大小大幅减小。

为了支持 MoE 层的大规模,作者提出了一种细粒度专家并行 (EP) 方案。在标准 EP 中,通信延迟常常成为性能瓶颈。作者观察到,在 DeepSeek-V4 中,单个 MoE 层内的计算时间超过通信时间。他们将通信和计算融合到一个流水线内核中。专家被拆分并调度为“波次”。一旦某个波次的通信完成,计算立即开始,从而允许下一波次的 token 传输和当前波次的结果发送并发进行。

在优化方面,模型对大多数模块使用 Muon 优化器,利用混合 Newton-Schulz 迭代进行正交化。这涉及一个两阶段过程:快速收敛,然后精确稳定奇异值。

在后训练阶段,作者用在线策略蒸馏 (OPD) 替代了混合强化学习阶段。该方法将多个特定领域教师模型的能力合并到一个统一的学生模型中。目标函数最小化学生和教师分布之间的 KL 散度:

LOPD(θ)=i=1NwiDKL(πθπEi)\mathcal{L}_{\text{OPD}}(\theta) = \sum_{i=1}^{N} w_i \cdot \text{D}_{\text{KL}}(\pi_\theta \parallel \pi_{E_i})LOPD(θ)=i=1NwiDKL(πθπEi)

为确保稳定的梯度估计,该框架采用全词汇 logit 蒸馏而非 token 级估计,缓存教师隐藏状态以动态重构 logit,并通过高效的教师调度管理内存。

实验

评估设置涵盖预训练和后训练阶段,在预训练阶段评估基座模型在世界知识、语言理解、编码、数学和长上下文基准上的表现,而后训练评估则涵盖知识、推理、agentic 任务以及包括中文写作、搜索和专业生产力在内的实际用例。DeepSeek-V4-Flash-Base 在大多数基准上优于更大的 DeepSeek-V3.2-Base,而 DeepSeek-V4-Pro-Base 几乎全面领先,在所有类别中创下新的性能高点。后训练后,DeepSeek-V4-Pro-Max 在知识和推理任务上为开源模型设立了新的最先进水平,在多项指标上与领先的闭源模型持平,并展示了强大的 agentic 和长上下文能力,尽管在某些知识基准和复杂指令遵循场景中仍落后于闭源模型。实际任务评估证实了 DeepSeek-V4-Pro 在中文写作、搜索增强问答、白领专业任务和代码 agent 场景中的优势,人类评估和内部指标凸显了相对于先前模型的实际收益以及与前沿系统的竞争力。

DeepSeek-V4-Flash-Base 在大多数基准上超越了更大的 DeepSeek-V3.2-Base,尽管其激活参数和总参数都少得多,尤其是在世界知识和长上下文任务中。DeepSeek-V4-Pro-Base 进一步实现了决定性的能力飞跃,在知识密集型评估中取得了巨大提升,并在推理、编码和长上下文理解方面全面改进,几乎全面领先于两个前代模型。DeepSeek-V4-Flash-Base 在广泛的基准上优于 DeepSeek-V3.2-Base,仅使用 13B 激活参数,而后者为 37B。DeepSeek-V4-Flash-Base 在 AGIEval 和 MMLU-Redux 等世界知识任务中表现出特别强的优势。DeepSeek-V4-Pro-Base 在几乎所有评估中取得了最高分,在 MMLU-Pro 等知识密集型基准上提升尤为显著。在 MMLU-Pro 上,DeepSeek-V4-Pro-Base 达到 73.5,大幅超过 DeepSeek-V3.2-Base 和 DeepSeek-V4-Flash-Base。DeepSeek-V4-Pro-Base 在知识、推理、编码和长上下文类别中全面超越了前代模型。

DeepSeek-V4 模型提供了三种推理模式,通过在 RL 训练期间应用不同的长度惩罚和上下文窗口,在速度和深度之间进行权衡。Non-think 模式为常规任务提供快速、直觉的响应,而 Think High 和 Think Max 则逐步分配更多的推理 token,用于复杂问题求解和探索能力边界。人类评估表明,Think Max 变体在任务完成和内容质量方面表现出色,能够预判用户意图并生成连贯的长篇输出,尽管它可能忽略特定的格式约束。三种推理模式(Non-think、Think High、Think Max)是通过在 RL 训练期间改变长度惩罚和上下文窗口产生的,从而得到不同的输出 token 长度。Non-think 模式针对日常例行任务和低风险决策提供快速、直觉的响应,而 Think High 则对复杂问题进行有意识的逻辑分析。Think Max 使用特殊的系统提示将推理推向极致,旨在探索模型推理能力的边界。人类评估发现,Think Max 变体在中文白领任务上优于竞品模型,主要优势在于任务完成和内容质量。该模型主动提供补充见解和自我验证步骤,并给出深度连贯的叙述,而非过于简单的要点。偶尔的弱点包括忽略特定的格式约束、难以将长文本压缩为简洁摘要,以及在视觉呈现设计方面有改进空间。

“Think Max”模式注入了一条系统提示指令,要求进行穷尽推理,迫使模型完全分解问题,针对边缘情况对逻辑进行压力测试,并记录每个中间步骤和被拒绝的替代方案。该指令在专家训练期间使用,配合不同的长度惩罚和上下文窗口,以塑造高投入的推理行为。人类评估表明,经过这种推理努力训练的模型在任务完成和内容质量方面表现出色,能够提供补充见解和自我验证,尽管它们有时可能过度思考或忽略特定的格式约束。注入的指令明确禁止走捷径,并要求彻底分解问题以解决根本原因。推理必须针对所有潜在路径、边缘情况和对抗场景进行压力测试。模型需要在思考过程中记录每个中间步骤、考虑过的替代方案和被拒绝的假设。人类评估表明,这种穷尽推理模式的优势在于能够预判隐含的用户意图并提供自我验证步骤。广泛推理的一个已知权衡是偶尔的过度思考,以及在将长输入压缩为简洁摘要方面能力下降。

一组特殊 token 支持在助手流水线中进行结构化的辅助任务,如网页搜索决策、标题生成、查询构建、权威性分类、领域识别和 URL 获取。这些 token 定义了清晰的格式边界,将用户提示与助手操作分开,支持受控的多步骤工作流。一个专用 token 判断用户提示是否需要网页搜索或可直接回答,并用思考标记将提示与助手决策分开。标题生成在第一个助手响应之后进行,使用一个放在句末标记之后的特殊 token 来生成简洁的对话标题。搜索查询构建由一个跟随用户提示的独特 token 处理,从而显式生成查询。单独的 token 对用户提示对来源权威性的需求进行分类,并识别其领域,每个都紧跟在用户提示之后。一个 token 结构从用户提示中提取 URL,并确定每个 URL 是否应被获取和阅读,使用提取的 URL 标记后跟一个阅读决策 token。

DeepSeek-V4-Pro-Max 在知识和推理基准上为开源模型设立了新的最先进水平。它在事实准确性上大幅领先先前的开放模型,并在代码推理上取得了最高分,甚至超越了闭源模型。然而,它在几个知识任务上仍落后于 Gemini-3.1-Pro。在 SimpleQA-Verified 上,DeepSeek-V4-Pro-Max 比所有开源基线高出约 20 个百分点,但仍落后于 Gemini-3.1-Pro。在 LiveCodeBench 上,DeepSeek-V4-Pro-Max 取得了最高分,超越了包括 Gemini-3.1-Pro 在内的开放和闭源模型。

评估比较了基座模型变体和推理模式,显示 DeepSeek-V4-Flash-Base 在大多数基准上优于更大的 DeepSeek-V3.2-Base,尽管其激活参数少得多,而 DeepSeek-V4-Pro-Base 则实现了决定性的飞跃,在知识密集型评估中取得巨大提升,并在推理、编码和长上下文任务中全面改进。三种推理模式 Non-think、Think High 和 Think Max 是通过在 RL 训练期间改变长度惩罚和上下文窗口产生的,其中 Think Max 使用穷尽推理指令,要求完全分解问题并进行压力测试,从而在任务完成和内容质量方面表现优异,但代价是偶尔过度思考。一组特殊 token 构建了辅助任务,如网页搜索决策、查询构建和权威性分类,以支持受控的多步骤工作流。在最终基准测试中,DeepSeek-V4-Pro-Max 在知识和推理方面为开源模型设立了新的最先进水平,在事实准确性上大幅领先,并在代码推理上取得最高分,尽管在几个知识任务上仍落后于 Gemini-3.1-Pro。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供