HyperAIHyperAI

Command Palette

Search for a command to run...

KIMI K3:开放前沿智能

摘要

我们推出 Kimi K3,一个拥有 2.8T 参数的混合专家模型,其激活参数为 1040 亿,具备原生视觉能力,并支持 100 万 token 的上下文窗口。Kimi K3 基于 Kimi Delta 注意力与注意力残差构建,改善了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE(每个 token 有效激活 896 个路由专家中的 16 个)以及精炼的训练与数据方案,这些进步使整体扩展效率相比 Kimi K2 提升了约 2.5 倍。后训练阶段重点突出了在通用、智能体和编程领域的强化学习以及多种推理努力级别,实现了组合泛化和稳健的长程执行。在 2.8T 规模下,Kimi K3 得到了多个领域基础设施进步的支持:针对 KDA 的算法-系统协同设计、具有高效内存管理的完美均衡专家并行训练、支持持久化 rollout 与沙箱状态的百万 token 智能体强化学习,以及部署创新。广泛的评估表明,Kimi K3 在长程编程、智能体、知识、推理和视觉任务上达到了前沿水平。尽管其整体性能仍落后于最强大的闭源模型,即 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 在我们评估套件中持续优于其他开源和闭源模型。我们发布完整的 Kimi K3 模型权重,以促进未来研究,并加速前沿智能的更广泛部署与应用。

一句话总结

Kimi 团队发布并开源了 Kimi K3,一个 2.8T2.8\,\text{T}2.8T 参数的混合专家模型,拥有 104B104\,\text{B}104B 激活参数、原生视觉能力以及 1M1\,\text{M}1M-token 上下文窗口;该模型利用 Kimi Delta Attention、注意力残差和 Stable LatentMoE,相比 K2 实现了约 2.5 倍的扩展效率提升,并通过在通用、agentic 和编程领域使用强化学习达到了前沿水平的性能,但落后于 Claude Fable 5 和 GPT-5.6 Sol。

核心贡献

  • Kimi K3 是一个 2.8T 参数的混合专家模型,具有原生视觉能力和 1M-token 上下文窗口,融合了 Kimi Delta Attention、注意力残差以及 Stable LatentMoE(896 个专家,每个 token 激活 16 个),相比 Kimi K2 在整体扩展效率上提升了约 2.5 倍。
  • 该模型在长时程编程、agentic 和推理任务上,通过多个努力级别进行强化学习,并将领域和努力程度专用的策略通过多教师在线策略蒸馏整合为统一模型,实现了组合泛化和稳健的长时程执行。
  • 完整的模型权重公开发布,论文详细介绍了基础设施协同设计,例如用于 2.8T 参数预训练的融合 KDA 内核和均衡专家并行训练(MoonEP),以及一个支持可恢复沙箱的协同 RL 系统,用于百万 token 级别的 agentic 轨迹。

引言

作者利用了大语言模型的双重扩展轴:传统的轴是使用更多数据训练更大的模型,新兴的轴则是通过推理和 agentic 行为扩展测试时计算。近来,开源模型在测试时扩展方面进展迅速,但其规模一直停滞在约 1 万亿参数,这带来了进一步进展趋同、而与前沿闭源系统的差距却不断扩大的风险。为解决此问题,作者提出 Kimi K3,一个 2.8 万亿参数的混合专家模型,具备原生多模态视觉、1040 亿激活参数和 1 百万 token 上下文窗口。架构创新(Kimi Delta Attention、注意力残差和 Stable LatentMoE)加上精炼的数据和配方,使其扩展效率相比前代提升了 2.5 倍,而通过编程、agentic、推理、知识和视觉领域的强化学习后训练,将多努力级别的测试时扩展整合为一个统一的模型。最终成果是一个开放的前沿模型,同时将两个扩展轴推向了兆参数和兆上下文区间。

数据集

作者为预训练和后训练整合了一个多来源数据集,并进行了大量过滤、改写和合成增强,以覆盖文本、视觉、长上下文和专用任务领域。

预训练数据

  • 文本语料库:四个领域——网页文本、代码、数学和知识。每个领域都经过基于规则的启发式清理、分类器质量评分和去重。通过在较小模型上的消融研究设定了特定领域的采样率。知识和数学数据被进一步改写:使用多样化的风格/视角提示、分块自回归生成,并对照原始文档进行保真度验证。
  • 视觉语料库:基于先前 Kimi 模型的分类法,结合开源集合和内部管线进行过滤、合成和去重。涵盖了带标注的图像、图文交错文档、OCR、感知、视频和视觉编程。坐标监督以绝对和归一化两种格式提供,以实现对分辨率鲁棒的定位。此外,一个大规模的程序化多模态集合将代码片段与渲染后的视觉效果——SVG、3D 资产、网页、游戏画面和 CAD 原理图——耦合起来。

长上下文数据

  • 自然长文档和视频:通过专用管线过滤——精确和模糊去重、基于视频帧的感知哈希、基于分类器的质量过滤和结构验证。由于真正长且连贯的内容很稀少,这些数据被上采样,以避免被短序列淹没。
  • 合成长上下文序列:多模态文档和子任务被仔细排列和拼接,使得解决一个嵌入任务需要关注分散在 1M-token 上下文中的信息。这迫使注意力机制学习真正的长程模式。

后训练 RL 任务数据集

  • 知识图谱引导任务:通过网页规模探索,构建了一个 agentic、自进化的分层知识图谱。Agent 递归地扩展粗粒度的种子概念,并与现有节点进行去重。在不同粒度上采样的节点——结合祖先上下文——生成网页查询;检索到的真实世界材料随后由合成 agent 组合成多样化的训练任务。
  • 内核优化任务:从单算子内核到融合大型内核的大量任务套件,来源于高质量 GitHub 仓库(例如 Flash Linear Attention)。涵盖 CUDA、Triton、CuTe DSL、Gluon、ThunderKittens、TileLang 以及多种 GPU 架构/数值格式(BF16、FP8、FP4)。奖励基于正确性和性能,并配有黑客检测系统以惩罚奖励作弊策略。
  • 个人助理任务:对应用程序(Gmail、Notion、Slack、Canvas)的真实模拟实现,使得可复现的长时程工作流成为可能。受 HR、法律和金融启发的场景涉及持久环境,在模拟天数内包含数十个相互依赖的事件,需要数千次工具调用。初始工作区由搜索网络获取参考资料的 agent 构建。
  • 网页开发任务:专家策划的任务,从一行场景描述到全栈应用。涵盖网站、交互式游戏、3D/WebGL、数据可视化、SVG 等。在容器化沙箱中运行;奖励结合了确定性功能检查(构建成功、结构/像素相似度)和基于模型对源代码及输出制品进行评判。

数据使用方式

  • 文本和视觉语料库混合用于预训练,采样比例在小模型上优化。
  • 长上下文数据在冷却阶段通过渐进式课程(上下文窗口从 256K 增长到 1M token)引入,通过上采样和合成序列确保模型学习长程依赖。
  • 后训练任务集驱动强化学习;每个任务集提供自动化或基于 LLM 的奖励信号,以训练 agentic 和专业化能力。

方法

Kimi K3 架构旨在沿三个互补维度扩展信息流:序列长度、网络深度和模型宽度。沿序列维度,混合注意力在每个块中结合三个 Kimi Delta Attention (KDA) 层与一个门控多头潜在注意力 (Gated MLA) 层。沿深度维度,注意力残差 (AttnRes) 允许每个模块从嵌入层和前置块中选择性地检索表示。沿宽度维度,每个注意力层后接一个 Stable LatentMoE 层,执行稀疏通道混合。对于原生视觉,MoonViT-V2 编码图像和视频,将视觉特征映射到共享嵌入空间。加上 Per-Head Muon,这些组件提供了一个统一的架构,用于跨 token、层和通道扩展信息流。

Kimi K3 使用线性注意力和全局注意力的逐层混合。每个块包含 3 个 KDA 层和 1 个门控 MLA 层,混合比例为 3:1。主干网络末端额外放置一个门控 MLA 层。KDA 通过通道级遗忘门扩展了 delta 规则循环。对于隐藏状态序列 xtx_txt,循环状态 StS_tSt 更新如下:

St=(Iβtktkt)Diag(αt)St1+βtktvt,o~t=StqtS_t = (I - \beta_t k_t k_t^\top) \text{Diag}(\alpha_t) S_{t-1} + \beta_t k_t v_t^\top, \quad \tilde{o}_t = S_t^\top q_tSt=(Iβtktkt)Diag(αt)St1+βtktvt,o~t=Stqt

其中 αt\alpha_tαt 是通道级单步保留因子,βt\beta_tβt 控制 delta 规则的写入强度。为解决分块并行形式中的数值溢出问题,Kimi K3 将衰减 logits zthz_t^hzth 到每步对数衰减 gthg_t^hgth 的映射进行了更改。Kimi K3 不使用无界的负 Softplus 映射,而是使用缩放 sigmoid 函数来从下方界住对数衰减:

gth=gminSigmoid(eAhzth)(gmin,0)dk,αth=exp(gth)(egmin,1)dkg_t^h = g_{\min} \text{Sigmoid}(e^{A_h} z_t^h) \in (g_{\min}, 0)^{d_k}, \quad \alpha_t^h = \exp(g_t^h) \in (e^{g_{\min}}, 1)^{d_k}gth=gminSigmoid(eAhzth)(gmin,0)dk,αth=exp(gth)(egmin,1)dk

其中 gmin=5g_{\min} = -5gmin=5。这个有限范围使得对角和非对角分块都可以使用密集的 Tensor Core 矩阵乘法,消除了位置对对角路径。

最后,KDA 应用一个输入依赖的全秩输出门:

yt=Wo[Sigmoid(Wgxt)RMSNorm(o~t)]y_t = W_o [\text{Sigmoid}(W_g x_t) \odot \text{RMSNorm}(\tilde{o}_t)]yt=Wo[Sigmoid(Wgxt)RMSNorm(o~t)]

门控 MLA 将键值表示压缩为低维潜在向量 ct=Wcxtc_t = W_c x_tct=Wcxt。与以往版本不同,Kimi K3 对所有 MLA 层应用无位置编码 (NoPE),依赖 KDA 进行位置敏感的混合。它还通过一个输入依赖的、通道级全秩输出门来增强 MLA:

yt=Wo[Sigmoid(Wgxt)o~t]y_t = W_o [\text{Sigmoid}(W_g x_t) \odot \tilde{o}_t]yt=Wo[Sigmoid(Wgxt)o~t]

标准残差连接将所有先前信息压缩为深度上的单一状态。注意力残差 (AttnRes) 将注意力方法应用于深度:每一层从所有前置层中选择性地检索表示。对于每一层 lll,定义一个层特定的可学习伪查询 ql=wlq_l = w_lql=wl,键和值从 token 嵌入和前置层输出中导出。注意力权重遵循带有 RMSNorm 的 softmax 核,以防止大幅度输出主导计算。为减少内存开销,层被划分为块。在块内,层输出通过求和缩减为单一表示。跨块时,在块级表示上应用完整的注意力机制。

LatentMoE 将全模型宽度与路由专家宽度分离,允许 Kimi K3 将通道混合扩展到 896 个路由专家,每个 token 激活 16 个专家。共享专家直接处理输入,而路由路径将其投影到紧凑的潜在空间,分派给选定专家,并将聚合结果映射回来:

u=iTk(x)piEirouted(Wx),y=j=1NsEjshared(x)+WRMSNorm(u)u = \sum_{i \in \mathcal{T}_k(x)} p_i E_i^{\text{routed}}(W^\downarrow x), \quad y = \sum_{j=1}^{N_s} E_j^{\text{shared}}(x) + W^\uparrow \text{RMSNorm}(u)u=iTk(x)piEirouted(Wx),y=j=1NsEjshared(x)+WRMSNorm(u)

为抑制路由分支中的激活爆炸,Kimi K3 在专家聚合和上投影之间插入 RMSNorm。它还提出了 Sigmoid Tanh Unit GLU (SiTU-GLU),对 Swish 门控的线性因子以及上分支分别应用平滑上限:

SiTU-GLU(x)=[β1tanh(Wgx/β1)Sigmoid(Wgx)][β2tanh(Wux/β2)]\text{SiTU-GLU}(x) = [\beta_1 \tanh(W_g x / \beta_1) \odot \text{Sigmoid}(W_g x)] \odot [\beta_2 \tanh(W_u x / \beta_2)]SiTU-GLU(x)=[β1tanh(Wgx/β1)Sigmoid(Wgx)][β2tanh(Wux/β2)]

对于负载均衡,Kimi K3 采用分位数均衡 (QB),根据与目标负载匹配的路由器分数分位数设置每个专家的偏置。更新规则为:

b^j(t+1)quantile1k/n(s:,jα(t)),b(t+1)b^(t+1)mean(b^(t+1))1\hat{b}_j^{(t+1)} \leftarrow -\text{quantile}_{1-k/n}(s_{:,j} - \alpha^{(t)}), \quad b^{(t+1)} \leftarrow \hat{b}^{(t+1)} - \text{mean}(\hat{b}^{(t+1)}) \mathbf{1}b^j(t+1)quantile1k/n(s:,jα(t)),b(t+1)b^(t+1)mean(b^(t+1))1

Kimi K3 是原生多模态的。视觉编码器 MoonViT-V2 完全从零开始通过下一 token 预测进行训练,而不是从对比预训练模型初始化。这种方法产生了更稳定的优化过程和更低的梯度范数。

MoonViT-V2 是一个 27 层的视觉 Transformer,采用 RMSNorm 并移除偏置项。视觉输入被编码并通过轻量级 MLP 投影器映射到 LLM。注意力被分解为帧内空间和帧间时间传递,并通过像素重组操作减少视觉 token 的数量。

Kimi K3 采用 Muon 作为矩阵参数的优化器。对于注意力投影,它使用逐头变体,沿头维度划分动量矩阵并分别对每个头的块进行正交化,从而均衡各头的更新尺度。该模型在涵盖文本和视觉领域的精选语料库上进行预训练。扩展律研究表明,架构改进相比 Kimi K2 在整体扩展效率上带来了约 2.5 倍的提升。

训练配方采用原生多模态策略,语言和视觉从一开始就联合优化。模型使用余弦学习率调度,配合 1% 的线性预热和 0.1 的权重衰减。预训练开始时上下文长度为 8k token,后来扩展到 64k token。

实验

评估设置涵盖了架构和训练改进的扩展律重新调优、在可验证的多步任务上的 agentic 强化学习,以及全面的公开、内部、网络安全和第三方基准测试。扩展律研究证实,架构、数据和训练变更带来了 2.5 倍的效率提升,并且在公平的超参数优化下,余弦衰减始终优于 WSD。在公开基准上,Kimi K3 在编程和 agentic 领域与最强的闭源模型相媲美,同时提供更优的成本效率;内部评估则突出了强大的编排和深度研究能力,以及有形但不完整的漏洞利用开发能力。案例研究进一步展示了该模型自主执行复杂现实世界工作的能力,例如 GPU 内核优化、编译器编写、芯片设计和多天知识任务。

SiTU-GLU 通过应用基于 tanh 的饱和来修改类 GLU 激活的门控和上分支,产生有界的标量响应。它在原点附近紧密跟踪 SwiGLU,同时对于大的正输入,将输出限制在其两个饱和参数的乘积,这与保持无界的 SwiGLU 不同。对于大 x,SiTU-GLU 保持在界 |f(x)| ≤ β₁β₂ = 100 内,而 SwiGLU 则无限增长。插图显示 SiTU-GLU 和 SwiGLU 在原点附近几乎重合,保留了小输入行为。

与 Kimi K2 相比,Kimi K3 将深度提升了 52%,总参数量提升了 167%,而激活参数量增长了 220%。混合专家层增加了潜在维度,并将每个专家的隐藏维度提高了 50%,报告称整体扩展效率提升了 2.5 倍。层数从 61 增加到 93(↑52%),总参数从 1.04T 增加到 2.78T(↑167%),激活参数从 32.6B 增加到 104.2B(↑220%)。引入了 3584 的潜在 MoE 维度(0.5× 隐藏尺寸),每个专家的隐藏维度从 2048 增加到 3072(↑50%)。这些架构变化共同带来了相比 Kimi K2 约 2.5 倍的扩展效率提升,该结果在留存的 OOD 验证数据上测得。

Kimi K3 在基准测试中紧追最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,同时始终优于 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。它在编程和 agentic 任务中表现出色,在多个基准上取得最高分,但在研究级推理和 Elo 评级的知识工作套件上落后。Kimi K3 在 ProgramBench 和 SWE-Marathon 上取得了最佳分数(领先 Claude Fable 5 7 分),在 Terminal-Bench 2.1 上几乎与 GPT-5.6 Sol 持平,在 FrontierSWE 上排名第二,仅次于 Claude Fable 5。在 agentic 套件中,它在 BrowseComp、DeepSearchQA 和 MCPMark-Verified 上设立了新的最高水平,并在 CorpFin v2 和 OSWorld-Verified 上与领先者相差不到 0.2 分。

Kimi K3 在内部基准上展示了具有竞争力的编程和 agent 能力,常常匹敌或超越闭源和开放权重模型。其性能延伸至自主的、长时程的工程任务,例如构建编译器栈和设计芯片,在数小时内完成多天的项目。在 Kimi Code Bench 2.0 上,使用 Claude Code 工具的 Kimi K3 (max) 得分为 73.7,仅落后顶级闭源模型 3.2 分,而该模型出现了 13 次回退和 1 次拒绝。在编程体验基准测试中,Kimi K3 配合 Claude Code 达到 59.9 分,实际上与最佳闭源模型 (59.8) 持平,并优于 Claude Fable 5 (58.0) 和 Claude Opus 4.8 (53.3)。Kimi K3 在单次 48 小时的运行中自主构建了一个端到端编译器,并设计了一个推理芯片原型,在 4 mm² 的面积预算内以 100 MHz 的频率完成时序收敛。

在网页开发输出的盲法专家评估中,Kimi K3 总体上优于 Claude Opus 4.8,最大的胜出优势出现在 3D、WebGL 和着色器任务中。该模型在网站和 UI 克隆方面也处于领先地位,而在游戏方面则显示出更接近但仍为正面的优势。Kimi K3 对 Claude Opus 4.8 的总体胜率为 58.6%,仅有 27.6% 的败率,净胜优势为 31.0 个百分点。最强的相对表现出现在 3D/WebGL/着色器提示中,Kimi K3 在 72.7% 的比较中获胜,仅 13.6% 落败,胜负差为 59.1 个百分点。

SiTU-GLU 激活通过 tanh 饱和引入有界输出,在保持原点附近行为的同时防止无界增长。扩展 Kimi K3 带来了 2.5 倍的效率提升,该模型在编程、agentic 和长时程工程基准上始终匹配或超越领先的闭源模型。在网页开发盲法评估中,Kimi K3 优于 Claude Opus 4.8,在 3D、WebGL 和着色器任务中优势最大。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供