HyperAIHyperAI

Command Palette

Search for a command to run...

KIMI K3:开放前沿智能

摘要

我们推出 Kimi K3,一个拥有 2.8T 参数的混合专家模型,其激活参数为 1040 亿,具备原生视觉能力与 100 万 token 的上下文窗口。Kimi K3 基于 Kimi Delta 注意力与注意力残差构建,改善了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE(每个 token 有效激活 896 个路由专家中的 16 个)以及精炼的训练与数据配方,这些进展使整体扩展效率相较 Kimi K2 提升约 2.5 倍。后训练阶段着重于通用、智能体和编程领域的强化学习以及多种推理努力水平,实现了组合泛化与稳健的长程执行。在 2.8T 规模下,Kimi K3 得到了多个领域基础设施进步的支持:针对 KDA 的算法-系统协同设计、具有高效内存管理的完美均衡专家并行训练、支持持久化 rollout 与沙箱状态的百万 token 智能体强化学习,以及部署创新。广泛评估表明,Kimi K3 在长程编程、智能体、知识、推理和视觉任务上达到了前沿水平。尽管其整体性能仍落后于最强大的闭源模型,即 Claude Fable 5 和 GPT-5.6 Sol,但 Kimi K3 在我们评估套件中持续优于其他开源和闭源模型。我们发布完整的 Kimi K3 模型权重,以促进未来研究,并加速前沿智能的更广泛部署与应用。

一句话总结

Kimi 团队发布了 Kimi K3,一个拥有 2.8T 参数的混合专家模型,其中激活参数 1040 亿,具备原生的视觉能力与 100 万 token 的上下文窗口,并利用 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 实现相较 Kimi K2 约 2.5 倍的扩展效率;其后续的通用、agent 和编程任务的强化学习后训练达到前沿性能,超越了所有其他开源和闭源模型,仅次于 Claude Fable 5 与 GPT-5.6 Sol,且完整模型权重已公开。

核心贡献

  • 发布了 Kimi K3,一个 2.8T 参数的混合专家模型,具备原生视觉能力和 1M token 上下文窗口,完整权重公开;其采用的 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 将整体扩展效率较 Kimi K2 提升约 2.5 倍。
  • 在通用、agent 和编程领域进行多推理 effort 级别的强化学习,再通过多教师在线策略蒸馏,将不同领域和 effort 的专用策略统一为单一模型。
  • 基础设施包括 KDA 系统协同设计、实现均衡专家并行训练与内存高效管理的 MoonEP,以及能够维持百万 token agent 轨迹的、可恢复 microVM 沙盒式协同 RL 系统。

引言

大型语言模型的扩展沿着两条轴线演进:使用更多数据预训练更大模型,以及通过推理和 agent 强化学习增加测试时计算。虽然开源社区在测试时扩展上进展迅速,但其预训练模型依然停留在约一万亿参数级别,导致与闭源前沿系统的差距不断拉大。作者同时应对这两方面,推出 Kimi K3,一个开源的 2.8 万亿参数混合专家模型,每个 token 激活 1040 亿参数,并支持百万 token 上下文窗口。架构创新——Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE——改善了长序列混合、跨层信息流动与极端稀疏优化,带来相较上一代约 2.5 倍的扩展效率提升。以此为基础,进一步通过多 effort、长程的编程、推理及 agent 任务进行强化学习后训练,将多样化能力统一于单一模型,树立了新的开源前沿,同时缩小了与最强闭源系统之间的差距。

数据集

作者收集了预训练、长上下文冷却以及后训练强化学习等各阶段的训练数据。以下为主要数据类别、组成、处理方法及其用途的分解。

预训练数据

  • 文本语料:四个领域——网页文本、代码、数学与知识。
    • 过滤:每个领域分别采用基于规则的启发式清洗、分类器质量评分及去重。
    • 混合配比:通过在小模型上的消融实验确定各领域的采样率。
    • 知识与数学部分使用 Kimi K2 配方(风格多样的提示、逐块自回归生成、依据源数据的忠实度验证)进行改写。
  • 视觉语料:沿用 Kimi K2.5 的分类体系。
    • 来源:开源数据集加上内部合成、过滤与去重管线。
    • 内容:包含图像描述、图文交错文档、OCR、感知数据、视频及视觉编程数据。
    • 程序化多模态数据:大量代码片段与渲染视觉(SVG、3D 资源、网页、游戏、CAD 示意图)的配对数据。
    • 坐标监督同时以绝对坐标与归一化格式提供,以实现分辨率鲁棒的精准定位。
  • 用法:文本与视觉语料均在整个预训练过程中使用;领域混合与改写直接应用于训练 token。

长上下文冷却数据

  • 自然长文档与视频:源自私有的长篇幅内容。
    • 清洗:精确/模糊去重、视频帧的感知哈希、基于启发式与分类器的质量过滤、结构验证。
  • 合成长上下文数据
    • 通过排列拼接多模态文档与子任务构建,使完成一项任务需要关注分散在整个 1M token 上下文中的信息。
  • 混合配比:冷却阶段对长序列进行上采样,避免其分布被短序列淹没。
  • 用法:仅在冷却阶段使用,此时上下文窗口逐步从 256K 扩展到 1M token,以训练注意力机制处理真实的长程依赖。

后训练(RL)任务数据

后训练阶段使用多样化的合成任务套件;以下是关键数据集。

  • Kernel 优化任务

    • 大规模 GPU kernel 任务集,涵盖从单一算子 kernel 到融合 mega-kernel,数据来源于高质量的 GitHub 仓库(如 Flash Linear Attention)。
    • 覆盖多种 GPU 编程方式(CUDA、Triton、CuTe DSL、Gluon、ThunderKittens、TileLang)及数值格式(BF16、FP8、FP4)。
    • 奖励结合正确性检查(对照 PyTorch 参考实现)和性能评分(与专家实现比较),并配有反作弊系统以处罚奖励黑客策略。
    • 用于 RL 环境,以增强 GPU kernel 优化能力。
  • 知识图谱引导的任务合成

    • 构建一个自演化、层级组织的知识图谱,由 agent 从种子节点通过网页搜索递归扩展。节点代表知识密集与编程领域中的细粒度概念。
    • 通过在不同粒度采样节点,结合节点关键词与祖先上下文的网页查询获取现实材料,然后将材料组装成多种类型的训练任务来合成任务。
    • 用于 生成覆盖广泛、可控制分布的 RL 任务,针对专业化及代表性不足的知识。
  • 个人助理任务

    • 基于广泛使用的应用(Gmail、Notion、Slack、Canvas)的真实模拟实现,保留核心语义,无需外部 API。
    • 复杂的长程专业工作流(如 HR、法律、金融)在多个模拟日中展开,创建跨应用且包含数十个相互依赖事件的持续性环境。单次 rollout 可涉及数千次工具调用与数百万上下文 token。
    • 初始工作空间由 agent 自主搜索网络获取参考材料,并转换为与任务上下文一致的环境。
    • 用于 长程 agent 行为的 RL 训练,评估粒度到单个事件。
  • Web 开发任务

    • 一个专家策划的任务集,覆盖网站、交互游戏、3D/WebGL 场景、数据可视化、SVG 及全栈应用等各类产出。
    • 输入复杂度从单行场景描述到多段落规格不等。
    • 每个任务在隔离沙盒中运行;奖励包括确定性功能检查(构建成功、无错误运行、与参考复制品在结构/像素级的相似度)和基于模型的评判(源码审查、产出物交互)。对虚假实现予以惩罚。
    • 用于 多种 agent scaffold 的 RL,促进跨 scaffold 的泛化。

方法

Kimi K3 的架构旨在沿着序列长度、网络深度和模型宽度三个互补维度扩展信息流。结合改进的训练与数据配方,这些组件相较上一代带来约 2.5 倍的整体扩展效率提升。

如下方框架图所示,模型将这些维度整合为统一结构。

混合注意力 序列维度上,混合注意力在每个块中组合三层 Kimi Delta Attention (KDA) 和一层 Gated MLA。3:1 的混合比提供了高效的长上下文 token 混合机制,同时保留选择性高容量注意力。

KDA 通过一个逐通道的遗忘门扩展 delta 规则循环。为解决分块并行形式中的数值稳定性,作者用缩放 Sigmoid 替代无下界的负 Softplus 映射,使对数衰减具有下界:

gth=gminSigmoid(eAhzth)\pmb{g}_t^h = g_{\min} \operatorname{Sigmoid}(e^{A_h} \pmb{z}_t^h)gth=gminSigmoid(eAhzth)

这一有下界的衰减确保倒数缩放因子保持在 BF16 动态范围内,从而允许所有因果分块使用稠密的 Tensor Core 矩阵乘法,而非对对角线分块进行显式位置对计算。

Gated MLA 层将键值表示压缩为低维隐向量,降低 KV 缓存占用。Kimi K3 对所有 MLA 层采用无位置编码(NoPE),依赖穿插的 KDA 层进行位置敏感的混合。KDA 和 MLA 均使用一个依赖输入的逐通道满秩输出门。

Attention Residuals 为突破传统逐层残差累积的信息访问限制,作者引入 Attention Residuals (AttnRes)。该机制允许每一层从嵌入层及之前的 block 中有选择地检索表示。为减少内存开销,层被划分为 block。每个 block 内,层输出通过加和压缩为单一表示,并在 block 级表示上应用完整注意力。这种 block 结构限定了推理时的状态大小,并可通过在线 softmax 高效合并。

Stable LatentMoE 在宽度维度上,每个注意力层后接一个 Stable LatentMoE 层。该模块将全模型宽度与路由专家宽度分离,使模型能够将通道混合扩展至 896 个路由专家,每 token 激活 16 个专家。为应对极端稀疏性带来的激活值爆炸和负载均衡问题,作者引入三个组件:

  1. 标准化的 LatentMoE: 在专家聚合与上投影之间插入 RMSNorm,减少对尺度变化的敏感性。
  2. SiTU-GLU: 一种 Sigmoid Tanh Unit GLU 激活函数,对 Swish 门的线性因子和上分支施加平滑上限,在保留局部响应的同时控制大值增长。
  3. 分位均衡(QB): 这种无辅助损失的路由方法根据与目标负载匹配的路由分数分位数设定每个专家的偏置,确保分派均衡而不改变混合权重。

原生视觉 为实现原生多模态能力,模型在单一共享骨干中同时处理文本、图像和视频。视觉编码器 MoonViT-V2 完全从零开始,使用下一 token 预测从头训练。与从对比预训练模型初始化的编码器相比,这种方式在优化中具有更稳定的梯度范数。

视觉输入经 MoonViT-V2 编码后,由轻量 MLP 投影器映射至共享嵌入空间。编码器将注意力分解为帧内空间与帧间时间的两次传递,并使用像素混洗下采样减少视觉 token 数量。

Per-Head Muon 模型使用 Per-Head Muon 进行优化,这是 Muon 优化器的一个变体,其中 Newton-Schulz 正交化分别应用于每个注意力头的动量块,而非整个投影矩阵。这均衡了各头的更新尺度,提高大规模训练时的稳定性。

实验

Kimi K3 在推理、编程、agent 和视觉基准上与最先进闭源模型对比评估,同时涵盖内部评测和网络安全任务。它在推理上紧紧追赶最强模型,在诸多 agent 与编程套件中领先,并实现更优的成本效率,但在研究级推理、kernel 漏洞利用和 agent 行为上仍有差距。模型在编排、研究 agent 和编程方面表现卓越,而网络安全测试显示其具备有意义的漏洞开发能力,但在防御加固目标上与人类专家仍有明显差距。案例研究展示了在 kernel 优化、编译器设计和芯片设计等复杂技术任务上的强大自主性能。

SiTU-GLU 为门控线性单元的两个分支引入有界饱和,在原点附近与 SwiGLU 非常接近,但对大正输入限制响应。门分支使用 Sigmoid 加权的 tanh,而上分支采用独立的 tanh,输出趋近于缩放因子乘积 β1β2 = 100,不同于 SwiGLU 的无界增长。SiTU-GLU 将 SwiGLU 的线性上分支替换为 β2 缩放的 tanh,对大输入的上分支贡献施加上限。在原点附近,SiTU-GLU 曲线与 SwiGLU 紧密切合,但随着 x 增大,其饱和于边界 |f̄(x)| ≤ 100,而 SwiGLU 保持无界。

Kimi K3 通过对混合专家架构的扩展来扩大规模:增加深度、总参数量与激活参数量,引入隐 MoE 维度,并扩大每专家隐藏层大小,同时保持模型隐藏维度不变。结合数据与训练的变化,这些结构更新相较 Kimi K2 贡献了约 2.5 倍的整体扩展效率提升。深度增加 52%(从 61 层到 93 层)。总参数增长 167%,激活参数增长 220%,转向更稀疏的专家配置。引入一个新的隐 MoE 维度,设为隐藏维度的一半。每专家隐藏维度扩展 50%,模型隐藏维度保持不变。架构变化与数据和训练改进共同带来约 2.5 倍扩展效率增益。

Kimi K3 紧紧追赶最强闭源模型 Claude Fable 5 和 GPT-5.6 Sol,同时在大部份基准上持续超越 Claude Opus 4.8、GPT-5.5 和 GLM-5.2。它在编程和 agent 任务中取得顶尖或接近顶尖的成绩,尤其在 ProgramBench 领先,并在长程 FrontierSWE 上排名第二,但在 HLE-Full、CritPt 等研究级推理挑战上与前沿海存在明显差距。在 SWE-Marathon——一个 GPU kernel 编程套件中,Kimi K3 领先 Claude Fable 5 达 7 分。Kimi K3 在所有评估模型中取得 ProgramBench 的最高分。在 agent 任务中,Kimi K3 在 BrowseComp、DeepSearchQA、ResearchRubrics 及数项其他套件中创下最新最优结果,在 GDPval-AA v2 和 AA-Briefcase 等 Elo 评分的知识工作基准上排名第二或第三。在长程基准 FrontierSWE 上,Kimi K3 以 81.2% 的得分位居第二,仅次于 Claude Fable 5。Kimi K3 在 Terminal-Bench 2.1 上几乎与 GPT-5.6 Sol 持平(88.3% vs. 88.8%)。在推理方面,Kimi K3 在 GPQA Diamond(93.5%)上具有竞争力,但在研究级 CritPt 以及带工具和不带工具的 HLE-Full 上落后于 Claude Fable 5 和 GPT-5.6 Sol。

在内部编程基准上,Kimi K3 表现颇具竞争力,在 Coding Experience 上与顶尖闭源系统持平,在 Kimi Code Bench 2.0 上仅以微弱差距落后。开源的 Claude Fable 5 模型则分数较低且拒绝率更高。这些结果反映了在最大推理 effort 下的评估,并标注了各模型的 harness 分配。Kimi K3 在 Coding Experience 基准上取得最高分,略微领先最佳闭源模型。在 Kimi Code Bench 2.0 上,闭源模型领先,但需要 13 次回退和 1 次拒绝,而 Kimi K3 没有出现此类问题,位列第二。

在 Web 开发产出的盲法专家评估中,Kimi K3 (max) 总体优于 Claude Opus 4.8 (max),胜率为 58.6%,负率 27.6%。优势在 3D/WebGL/Shader 任务中最为显著,Kimi K3 胜出 72.7% 的提示,负率仅 13.6%。网站与 UI 克隆任务竞争更激烈,平局比例最高。Kimi K3 总体以 31.0 个百分点领先(胜-负)。在 3D/WebGL/Shader 任务中,胜-负差扩大至 +59.1 分。网站/UI 克隆任务的平局比例最高(21.1%),表明性能更为接近。

评估覆盖了 Kimi K3 的激活设计、扩展效率及跨多种任务的表现。SiTU-GLU 限定了门控单元的输出以防止无界增长,而对 MoE 架构的结构性调整带来了 2.5 倍的效率改进。在公开及内部基准上,Kimi K3 在编程、agent 和 Web 开发任务中匹敌或超越强大的闭源模型,但在研究级推理挑战上仍不及前沿水平。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供