模型权重:http://huggingface.co/moonshotai/Kimi-K3

技术报告:http://github.com/MoonshotAI/Kimi-K3/blob/master/k3_tech_report.pdf

技术博客:http://kimi.com/blog/kimi-k3

KIMI K3 Open Frontier Intelligence

2.8T MoE 1M 上下文 原生多模态 全开源权重

Kimi K3 是月之暗面发布的2.8万亿总参混合专家大模型,激活参数104.2B,原生图文视频多模态,支持百万Token超长上下文。自研KDA、AttnRes、Stable LatentMoE三大架构,缩放效率相比Kimi K2提升2.5倍,覆盖代码、智能体、推理、视觉全赛道,完整开源模型权重。

01 模型核心总览

总参数量

2.78T

激活参数

104.2B
📄

上下文窗口

1M Tokens
🖼

视觉编码器

MoonViT-V2

基准图表展示

Benchmark 基准图表(上传图片替换此处占位)

Figure 1:编码、智能体、视觉多模型得分对比

02 整体模型架构

三维信息流设计

  • 序列维度:3层KDA + 1层Gated MLA混合注意力,超长文本高效建模
  • 网络深度:Attention Residuals,每层读取全部前置层特征
  • 模型宽度:896路由专家,单Token动态激活16个

架构总图

Kimi K3 完整架构图占位

Figure 2: 主干、KDA、MoE、视觉编码器完整结构

Kimi Delta Attention(KDA)

带通道遗忘门循环注意力,固定KV状态,解决百万上下文显存膨胀。

Sₜ = (I−βₜkₜkₜᵀ)Diag(αₜ)Sₜ + βₜkₜvₜᵀ

Attention Residuals

打破单层残差瓶颈,每层聚合全部历史层信息,深层利用率大幅提升。

Stable LatentMoE

SiTU-GLU有界激活+分位数均衡,稳定支撑896超大专家池训练。

Kimi K2 / K3 参数对比

参数项 Kimi K2 Kimi K3 提升幅度
总参数量1.04T2.78T+167%
激活参数32.6B104.2B+220%
路由专家数384896+133%
每Token激活专家816+100%
训练上下文128K1M8倍扩容
激活函数SwiGLUSiTU-GLU稳定有界
视觉编码器-MoonViT-V2 (401M)原生多模态

03 预训练与后训练流水线

预训练方案

  • 网页、代码、数学、专业知识、图文视频混合语料
  • MoonViT-V2 从零训练,不依赖SigLIP初始化
  • 上下文渐进扩容:8K → 64K预训练;256K → 1M冷却阶段
  • 优化器:Per-Head Muon,余弦学习率衰减

图表区域:K2/K3 FLOPs缩放效率对比

缩放效率曲线图占位

三阶段后训练

1. SFT 监督微调

海量智能体交互轨迹,全程MXFP4量化感知训练

2. 分层多强度RL强化学习

三大领域 × 三推理强度,共9个专家模型

3. 多教师在线蒸馏 MOPD

融合9个领域专家能力至单一基础模型

推理加速方案

EAGLE-3草稿模型 + MoE MXFP4量化,大幅降低推理成本

04 万亿级训练推理基础设施

KDA 软硬件协同

  • FlashKDA专用CUDA内核
  • KCP上下文并行
  • SM层级序列加速

MoonEP 均衡MoE

  • 全GPU Token负载均衡
  • 零拷贝All-to-All通信
  • 内存分片重计算

AgentENV 微VM沙箱

  • Firecracker隔离虚拟机
  • 毫秒级快照暂停恢复
  • 千万级沙箱批量调度

线上推理调度系统

统一前缀缓存

混合KDA状态+MLA分页KV,细粒度复用百万上下文前缀。

预算式集群调度

长短请求资源隔离,防止超长文本挤占普通对话SLO。

05 全维度评测数据

四大能力赛道表现

  • 🔹 代码:SWE-Marathon 42.0分领先闭源,ProgramBench 77.8行业第一
  • 🔹 智能体:BrowseComp 91.2、MCPMark-Verified 94.5多项SOTA
  • 🔹 多模态:OmniDocBench 91.1;Math-Vision搭配Python达97.8
  • 🔹 通用推理:GPQA 93.5比肩GPT/Claude,高阶科研小幅落后
得分-推理成本散点图占位

第三方权威榜单

Artificial Analysis综合指数 57.1(全球第4)
Vals AI行业指数 74.7(全球第2)
LMArena Web开发榜 1678 Elo(第1)
LMArena通用文本榜 1486 Elo(第8)

安全攻防能力

可挖掘Linux内核零日漏洞;用户态漏洞38.9%完成率,内核完整利用链弱于人类专家。主流闭源拒绝安全任务,无对标数据。

06 前沿工程落地案例

GPU内核优化

AttnRes延迟下降59.7%,FlashKDA超越Triton内核。

{ }

MiniTriton编译器

自研DSL、PTX代码生成,分布式loss对齐PyTorch。

AI芯片RTL设计

48小时完成KDA专用NPU,开源硬件代码。

📊

天体物理管线

研读论文生成交互式天文可视化看板。

🎬

科普视频自动制作

自动剪辑、动态数学图表渲染。

📑

行业深度研究

财报、多智能体并行分析,自动生成综述。

Kimi K 完整开源权重:huggingface.co/moonshotai/Kimi-K3