模型权重:http://huggingface.co/moonshotai/Kimi-K3
技术报告:http://github.com/MoonshotAI/Kimi-K3/blob/master/k3_tech_report.pdf
技术博客:http://kimi.com/blog/kimi-k3
KIMI K3 Open Frontier Intelligence
Kimi K3 是月之暗面发布的2.8万亿总参混合专家大模型,激活参数104.2B,原生图文视频多模态,支持百万token超长上下文。自研KDA、AttnRes、Stable LatentMoE三大架构,缩放效率相比Kimi K2提升2.5倍,完整开源模型权重。
01 模型核心总览
总参数量
激活参数
上下文窗口
视觉编码器
基准图表展示
Figure 1:编码、智能体、视觉多模型得分对比
02 整体模型架构
三维信息流设计
- 序列维度:3层KDA + 1层Gated MLA混合注意力,超长文本高效建模
- 网络深度:Attention Residuals,每层读取全部前置层特征
- 模型宽度:896路由专家,单Token动态激活16个
架构总图
Kimi Delta Attention(KDA)
带通道遗忘门循环注意力,解决百万上下文显存膨胀。
Attention Residuals
打破单层残差瓶颈,聚合所有历史层信息。
Stable LatentMoE
SiTU-GLU有界激活+分位数均衡,稳定超大专家池训练。
Kimi K2 / K3 参数对比
| 参数项 | Kimi K2 | Kimi K3 | 提升幅度 |
|---|---|---|---|
| 总参数量 | 1.04T | 2.78T | +167% |
| 激活参数 | 32.6B | 104.2B | +220% |
| 路由专家 | 384 | 896 | +133% |
| 单Token激活专家 | 8 | 16 | +100% |
| 训练上下文 | 128K | 1M | 8倍扩容 |
| 激活函数 | SwiGLU | SiTU-GLU | 稳定有界 |
| 视觉编码器 | - | MoonViT-V2 (401M) | 原生多模态 |
03 预训练与后训练流水线
预训练方案
- 网页、代码、数学、图文视频混合语料
- MoonViT-V2 从零训练,不依赖外部预训练权重
- 上下文分阶段扩容:8K→64K→1M
- 优化器 Per-Head Muon,余弦衰减
图表占位:FLOPs损失对比曲线
三段式后训练
1. SFT 监督微调
海量智能体交互轨迹,量化感知训练。
2. 分层多强度RL
通用/代码/智能体9套专家模型。
3. 多教师蒸馏 MOPD
融合多专家能力至单一基座。
推理加速方案
EAGLE-3草稿模型 + MXFP4权重量化降低推理成本。
04 万亿级训练推理基础设施
KDA 软硬件协同
- FlashKDA CUDA专用内核
- KCP 上下文并行
- SM层级加速
MoonEP均衡MoE
- GPU Token均衡负载
- 零拷贝All-to-All通信
- 内存分片优化
AgentENV 微VM沙箱
- Firecracker隔离虚拟机
- 毫秒级快照恢复
- 大规模批量调度
线上推理调度系统
统一前缀缓存
混合KDA+MLA缓存,复用百万上下文前缀,降低预填充耗时。
预算式集群调度
长短对话资源隔离,超长文本不抢占普通请求速度。
05 全维度评测数据
四大能力赛道
- 代码:SWE-Marathon 42.0分,ProgramBench行业第一
- 智能体:BrowseComp 91.2,Web开发开源SOTA
- 多模态:OmniDocBench 91.1,图文数学推理优秀
- 通用推理:GPQA 93.5,接近头部闭源模型
第三方权威榜单
安全攻防评测
可挖掘Linux内核漏洞,用户态漏洞通过率优于GLM系列,但完整利用链弱于人类专家。主流闭源模型不支持安全任务。
06 前沿工程落地案例
GPU内核深度优化
Attn延迟下降59.7%,自研FlashKDA超越Triton。
MiniTriton编译器
自研DSL,分布式训练loss对齐PyTorch。
AI NPU RTL设计
48小时完成KDA专用推理芯片,开源硬件代码。
天体物理数值管线
自动生成天文交互式可视化程序。
AI科普视频生成
自动剪辑、动态数学图表渲染。
行业深度分析
财报、引力波多智能体并行研究。
Kimi K3 完整开源权重地址:huggingface.co/moonshotai/Kimi-K3
主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网

评论(0)