月之暗面昨日晚间宣布在 Kimi K3 开放日发布 Kimi K3 的模型权重、技术报告,并开源支撑 Kimi K3 模型训练的关键 Infra 技术:MoonEP、FlashKDA和AgentEnv。
“希望以此加速前沿智能的部署与普及,促进 AGI 研究……我们坚信开放权重模型的价值。它们能降低获取智能的门槛,推动创新,并赋予用户对数据更大的控制权、隐私保护和所有权。”
Kimi K3 是月之暗面于本月中旬推出的该公司迄今为止能力最强的模型 —— 一个拥有 2.8 万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持 100 万 token 的上下文窗口,参数规模是 Kimi K2.5 的 3 倍左右。
公告指出,用户可在公开的 Kimi K3 技术报告中了解以下技术细节:
- KDA + AttnRes:以 3:1 比例混合 KDA 与 Gated MLA,实现高效长上下文建模,并通过块级注意力残差增强跨层信息流动。
- Stable LatentMoE:每个 token 从 896 个路由专家中激活 16 个,并通过 SiTU-GLU 与 Quantile Balancing 保持极高稀疏度下的训练稳定。
- MoonViT-V2:视觉编码器从零开始使用 next-token prediction 训练,无需对比预训练,在达到 SigLIP 初始化基线效果的同时获得更稳定的优化过程。
- 后训练与评估:在通用推理、通用 Agent 和编程 Agent 三大领域进行大规模任务合成,百万 token 上下文的强化学习基建,近 20 个内部评测集的完整评估结果。

支撑 Kimi K3 训练的三项 Infra 技术分别为:MoonEP、FlashKDA 和 AgentEnv,覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源,MoonEP 和 AgentEnv 则随本次发布正式开源。
- MoonEP:MoonEP 是团队为超大的细粒度 MoE 打造的高性能通信库,让专家并行(expert-parallel)的通信在不均衡的情况下仍然实现极致效率。
- FlashKDA:FlashKDA 是团队实现的 Kimi Delta Attention 高性能算子(kernel)。在英伟达 H20 上,相比 flash-linear-attention 基线,它的 prefill 速度提升 1.72-2.22 倍,可以直接作为 flash-linear-attention 的替换后端。
- AgentEnv:AgentENV 是团队与 KVCache.ai 合作开发的沙箱系统,用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱,灵活支持快速快照、恢复和分叉(fork)等,可以应对大规模并行的 Agent 工作流与训练任务。
相关阅读: