Kimi K3 开源完整权重之后,社区的动作比预想的快。不到 48 小时,Sebastian Raschka 就发了一篇架构拆解笔记。
如果你不知道 Raschka 是谁——他写过《Build a Large Language Model (From Scratch)》,在 Lightning AI 做研究,长期以独立视角分析各家模型架构。他的判断通常不站队,只讲技术。这篇 K3 笔记也不例外,短、干净、没有废话。
他上来第一句就给 K3 定了性:「本质上是 Kimi Linear 的规模化生产版本。」Kimi Linear 是 Moonshot 去年的工作,当时只有 48B 参数。现在 K3 把它放大到了约 2.8 万亿——Raschka 说这是「目前最大的开源权重模型」。

从 48B 到 2.8T,加了一个关键组件:LatentMoE。
这个概念不是 Kimi 首创。NVIDIA 的 Nemotron 3 Ultra 也用了类似方案。核心思路是把标准 MoE 里的大线性层压缩——通过下投影(down-projection)的方式——类似于多头 latent attention 的做法。Moonshot 把它叫做 Stable LatentMoE 框架,在 K3 的技术报告里有详细展开。
但 Raschka 的关注点不止于这一个组件。他指出了一个更宏观的趋势:推理效率正在成为架构设计的驱动力量。MoE → LatentMoE,常规注意力 → 多头 latent attention + Kimi Delta Attention(KDA)。每一步替换都在牺牲一点表达能力,换取更低的推理成本。这套思路在 Nemotron 3、DeepSeek V4 身上也能看到,不是 Kimi 一家在走。
然后是 Attention Residuals。Raschka 特意强调这不是效率优化,而是对残差路径的结构性改良。DeepSeek V4 用流形约束的超连接(mHC)来拓宽残差路径,K3 的做法不同——它用注意力分数来学习跨层残差的贡献权重。技术报告里的原话是「持续改善验证损失和下游性能」,代价是训练成本增加约 4%,推理成本增加约 2%。这个设计其实继承自 Kimi Linear,不是新东西,但 Raschka 觉得值得单独拿出来讲。
最让他意外的是 NoPE。
K3 移除了所有 RoPE 位置编码,全模型使用 NoPE(无位置嵌入)。Raschka 说据他所知,这是第一个在「前沿级别」模型上这么干的。其他架构——比如 Gemma-4——的做法更保守:滑动窗口注意力层用 RoPE,全局注意力层用 NoPE。K3 一刀切,全干掉。
Hacker News 社区关于这一点吵得最凶。有人困惑:没有位置编码,模型怎么知道词序?几条解释逐渐浮现:因果掩码本身就隐含了位置信息;KDA 层本质上是 RNN-like(从 Gated DeltaNet 派生),天然理解序列顺序;而且 K3 在第一个注意力层之前堆了 3 个 KDA 层,位置信息在注意力启动之前就已经被学到了。还有人指出线性层的衰减机制(类似 IIR 滤波器)天然提供了相对位置信息。另一个评论说,去掉 RoPE 反而是好事——RoPE 在某些场景下确实会带来破坏性影响。
Raschka 还提到 K3 原生支持多模态,他认为这是加分项。至于训练细节,他说技术报告里还有「不少有趣的 tidbits」,但他的笔记只聚焦架构。
Hacker News 的讨论里,几个高赞评论直接说 Raschka 的工作是「稀有品」——在 LLM 生成的摘要淹没技术资讯的时代,这种原创的、有判断力的架构分析越来越少见了。
还有一个技术细节被社区挖了出来:K3 的 KV-cache 用了固定 1024 token 的增量块,这意味着在某些场景下会多出最多 1023 个 token 的 cache-miss 推理开销——和 Qwen 3.5/3.6 在处理 recurrent state 时遇到的问题类似。
Raschka 的结论很简单:「整体而言是一次很棒的发布。」
在这个语境下,「很棒」不是一个客套词。一个独立研究者,看了 2.8T 参数模型的技术报告,把架构里真正新鲜的东西挑出来,讲清楚什么是从前代继承的、什么是新加的、什么值得关注。这件事本身就是对「开源权重模型没有技术看点」论调的最有效反驳。
参考来源: