月之暗面放出 Kimi K3 完整权重之后,社区的动作比预想快——「在 M1 Max 上跑 Kimi K3」的帖子今天登上了 Hacker News 首页。

具体来看,这是一个名为「Deltafin」的小型研究项目,支持在 Apple Silicon Mac 上本地运行 Kimi K3(2.8 万亿参数)。

HN 讨论帖的评论两极分化得很厉害。一边说「0.3 token 每秒,这东西有什么意义?」另一边说「你想想,2.8 万亿参数,在你的桌面电脑上跑。」两边都对,但这个争论本身跳过了更有意思的问题——K3 能在 Mac 上跑起来,不是因为有人想方设法去压缩它,而是这件事从一开始就写在了架构里。
Raschka 在 K3 开源完整权重 48 小时内就出了一篇架构笔记。他的第一句判断很简单:「本质上是 Kimi Linear 的规模化生产版本。」Kimi Linear 是 Moonshot 去年的工作,只有 48B 参数。现在 K3 把它放大到了约 2.8 万亿,加了一个关键组件:LatentMoE。

这个概念不是 Kimi 首创——NVIDIA 的 Nemotron 3 Ultra 也用了类似方案——但 K3 是第一个把它做到这个体量的。核心思路是把标准 MoE 里的大线性层通过下投影压缩。说人话就是:模型虽然整体巨大,但每次推理只激活一小部分专家,其余老老实实待在磁盘或网络存储上。一个 MoE 模型对本地推理天然友好,不是靠事后裁剪,是架构生来如此。
第二个设计是 MXFP4 原生训练。K3 从训练第一天起就是 MXFP4 格式。这意味着你下载下来的权重不需要经历一次额外的量化步骤——下载即用。对服务器这不重要,对一台 Mac 很重要。1.6TB 的权重文件,如果还需要再转换一轮格式,大多数人连试都不会试。K3 把这个步骤省了。
第三个更激进:NoPE。K3 移除了全部 RoPE 位置编码,全模型不用任何位置嵌入。Raschka 说据他所知,这是第一个在「前沿级别」模型上这么干的。其他架构的做法更保守——Gemma-4 在滑动窗口注意力层用 RoPE,全局注意力层用 NoPE。K3 一刀切。
为什么这跟本地推理有关?因为去掉 RoPE 意味着计算路径更短。HN 上有人解释了这怎么 work 的:因果掩码本身就隐含位置信息;KDA 层(从 Gated DeltaNet 派生)本质上是 RNN-like,天然理解序列顺序;而且 K3 在第一个注意力层之前堆了 3 个 KDA 层——位置信息在注意力启动之前就已经被学到了。没有 RoPE,少了一步计算,在每一点速度都很重要的场景下,这不算小事。
deltafin 这个项目就是把这些架构特性串起来的人。它做的事不复杂:K3 的 MXFP4 专家权重按需从 HTTP 流式传输到本地磁盘缓存,用 fused NEON 内核和 Metal/MPS 做推理。逐 token 拉专家,推理完就放。项目提供 OpenAI 兼容的 API 接口,支持确定性解码——每次跑同样的 prompt 会得到完全相同的输出。
Redis 作者 antirez 几乎同时在做同一件事,但更硬核一些,他在 M5 Max 上搞定了 K3。

antirez 用 M5 Max 128GB 直接从 Hugging Face 流式读取 K3 的 1.6TB 权重。「有点慢,」他承认。但从他后续的推文来看,这不只是一个好玩的项目。他在等两台 512GB Mac Studio ——「进行 Q2 精度量化,至少聊天场景下可以达到可接受的速度。」他的判断是 K3 在 MXFP4 上训练的,「感觉量化效果会很不错」。
然后回到 HN 那条争论。
0.3 tok/s 确实慢。随着 KV cache 增长会越来越慢——完整 1M token 上下文下 cache 就占约 27GB。但问题不是速度,是用什么场景来衡量。如果你是坐在屏幕前等回复,0.3 tok/s 是折磨。如果你是把一批测试用例挂上去过夜跑评估,或者用 LLM-as-judge 做离线打标,那这个速度完全没问题。有人说得挺到位:「OpenAI 和 Anthropic 的批量 API 给你打五折。这个是打九八折。」
更关键的是这次和以前不一样。
以前的路数是:大模型发布 → 社区费尽全力做量化、裁剪、蒸馏 → 勉强塞进消费级硬件,性能打折扣。K3 的路数是反过来的:模型架构本身的设计选择——LatentMoE、MXFP4 原生训练、NoPE——让它在发布的时候就已经准备好了被人在各种硬件上跑。不是「有没有办法压缩」,而是「用不着压缩」。
不是说每个大模型都应该这么设计。但如果开源权重的核心价值在于任何人、任何机器都能用,那 K3 的架构思路——让一台 Mac 也能跑 2.8 万亿参数——本身就是在扩大「开源」两个字的实际含义。
接下来要看的是,两台通过 Thunderbolt 5 连接的 Mac Studio 512GB 能不能把速度推到「可交互」的水平。antirez 觉得行。其他人可以等着看。
参考来源: