月之暗面开源 Kimi K3 完整权重的第二天,Hacker News 上最热的那条评论不是 "恭喜" 也不是 "历史性时刻"—— 是一条算数题。
"MXFP4 原生精度,光权重就要 1.5TB 显存。8 块 B200 勉强装下,实际部署至少 16 块。"
下面立刻有人接着算:一台二手四路至强服务器,插满 3TB DDR5 内存,不到三万美元,能不能跑?回答是大概能到每秒五六个 token。另一个评论说没戏,"K3 想得特别多才会回复",思考阶段就耗掉几分钟,实际可用速度得按天算,不是按秒。
有人在认真讨论 SSD offload。结论更悲观 —— 低于 700B 的模型用 Colibri 勉强能跑 0.1 tok/s,3T 级别 "可能慢到无法使用"。
这就是开源 3T 模型的技术现实。Kimi 把权重交出来了,但怎么跑、跑多快、花多少钱,是社区接下来要自己解决的问题。
先看 Kimi 官宣了什么。
7 月 27 日,Kimi 在官网博客正式发布 K3 的技术细节。2.8 万亿参数,MoE 架构,896 个专家每次激活 16 个,原生支持视觉和 100 万 token 上下文窗口。三项核心技术:Kimi Delta Attention(KDA,一种线性注意力机制的基础设施),Attention Residuals(选择性跨层检索而非均匀累积),以及 Stable LatentMoE 框架。配合 MXFP4 权重量化训练,宣称整体规模效率比前代 K2 提升约 2.5 倍。

基准测试的成绩单很有意思。Kimi 很坦诚地写了一句:"整体性能仍落后于 Claude Fable 5 和 GPT-5.6 Sol。" 但同时列出了一系列 K3 的实际产出:用 48 小时自主设计了一颗芯片(146 万标准单元、0.277MB SRAM、INT4 MAC 阵列),从头搭建了一个名为 MiniTriton 的紧凑型 Triton 式编译器且性能持平甚至超越原版,复现了计算天体物理中的 I-Love-Q 普适关系研究(阅读 20 多篇论文、生成 3000+ 行代码)。
这些不是 benchmark 分数,是可验证的产出。


定价方面:缓存命中输入 $0.30 / 百万 token,未命中 $3.00 / 百万 token,输出 $15.00 / 百万 token。Kimi 特别提到 Mooncake 分离式推理架构使编码场景缓存命中率超过 90%。这个价位跟 Claude Sonnet 差不多 —— 对一家中国 AI 公司来说,这是前所未有的高价。
然后 HN 的开发者开始算账。
核心问题是:自建跑 K3,划不划算?
一组计算是这样的:一台 3TB 内存的服务器,按美国平均电价 $0.124/kWh 算,一个月电费约 $135。另一组反驳:一个重度编码用户一周就要消耗 50 亿 token—— 你一台服务器一个月只能跑 1300 万 token,"差了四个数量级"。
但电力成本可能不是这件事的重点。几个评论者指出,真正的驱动力是数据主权 —— 欧洲和加拿大的公司在 CLOUD Act 之后开始刻意避开美国基础设施,一些受监管行业要求完全空气隔离的本地部署。"这不是省不省钱的问题。"
有人提到 AMD 即将推出的 Epyc Venice(16 个内存通道,最高 1.6Tb/s 带宽)和 MI355X(8 块就能轻松装下 K3),可能会改变成本曲线。如果推理成本继续下降,"自建 K3" 对中小团队来说就不再是天方夜谭。
还有一条技术线路被反复提起:蒸馏。不止一个人呼吁社区从 K3 做 "真正的蒸馏",不是简单量化压缩,而是在完整输出分布上训练更小的模型。"dsv4-kimi 应该会很好,因为 dsv4 推理成本很低。"
HN 上主力讨论线的基调是务实且兴奋的。K3 是 "第一个和闭源前沿一样大的开源模型",它的存在让社区第一次有机会量化以前只有实验室自己知道的参数 —— 真实推理成本、规模效率、微调可行性。
Kimi 开放了权重,但接下来的剧情不由他们写。由那些在算力、内存带宽、电费单和 vLLM PR 之间做取舍的开发者来写。
参考来源: