7 月 17 日凌晨,月之暗面发布了 Kimi K3。
数字可以快速过一遍:2.8 万亿参数,MoE 架构,896 个 expert 每次激活 16 个,100 万 token 上下文窗口,原生多模态,完整权重 7 月 27 日前放出——将成为全球首个开源的 3 万亿级别模型。

但数字说完了,故事才刚开始。
一个 90 后创始人,半年融了 60 亿美元
在讲模型之前,先看谁在做。
月之暗面成立于 2023 年 4 月,创始人杨植麟 1992 年生,清华计算机系本科,CMU 博士毕业,曾在 Google Brain 和 Meta AI 做研究。他是 Transformer-XL 和 XLNet 两篇里程碑论文的一作——这两篇论文解决了 AI 长文本理解的核心难题,被引过万次。创始团队还包括周昕宇、吴育昕、汪箴等一批顶级技术人才。多位核心成员来自 Google、Meta、Amazon 等公司,在 VLMo、Stable Diffusion 训练加速、LLaMA 对齐等方向上有重要贡献。
这家公司融资的速度,比模型迭代还快。2026 年上半年几乎按月一轮融资——1 月 5 亿美元,2 月 7 亿美元,3 月再 7 亿美元,5 月到 20 亿美元——六个月内累计超过 60 亿美元,估值从年初的 43 亿美元飙升到 200 亿美元以上。最新一轮目标 20 亿美元,估值 300 亿美元,正在为香港 IPO 铺路。
资方名单涵盖了半个中国互联网:红杉中国、真格基金、美团龙珠、阿里巴巴、腾讯、IDG 资本、高榕创投、小红书、中国移动、五源资本……
同时也在经历成长的阵痛。Kimi 月活从 2024 年 10 月巅峰的 3600 万下降到 1000-1500 万级别,面临字节跳动、腾讯、阿里和 DeepSeek 的生态挤压。2024 年底,杨植麟因前创业项目"循环智能"的股权问题被 5 家老股东提起仲裁。但商业化在加速——ARR 从 2026 年 3 月突破 1 亿美元,到 4 月翻倍至超 2 亿美元,海外收入已超过国内。
杨植麟把公司战略比喻为"爬楼梯"而非"看风景"。K3 就是最新一级台阶。
架构:为什么 K3 能到 2.8 万亿
K3 的架构围绕一个核心问题展开:当参数规模从万亿跳到接近三万亿,传统 Transformer 的瓶颈在哪里?
答案是两件事:序列长度的注意力代价,和深层的信号衰减。
Kimi Delta Attention(KDA) 是一种混合线性注意力机制。它把长上下文拆成两部分:一个压缩的历史摘要(维护在线性紧凑的记忆状态中),和新 token 带来的增量信息。新 token 只需要对"变化"部分做重注意力计算,不需要每次重算整个历史。实际效果是,在百万 token 上下文场景下,解码速度比标准注意力快约 6.3 倍。
KDA 也带来了新的工程挑战——传统的 prefix caching 不再适用。月之暗面的团队给 vLLM 开源项目贡献了定制实现,让 KDA 配合 prefill cache 工作,这才在 2.8 万亿参数规模下把推理价格压到可接受的水平。
Attention Residuals(AttnRes) 解决的是另一个维度的问题。在极深的网络中,早期层的注意力信号随深度衰减,传到后面已经被稀释了。AttnRes 在注意力输出上加了专用的残差连接,让每一层的注意力表征可以跳过中间层,把更原始、未被衰减的信息直接传给深层。改进效果是训练效率提升约 25%,额外开销不到 2%。
Stable LatentMoE 把稀疏性推到了极致——896 个 expert,每次只激活 16 个。为在这个极端稀疏率下保持训练稳定,团队引入了几个技术:Quantile Balancing 从 router-score 分位数直接推导 expert 分配,消除启发式均衡的超参数;Per-Head Muon 优化器在注意力头级别独立优化;SiTU(Sigmoid Tanh Unit)改善激活控制;Gated MLA 加强注意力选择性。
量化感知训练 从 SFT 阶段开始就用 MXFP4 权重 + MXFP8 激活做训练,不是训完了再压缩。这让 K3 可以在更广泛的硬件上部署。但推荐配置仍然是 64 卡以上的超节点——这是"云上可访问"的开源,不是个人设备能跑的开源。
综合起来,相比前代 K2(1 万亿参数),K3 的 scaling efficiency 提升了约 2.5 倍。
Benchmark:在三分之一的项目上打败了 Fable 5
Moonshot 自己发布的 35 项 benchmark 提供了一个诚实的全景图。
HN 用户 versteegen 把这些数据汇总成了一个直观的对比表:K3 在 35 项里赢了 Fable 5 的 12 项(34%,外加 1 个平局),赢了 GPT-5.6 Sol 的 19 项(56%),赢了 Opus 4.8 和 GPT-5.5 的多达 30 项(86%-88%)。
34% 的胜率不算超越。但"一个开源模型在三分之一 benchmark 上击败 Fable 5"这件事,六个月前没人会相信。

第三方评测的结论高度一致,但各有侧重。
Arena(UC Berkeley) 的前端编程排行榜上,K3 首次亮相就以 1679 分拿下第一,超过 Fable 5 的 1631 分和 Sol 的 1618 分。在 7 个前端子类别中拿下 6 个第一——数据与分析、内容创作工具、设计、开发工具、游戏开发、营销网站,只在 SaaS 类别输给了 Fable 5。相比前代 K2.6,这是一次 17 位的排名跳跃。

Vals AI 的综合性评测把 K3 放在全球第二,仅次于 Fable 5,高于 Sol。

Artificial Analysis 评价最为审慎。其 Intelligence Index 给 K3 打了 57 分,与 GPT-5.5 和 Opus 4.8 相当,低于 Fable 5 和 Sol。但在长程知识工作的独立评测中,K3 的 Elo 达到 1547,相比 K2.6 提升了 732 分,仅次于 Fable 5。Agent 任务评测中达到 1668 Elo,超越了 Opus 4.8、GPT-5.5 和 GLM-5.2。在自动化的 SaaS 工作流测试中取得了 53% 的分数,排名第一。

但有一项指标亮了红灯:K3 的幻觉率从 K2.6 的 39% 上升到了 51%。准确率确实也提高了(从 33% 到 46%),但超过一半的答案仍然不可靠。它知道得更多了,但它也更敢编了。
那个鹈鹕、隐藏的系统 prompt、和 25 美分的 SVG
Simon Willison 用一个著名的"鹈鹕测试"提供了最直观的 K3 初体验。
他给了 K3 一个 prompt:"Generate an SVG of a pelican riding a bicycle." 这只鹈鹕花了 25 美分——95 个输入 token,16658 个输出 token。而 K3 的思维链消耗了 13241 个 token,是实际输出 token 的近四倍。
Willison 还发现了一个有趣的细节:他给模型发送"hi"这样一个词,结果显示输入 token 数为 86。这说明 K3 内部可能藏着一个约 85 个 token 的系统 prompt——模型拒绝泄露具体内容。
鹈鹕本体的渲染质量还不错:一只卡通鹈鹕骑着自行车,围着红围巾,蹼状橙色脚在踩踏板,带有运动线。当 Willison 用 K3 的视觉能力为这只鹈鹕生成 alt text 时,模型详细描述了画面中的各个元素。
但 Willison 的结论是克制的:鹈鹕测试只是一个 hello world,它的质量与模型能力的关联性"现在基本上已被切断"——GLM-5.2 的鹈鹕比 GPT-5.6 和 Fable 5 更好,但 GLM 远不是 Fable 级别的模型。
更有用的发现来自推理效率。K3 目前只提供一种推理模式——"max"。这意味着即使是最简单的任务,它也会消耗大量推理 token。Willison 注意到的 token 效率改进是真实的(比 K2.6 少 21% 的输出 token),但被"max effort only"的模式抵消了。Moonshot 表示低推理和高推理模式会在后续推出。
48 小时,从零到一颗芯片
在所有 benchmark 数据中,最让人印象深刻的是一个过程。
K3 在一个 48 小时的连续自主运行中,用开源 EDA 工具和 Nangate 45nm 工艺库,从头设计了一颗功能完整的纳米级模型加速器芯片。没有人干预,没有预设流程。模型自己读文档、写 Verilog、跑仿真、分析时序违约、迭代修复——最终产出的是一个 4mm² 面积的芯片,包含 146 万标准单元和 0.277MB SRAM,内嵌一个融合解量化的 INT4 MAC 阵列,在 100MHz 下实现时序收敛,解码吞吐量超过 8700 token/秒。

45nm 工艺、100MHz 频率——这和英伟达 H100 的 4nm 工艺不在一个量级上。但这不重要。重要的是一个语言模型在没有被专门训练做芯片设计的情况下,用了两天的自主时间,完成了传统上需要一支工程师团队花费数月才能完成的从 RTL 到 GDSII 的完整流程。
团队还自研了 MiniTriton——一个对标 OpenAI Triton 的 GPU 编译器,在某些 workload 上持平或超越 Triton。这两个技术成就加在一起,指向同一个方向:K3 不只是一个对话模型或编程助手,它在真正尝试成为能操作复杂工具栈、完成长程工程任务的 agent。
"这是我这辈子用中国模型渲染过的最贵的鹈鹕"
K3 的定价改变了人们对"中国 AI 模型"的默认认知。
输出端 $15/百万 token——这个数字和 GPT-5.6 Terra 的输出定价一模一样。输入 $3/百万 token(Terra 是 $2.50),缓存命中 $0.30(Terra 是 $0.25)。它甚至在某些档位上比 OpenAI 的中端闭源模型还贵。

HN 上用户的调侃一针见血:"这是我这辈子用中国模型渲染过的最贵的鹈鹕。"对比之下,欧洲的 Mistral 同类产品价格只有 K3 的一半。而 K2.6 时代的定价是 $0.95 输入 / $4 输出——K3 的输出价格翻了近四倍。
但只看表面数字会错过关键信息。Artificial Analysis 的数据显示,K3 每次任务的综合成本为 $0.94,与 GPT-5.6 Sol 的 $1.04 接近,约为 Opus 4.8 的 $1.80 的一半。K3 每次推理消耗的 token 量比 K2 少约 40%,输出 token 量比 K2.6 少 21%。
更大的变量在缓存。月之暗面自研的 Mooncake 分离式推理架构,号称在编程场景中缓存命中率超过 90%。如果这个数字属实,大多数 coding 场景的输入成本会降到 $0.30/百万 token——比 Terra 的缓存价 $0.25 也只有一线之差。在缓存命中的前提下,K3 的综合成本是 Fable 5 的三分之一。
所以定价的完整叙事是:它是一个对标 OpenAI 中高端定价的模型,但通过架构效率优化实现了比价格标签看起来更好的性价比。它不便宜,但它也不怂。
"Impressive"——来自马斯克的点赞
马斯克在 X 上回了两个字:"Impressive。"这是他第二次公开点赞 Kimi——第一次是今年 3 月,Kimi 发了篇改进 ResNet 残差连接的论文,马斯克说"Impressive work from Kimi",Kimi 官号调侃回复"你的火箭也不赖"。这一次他的 xAI 刚在 7 月 15 日短暂开源了 Grok Build 编码 agent 工具,四天后他公开点赞了一个竞争对手的模型。行业观察者注意到了这层微妙。

其他人的反应更为直白。
宾大教授 Ethan Mollick:"Kimi K3 看起来真的很好,是目前最接近前沿的。"他随即追问——当开源模型正在缩小差距,美国政府还敢不敢限制 Anthropic 和 OpenAI 的发布节奏?
Arena 评测平台 CEO Anastasios Angelopoulos 称 K3 为"今年唯一最大的发布",且宣布"开源中国模型已经超越了美国模型。"
Mozilla CTO Raffi Krikorian 则从地缘角度切入——美国 AI 实验室的 CEO 们"如果没有把开源模型视为严重的竞争威胁,就没有理由去游说华盛顿反对开源模型。"
蒸馏、出口管制、以及一个讽刺的时刻
更大的背景是中美 AI 博弈。
美国政府前不久以安全理由撤回了 Anthropic Fable 和 Mythos 的出口许可。Anthropic 此前公开指控月之暗面、DeepSeek 和 MiniMax 通过蒸馏"非法提取" Claude 模型的能力,特朗普政府将此定性为"对抗性行为"。
而现在,一个被指控蒸馏了 Claude 的模型,正在 34% 的 benchmark 上和 Fable 5 打成平手或取胜。
这一幕的讽刺意味没有逃过 HN 用户的注意。一篇 1521 分、106 条评论的讨论,从 benchmark 对账吵到地缘政治,从"最贵的鹈鹕"调侃到开源 vs 闭源的路线之争。有一条评论很简短,但捕捉到了此刻的共识:"管你怎么看这些中国模型,它们确实在制造竞争和紧迫感。这就够了。"
月之暗面自己在官方博客里保持了一贯的坦诚:"K3 在整体性能上仍然落后于最强大的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。"模型会过度主动,碰到歧义时可能做出意料之外的决策;对思维历史敏感,如果历史思考内容没有正确传回,性能会下降。

这种坦诚本身就是一种自信——我不需要假装已经赢了,因为趋势线本身就说明了很多。
这不是一个模型的故事
DeepSeek V4 也定在 7 月中旬上线。同样支持百万 token 上下文,引入峰谷定价——高峰时段价格翻倍。同样在编程和推理上对标国际一线。
所以 K3 不是孤例。这不是一个中国实验室偶然冲到了 frontier 边上。这是多个中国团队在同一个夏天,同时逼近了那条线。月之暗面、DeepSeek、智谱、MiniMax——彼此竞争,但又共同构成了一股合力,在改变"中国 AI 模型 = 便宜替代品"的叙事。
7 月 27 日权重完全放出后,才是真正检验的开始。代码仓库会被 fork、研究、拆解。全球的开发者会在自己的硬件上测试、比较、争论。开源的意义不在于第一个 benchmark,在于十万双眼睛看过之后的共识。
而那个共识,正在被重新定义。
参考来源: