Kimi K3 发布那天,美股 AI 板块又经历了一次集体跳水。Moonshot 暂停了新用户订阅——GPU 容量被打到了上限。阿里巴巴紧接着发布了 Qwen3.8 Max 预览版,2.4 万亿参数,号称仅次于 Anthropic 的 Fable 5,股价当天涨了 5.4%。
市场的反应模式已经让人有些眼熟。上一次是 DeepSeek R1,再上一次是 Qwen 的开源版本。中国模型一有动静,美国 AI 公司的市值就蒸发几百亿。
但 Ben Thompson 不买账。
在 7 月 20 日发表的 Stratechery 长文中,这位硅谷最有影响力的科技分析师用一套商品市场理论,把"中国 AI 恐慌"拆了一遍。结论很直接:从经济学角度看,市场的反应过头了。

Thompson 没有从技术对比切入,而是先讲了一段 MBA 课堂往事。他在西北大学 Kellogg 商学院上第一堂战略课时,翻遍课程大纲发现没有一家科技公司的案例。教授的解释是:战略课教的是适用于一切行业的普适原理。当时他不服——软件和分发的边际成本为零,这和其他行业根本不同。但多年以后他发现,AI 正在把那些"过时"的原理重新拉回舞台中央。因为边际成本回来了。
这个判断是他全文的基石。
开源权重模型"免费"是一个容易让人上当的说法。不花钱的是研发——R&D 是一次性固定成本。推理不是。模型跑起来,每一次 token 产出都在烧钱。用 Thompson 的话说:做 1 亿美元收入和 10 万美元收入,R&D 一样,但销售成本差一千倍。Kimi K3 定价每百万输入 token 3 美元、输出 15 美元,比 Anthropic Sol 的 5 美元/30 美元便宜不少。但这场游戏比的不只是 token 单价。
Thompson 引入了一个关键区分:token 不是商品。
黄仁勋喜欢把 GPU 称为"token 工厂"。从英伟达视角看,这种框架没错——GPU 不管模型是谁家的,只管高效地产 token,于是行业习惯了用 token 每秒、token 成本做决策。但 Thompson 指出,推理时代这个逻辑塌了。同一个问题,不同模型消耗的 token 数量可以差几倍。Kimi K3 在有复杂推理需求时,消耗的 token"明显多于 Sol",价格优势可能被 token 效率的差距吃掉。
真正可替代的不是 token,而是 token 组装出来的东西——智能。答案对了,答案就是可替代的。花了多少 token 才拿到答案,决定了你的成本结构。
他把模型服务成本拆成五个变量:模型体积、推理效率、内存效率、服务效率、token 效率。谁在这些维度上综合最优,谁的智能边际成本就最低。
接下来是全文最硬核的部分——商品市场机制课。
假设三家供应商卖同一种商品:A 每单位成本 10 块,B 成本 15 块,C 成本 20 块。市场需求在 20 块价格下有 25 个单位,那么 A 卖 10 个赚 10 块利润,B 卖 10 个赚 5 块利润,C 卖 5 个刚保本。市场价由满足需求所需的最贵那单位成本决定——C 不赚钱,A 和 B 赚的就是自己和 C 的成本差。
Thompson 的推论直指 AI 行业:智能正在向这个方向走。做 CRUD 应用的开发者很快会发现换哪个模型都能搞定。到那时赢的不是定价最高的,而是成本最低的。而成本最低的供应商,恰好是 Anthropic 和 OpenAI——它们在模型能力、服务规模、token 效率上都有几个月的先发窗口,而且正在用最强的模型来优化自己的推理成本。
但这套分析有一个前提:供给充足。现状是算力短缺,前沿模型供不应求,Anthropic 可以把 token 卖得很贵。中间每一层(英伟达卖给 SpaceXAI,SpaceXAI 再卖给 Anthropic,Anthropic 卖给用户)都在加价。中国模型看起来便宜,很大程度上是因为头顶有一个美国前沿实验室撑起来的"价格伞",不是因为他们本身服务成本更低。
所以 Thompson 说,至少从经济学角度,恐慌过头了。
但文章没就此收住。他追问了一个更有意思的问题:既然经济上不怕,为什么前沿实验室自己这么慌?
四个解释。其一,实验室的财务模型长期锚定在"训练成本主导"的假设上,训练烧的 GPU 比推理多,就必须靠推理高定价来养下一轮训练。但推理市场增速远超训练成本增速,一旦算力上来,薄利多销的逻辑成立。其二,智能不是完美的商品——跑推理的同时在收集数据,数据喂给下一版模型,形成飞轮。中国模型的 API 用户不会给美国实验室贡献数据。其三,Claude Code 和 Codex 这类编程 harness 粘性惊人——不管你用哪个模型,一旦习惯了某个工具就懒得换。往上整合用户体验,确实是一条护城河。其四,Anthropic 的意识形态——一家认为只有自己能托付 AI 的公司,看到开源权重模型逼近自己,这是信仰层面的冲击。
在讨论中国动机时,Thompson 引用一句话——"坚持开放共赢,鼓励开源开放、协作共享"——然后一句话点透:这是"commoditize your complements"的经典策略。中国在机器人、制造业等物理世界有统治力,AI 模型越便宜越普及,中国越受益。同时,削弱美国前沿实验室、壮大一切可能的美国对手,也是算盘的一部分。
关于蒸馏,Thompson 的立场比大多数美国分析师更坦率。他不否认中国实验室从蒸馏美国前沿模型中获益——尤其在强化学习后训练环节,用美国模型当 teacher 可以跳过大量试错。但他反过来问了一个尖锐问题:蒸馏到底伤害了谁?大语言模型本身就是整个互联网公开知识的蒸馏产物。他建议美国立法明确训练数据收集属于合理使用,并禁止服务条款中"不得用于蒸馏"的限制——让美国开源模型团队也能直接吃前沿模型的数据,而不是绕道中国"蒸馏二手烟"。
Dean Meyer 和 Konstantine Buhler 在 X 上发了一篇被广泛引用的分析呼应了这个判断:蒸馏压缩了中国模型追赶前沿的"最后、也是最贵的那段差距"。即使蒸馏在中国模型总能力中占比不大,它在美国开源模型和中国模型之间造成的优势差是实质性的。每一个西方前沿模型的进步,都会变成中国实验室的教材。
但在文章最后,Thompson 承认有一个理由让人真的害怕——不是经济上的。
网络安全。Hugging Face 的生产环境最近被一个自主 AI agent 系统入侵。安全团队在应急响应时发现,美国前沿模型的护栏"无法区分攻击者和防御者"。Hugging Face 的工程师被迫转向中国的 GLM 5.2 模型,在本地运行来分析攻击者留下的 17000 多条日志。
这事充满了荒诞感。特朗普政府对 Anthropic Fable 施加了严格限制,名义上是防止 AI 落入敌手。结果是,美国公司防御网络攻击时,唯一可用的顶级模型来自一个"多年来一直在试图削弱我们网络防御"的国家。Thompson 的评价就三个词:"This is insane!"
他的政策建议清晰:放开 Fable 和 Sol 在网络安全领域的限制;确保美国开源权重模型和中国站在同一起跑线;让前沿实验室靠做得更好来赢,而不是靠画一条"只有我们能做 AI"的红线。中国已经够难对付了,把开放和创新的旗子也拱手让人,等于放弃了自己最大的优势。
Stratechery 这篇文章发布后,国内技术社区很快出现了来自一线的验证数据。一位工程师团队在博客园发表了为期四周的 Kimi K3 vs Claude Code/Codex 实测报告。
数据很有意思。在简单 CRUD 和单文件重构上,Kimi K3 确实便宜 5-10 倍(0.04 美元 vs 0.18-0.22 美元);多文件长推理场景下,价差缩到约 60%;到 agent 多步操作时只剩 30-40%。三位工程师从 Claude Code 迁到 Codex 分别花了 4 小时、2 小时和 1.5 小时,一周内全部恢复原有产速。约八成工程师没感受到 Thompson 所说的"harness 粘性"——模型的权重比工具的壳更重要。
但 Thompson 对 token 效率的判断却被数据扎扎实实地印证了。中国模型在复杂任务上的性价比优势缩水严重,远不是看 token 单价时那种"1/10 成本"的震撼效果。
参考来源: