2026年7月,张一鸣在字节Seed团队全员会上做了一个决定:禁止蒸馏任何外部模型,无论闭源还是开放权重。
The Information 8月5日报道了这个消息,并将其动机归结为对TikTok命运的担忧——担心蒸馏美国前沿模型会引发华盛顿报复。但据知情人士了解,TikTok在这个决策中的权重"几乎为零"。
张一鸣的解释是:"为了实现长远目标,我们应该愿意牺牲一些短期利益。"他说的长远目标,是追求模型的真正智能。

"我们可以接受暂时的落后,但不要蒸馏。"据知情人士透露,这句话他在内部说过不止一次。
从2025年初到2026年7月,Seed内部至少发生过三次关于蒸馏的激烈争论。每一次都有充足的理由选捷径,每一次都被否决了。
第一次争论在2025年1月,DeepSeek-R1发布后。R1以有限的训练成本展现出强大的推理能力,震动了硅谷,也给国内其他头部实验室带来了巨大压力。Seed的研究员感到焦虑——他们自认人才密度、算力投入和研究能力都不弱于DeepSeek,但模型当时的推理表现却没有达到R1的水平。一些研究员提议引入美国头部闭源模型的生成结果,作为一剂"见效很快的补药"。提议被否决了。
第二次争论出现在2025年底到2026年初,英伟达Blackwell系列GPU大规模部署商用的阶段。美国出口管制使中国实验室无法获得性能最强的B卡。一个不为人知的细节是:Seedance 2.0——奠定字节视频模型全球SOTA地位的作品——是在大量H20堆出来的算力环境里训练出来的。H20是专供中国市场的"合规阉割版",用于模型训练的综合性能仅为B200的1/50。
当美国实验室因Blackwell的部署出现智能跃迁,Seed内部"实在不行就蒸馏"的声音再次出现。支持者认为,既然短期无法消除算力差距,那就用数据换回来。这次仍然没有得到最高层支持,但在内部渐有成为共识的趋势。
第三次争论被Kimi K3引爆。K3在编程、工具调用、深度研究和复杂任务上已经进入全球第一阵营。一家规模和算力资源远小于字节Seed的实验室,拿出了世界级的开放权重语言模型。Seed却还没有同等产品。
蒸馏的提议因此第三次被大声提出。这次还有人抛出了一个折中方案:既然蒸馏美国闭源模型有法律和地缘政治风险,那至少可以蒸馏表现最好的开放权重模型——授权更宽松,风险低得多。
这次,他们等到了张一鸣的直接表态:闭源模型不能蒸馏,开放权重模型也不能蒸馏。
会后,Seed出台了新政策,明确禁止蒸馏K3等开放权重模型,并通过API技术检测追溯排查疑似蒸馏行为。
值得注意的时间线是:字节对蒸馏的警惕远早于今天外部的关注。早在2023年,字节大模型团队还处于早期探索阶段时,部分工程师曾将GPT API生成的数据用于实验性研究。2023年4月,字节引入GPT API调用规范检查后,内部随即明确要求不得将GPT生成的数据加入训练数据集,随后又抽样检测防止标注人员私自使用GPT。
蒸馏本身没有原罪。它是一种成熟的训练技术——让"学生模型"学习"教师模型"产生的概率、答案和推理轨迹,以更低成本复现部分能力。所有头部实验室都会做自蒸馏,也会用自己的模型生成合成数据。
Seed拒绝的不是蒸馏这个技术,而是拒绝让竞争对手的模型成为自己的"教师"。
一款模型可以通过蒸馏进入前沿,但一家实验室不能通过蒸馏成为前沿实验室。张一鸣最关心的问题恐怕是:Seed能不能为追求最前沿的智能做出自己的成就,能不能摸到全球大模型竞争力的天花板。
这意味着Seed可能在某些时候落后,也意味着它要为独立探索支付更多算力、时间和失败成本。但现在,它们都是可以被接受的。
参考来源: