字节跳动明确禁止蒸馏任何SOTA模型,张一鸣强调追求模型本源智能

2026年8月5日,据《The Information》报道,字节跳动创始人张一鸣在一个月前举行的Seed全员会上明确表示:字节跳动不会利用模型蒸馏来加速自身大语言模型的能力提升。

该报道曾分析称,字节跳动拒绝蒸馏美国前沿AI实验室模型,是出于对华盛顿方面可能报复的担忧,以保护TikTok等核心资产。但内部信源证实,TikTok前景在禁令决策中的权重几乎为零。

张一鸣在会上解释禁令原因时指出:“为了实现长远目标,我们应该愿意牺牲一些短期利益。”此处“长远目标”并非指向TikTok命运,而是指追求模型的真正智能——即模型的无限智能演进能力。

知情人士透露,张一鸣曾在Seed内部多次表态:“我们可以接受暂时的落后,但不要蒸馏。”

过去半年,美国AI实验室Anthropic已公开指控通义千问、DeepSeek、月之暗面和MiniMax等中国机构,通过大规模虚假账号和代理网络获取Claude输出用于模型能力提升。模型蒸馏正成为中美AI竞争中日益敏感的技术行为。

但字节跳动对蒸馏的反对早于该竞争叙事。早在2023年4月,字节引入GPT API调用规范检查后,即明令禁止将GPT生成数据加入训练集;随后开展内部抽样检测,核查模型输出与GPT的相似度,防止数据标注人员私自使用GPT。

2025年起,Seed内部至少发生三次关于是否采用蒸馏的路线争论。第一次发生于2025年1月DeepSeek-R1发布后,部分研究员提议引入美国头部闭源模型生成结果以快速提升推理与综合表现,该提议被否决。

第二次争论发生于2025年底至2026年初英伟达Blackwell系列GPU在美国大规模商用阶段。受美国高端GPU出口管制影响,Seed训练所用H20算力仅为B200的1/50;同期GPT-5.5、Claude 4.8及Claude Fable 5在推理、编程与科学领域出现智能跃迁,加剧内部压力,“实在不行就蒸馏”动议获得较多支持,但仍未获最高层批准。

第三次争论由Kimi K3成功引发。K3在编程、工具调用、深度研究与复杂任务上已进入全球第一阵营,而投入更大、人才更多的Seed尚未推出同级语言模型,蒸馏提议再度高涨,并衍生出折中方案:仅蒸馏开放权重模型以规避法律与地缘风险。

对此,张一鸣明确表态:闭源模型不能蒸馏,开放权重模型也不能蒸馏。他重申:“Seed可以接受暂时的落后,但不接受依靠蒸馏竞争对手来消除这种落后。”

此次全员会后,Seed出台新政策,明令禁止蒸馏K3等开放权重模型,并通过API技术手段追溯排查疑似蒸馏行为。

模型蒸馏本身是成熟技术,指学生模型学习教师模型的概率分布、答案、推理轨迹或工具调用过程,以低成本复现部分能力。所有头部实验室均进行自蒸馏及合成数据回填,但Seed拒绝将任何外部SOTA模型——无论开源或闭源——作为“教师爷”。

当发现落后时,Seed允许研究对手论文、分析技术报告、复现评测结果、自查数据与架构;但禁止直接将对手模型变为“教师”,批量生产答案并沿其路径前进——尽管后者通常更快,可在数月内补齐benchmark差距,却无法揭示能力生成机制,亦无法支撑下一代智能边界的自主突破。

三次蒸馏动议均发生在Seed具备充分现实理由选择捷径之时:首次为应对R1推理冲击,第二次为跨越H20与Blackwell算力鸿沟,第三次为缩小与Kimi K3及美国头部闭源模型的差距。三次均被否决。

这一原则性立场发端于外部风险与政策压力之前,其核心关切在于:Seed能否为追求最前沿智能程度做出独立成就,能否摸到全球大模型竞争力的天花板。一款模型可通过蒸馏进入前沿,一家实验室却不能通过蒸馏成为前沿实验室。

这意味着Seed可能阶段性落后,需承担更高算力、时间与失败成本。但这些代价已被视为可接受的必要投入。

免责声明:本文内容由开放的智能模型自动生成,仅供参考。

最新文章
Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号