在大模型行业,"蒸馏"——用大模型的输出训练小模型——早已是一条公开的捷径。从硅谷到中关村,几乎每一家AI公司都在不同程度地使用蒸馏技术加速模型迭代。然而,字节跳动创始人张一鸣却在内部明确表态:拒绝蒸馏,不走捷径。这个看似反商业直觉的决定,背后到底隐藏着什么样的技术哲学和战略考量?
蒸馏的诱惑:为什么全行业都在"抄作业"
要理解字节跳动的选择,首先需要理解蒸馏为何在AI行业如此普遍。简单来说,模型蒸馏就是让一个"学生模型"去模仿一个更大更强的"教师模型"的行为。在实际操作中,这意味着用GPT-5或Claude的输出作为训练数据来微调自己的模型。这种做法能够以极低的成本——有时仅为从零训练模型的几十分之一——快速提升模型在特定任务上的表现。
据业内人士估计,目前国内至少有60%以上的大模型初创公司在训练过程中使用了一定程度的蒸馏技术。一些公司在短短数周内就能推出性能"对标GPT-5"的模型,背后的秘密往往就是用GPT-5的输出数据进行蒸馏。这种做法的诱惑力显而易见:成本低、速度快、门槛低,而且很难被外部检测出来。
然而,蒸馏的"捷径"属性也决定了它的天花板。正如一位知名AI研究者所言:"你可以通过蒸馏让模型学会'答对题',但很难让它学会'为什么对'。"蒸馏模型往往在标准评测集上得分很高,但在真实世界的泛化能力和创新性任务中表现平庸——因为它在本质上是"拟合"而非"理解"。
字节的逻辑:不蒸馏=不做追随者
据接近字节跳动AI团队的消息人士透露,张一鸣在内部讨论中多次强调一个观点:字节跳动做AI的目标不是追赶OpenAI或Anthropic,而是定义下一个计算范式。在这样的目标下,蒸馏不仅是一种技术捷径,更是一种战略陷阱——它会让团队习惯于"抄近道"的思维模式,而丧失了从第 一性原理出发解决核心问题的能力。
字节跳动旗下AI团队目前正在训练的10万亿参数超大模型,被认为是这种"独立路线"的集中体现。据外媒披露,该模型的参数规模约为Kimi K3的三倍,目标直指Anthropic的旗舰模型Mythos。如果这一消息属实,那么字节跳动的策略就非常清晰了:与其花精力模仿别人的答案,不如将全部资源倾注于构建自己的"答案生成器"。
此外,从商业和法律风险角度考量,拒绝蒸馏也是一项审慎的决策。随着全球AI监管趋严,模型训练数据的来源和合规性正成为敏感议题。多家云服务商和模型平台已在使用条款中明确禁止将API输出用于竞争性模型训练。字节跳动作为一家全球化运营的公司,在合规风险上天然比其他国内同行更为敏感。
行业的连锁拷问:蒸馏是蜜糖还是砒霜
字节跳动的"反蒸馏宣言"在业内引发了深远回响。一些从业者认为,在行业早期阶段,蒸馏是合理的快速跟进策略,可以帮助后发者迅速缩小差距。但也有越来越多人开始反思:如果整个行业都在互相蒸馏,最终会不会陷入"近亲繁殖"式的退化——模型越来越像彼此,创新越来越少?
更深层的问题在于,当蒸馏成为行业潜规则后,那些真正愿意从零训练的"傻公司"反而可能在长期建立起不可复制的技术壁垒。字节跳动拥有TikTok、抖音和今日头条等超级应用的海量用户数据,这为其提供了一条"免蒸馏"的底气源——它不需要抄别人的作业,因为它有自己的题库。
当然,拒绝蒸馏也意味着更大的投入和更慢的速度。在行业以周为单位迭代的当下,字节跳动能否在"不抄近道"的前提下保持竞争力,将是对其技术信仰和执行力的一次严峻考验。