一、案例背景
2026年8月,一则来自The Information的报道在人工智能领域引发震动:字节跳动创始人张一鸣在两周前的Seed全员会上罕见发声,明确拒绝以“蒸馏”手段追赶前沿大语言模型。他的态度坚决:“字节跳动应该愿意为了长远目标牺牲一些短期利益。”
这一表态的背景,是字节跳动在大模型竞赛中面临的严峻局面。最新一期Artificial Analysis全球LLM排行榜显示,中国模型已占据全球前十近半席位:月之暗面Kimi K3 Max位列第二,阿里Qwen 3.8 Max位居第四,智谱GLM 5.2 Max、DeepSeek V4 Flash分列第七、第八。而字节跳动的Seed 2.1 Pro,仅排在第21位,远低于其他中国模型。
这一排名与字节跳动的资源禀赋形成鲜明反差。论资金,字节跳动年利润规模位居互联网行业头部;论人才,Seed团队汇聚了从搜广推体系成长起来的顶尖算法人才;论算力,数万张GPU集群的智算中心正在全国铺开;论数据,抖音与TikTok坐拥全球最大的原生内容池。样样不缺的字节跳动,为何在大模型榜单上追不上?
答案的关键,恰恰在于字节跳动拒绝走的那条“捷径”——蒸馏。
蒸馏(Distillation),通俗而言,就是拿其他大模型的答案来训练自己的模型。这条路径见效极快:几百万条高质量指令数据灌入模型,基准测试分数能在短短几周内突飞猛进。在大模型竞速的早期,几乎所有玩家都试过这招。然而,字节跳动内部至少有三次关于是否蒸馏的路线之争,每一次都被张一鸣否决。
第一次冲突发生在2025年1月。DeepSeek-R1横空出世,其推理风格席卷全球。Seed内部有研究员提议跟进蒸馏,张一鸣拒绝了——他要的是Seed像人类一样“学习如何思考”,而不是模仿R1的“碎碎念”。
第二次冲突出现在英伟达Blackwell芯片部署后。算力差距拉大,竞争对手拿到了英伟达最新的“入场券”,字节跳动只能靠H20“苦撑”,蒸馏呼声再起。但张一鸣再次说不,字节选择增资2000亿,在乌兰察布和怀来加盖智算中心。
……