張一鳴:字節不走模型蒸餾捷徑,寧願大模型暫時落後
ChainCatcher 消息,字節跳動創始人張一鳴上月在 Seed 團隊全員會上明確表示,公司不會將模型蒸餾作為追趕大模型的捷徑,即使因此暫時落後於國內競爭對手。他要求團隊願意犧牲短期收益以換取長期目標。
蒸餾是指讓新模型學習更強模型的輸出,可節省訓練時間和算力。字節內部認為,這一選擇將使 Seed 的語言模型在短期內更難追上 DeepSeek、Kimi 及千問等國內同行。但字節更擔心的在於政治風險:公司長期因 TikTok 接受美國政府審查,一旦被指控大規模提取美國前沿模型能力,華盛頓可能重新向 TikTok 施壓。此前 Anthropic 曾指控 DeepSeek、月之暗面、MiniMax、智譜及阿里巴巴大規模提取 Claude 的能力,但未點名字節。






