剑指国内最大规模!字节跳动被曝正讨论训练超5万亿参数模型,张一鸣称“可接受暂时落后”

🤖 由 文心大模型 生成的文章摘要

字节跳动内部正在讨论训练一个参数规模超过5万亿的全新大模型。这一规模将使其成为国内已知参数最大的模型,远超当前业界主流产品。

消息一出,立即引发AI圈高度关注。在算力与数据成本高企的背景下,如此大规模的模型训练计划,既彰显了字节跳动在AI基础研究上的野心,也折射出内部对技术领先地位的迫切渴望。

据悉,该模型将由 Seed Foundation(种子基金会)负责人项亮主导,与大语言模型预训练数据负责人沈科合作。

报道援引多名字节跳动人士透露,上半年多个Seed团队已开始进行深刻反思,这也是讨论训练超大规模模型的重要原因之一。

有内部人士直言,将参数规模一次推到同行的数倍以争取领先位置,此举“像一场赌博”。这表明,在激烈的行业竞争中,字节跳动正考虑通过极致的规模优势实现弯道超车或拉开差距。

值得注意的是,就在两周前的Seed全员会上,字节跳动创始人张一鸣 对团队进行了安抚与战略定调:

心态上:他认为训练大模型本就是难事,团队不必过度焦虑,并明确一段时间内可接受模型落后于行业。

目标上:希望大家以追求智能上限为核心目标,期待Seed模型能力能跻身世界第一梯队。

路线上:他特别强调编程是当前的关键方向,并明确反对蒸馏。在他看来,蒸馏虽能短期改善表现,但本质是复制Claude等现有模型的能力,难以实现真正的超越。

当前,国内已知的大模型参数规模纪录为阿里的Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数)。字节跳动这一尚在讨论中的计划,若最终落地,将在参数规模上形成显著代际优势。

不过,消息也指出该计划仍处于早期阶段,最终是否实施、何时实施仍存在不确定性。在大模型追求参数规模的同时,训练成本、数据效率、算力约束和实际性能提升之间的平衡,也是行业普遍关注的焦点。