字节跳动要炼10万亿参数大模型:中国大模型军备竞赛进入新阶段
据英国《金融时报》8月7日报道,字节跳动正在训练一个目标参数量高达10万亿的大模型,目前处于早期预训练阶段。
10万亿是什么概念?目前中国已发布的最大模型是月之暗面的Kimi K3,大约2.8万亿参数。字节这个目标如果落地,是Kimi K3的三倍多,甚至可能超过Anthropic的旗舰Mythos 5(业内估计约8万亿参数)。
换句话说,字节不光想追,还想超。
八周五模型,中国大模型集体爆发
过去两个月,中国大模型赛道已经够热闹了。阿里Qwen3.8-Max、月之暗面Kimi K3、DeepSeek-V4-Flash、智谱GLM-5.2、字节Seedance 2.5,八周内五款重磅模型接连亮相,被市场称为「八周五模型」。
斯坦福《2026人工智能指数报告》指出,中美顶尖模型的综合性能差距已经大幅收窄。更关键的是,大量美国企业和硅谷初创公司出于成本考量,正把业务流量切到中国大模型上。当性能差距缩小到可以忽略的程度,成本和部署灵活性就成了决定性因素。
字节在这个节点上押注10万亿参数,信号很明确:不只是要追赶,而是要在基础模型层面建立代际优势。
禁止蒸馏:张一鸣的「不走捷径」
更值得注意的是张一鸣在内部会议上的表态:明确反对蒸馏技术。他说「蒸馏最多只能逼近对方,很难真正实现超越」。
这个表态的含金量很高。蒸馏是当前大模型行业的一个灰色地带,很多公司通过蒸馏OpenAI、Anthropic的模型快速追赶。但蒸馏的天花板就是被蒸馏的模型本身。字节的路线是纯自研,接受短期落后,但追求长期超越。
结合字节CEO梁汝波的表态「大语言模型会坚持自研,接受短期落后」,可以看出字节在大模型上的战略定力:不追求短期benchmark好看,而是追求底层能力的真正突破。
模型+应用,字节的双轮飞轮
字节的可怕之处在于,它不只是有模型,还有应用。豆包月活已经达到3.82亿,是国内最受欢迎的AI应用。Seedance 2.5在视频生成领域跻身全球最先进之列。
如果10万亿参数模型落地,字节在消费者端有豆包承接流量,在企业服务端有火山引擎承接需求。模型能力越强,应用体验越好;应用用户越多,模型训练的数据和反馈越丰富。这是一个完整的飞轮。
中国大模型军备竞赛进入了一个新阶段。不再是「谁能追上GPT」,而是「谁能建立系统性优势」。字节的10万亿,可能就是这场竞赛的分水岭。

关键是模型加应用的飞轮,豆包3.82亿月活给了字节足够的数据喂养
禁止蒸馏这个表态含金量很高,不走捷径才是真的想赢
八周五模型,中国大模型这波爆发确实猛,斯坦福都承认差距缩小了
10万亿参数,这规模真不是开玩笑的,字节这是要all in了