字节跳动正在训练一个参数规模高达 10 万亿的 AI 模型,试图在基础模型能力上与 Anthropic 等国际头部实验室一较高下。这一消息由 Ars Technica 率先披露,迅速引发行业关注。
发生了什么
据 Ars Technica 报道,TikTok 的母公司字节跳动正在训练一个拥有 10 万亿参数的大规模 AI 模型。这一参数规模远超目前公开的绝大多数模型——作为对比,OpenAI 的 GPT-4 据传参数规模约为 1.8 万亿(未官方确认),而 Anthropic 的 Claude 3 系列参数规模也未公开,但普遍认为在万亿级别以下。字节跳动的这一动作,显然意在跻身全球 AI 竞赛的第一梯队。
目前,字节跳动尚未官方确认这一消息,但公司此前已在 AI 领域有所布局,包括推出云服务平台火山引擎,以及开源多个模型。此次训练万亿参数模型,可以视为其在基础模型研发上的重大投入。
为什么重要
字节跳动的这一举措,背后有多重战略考量。首先,TikTok 的全球化业务需要强大的内容推荐和生成能力,而大模型是提升这些能力的关键。其次,字节跳动在 AI 领域的布局一直相对低调,但此次训练万亿参数模型,表明其不甘于只做应用层创新,而是要在基础模型层面建立核心竞争力。
从行业格局来看,目前基础模型领域由 OpenAI、Anthropic、Google 等美国公司主导,中国公司中,百度、阿里、腾讯等也在积极投入,但参数规模多集中在千亿级别。字节跳动若成功训练 10 万亿参数模型,将使其在模型规模上超越多数同行,甚至可能比肩 Anthropic 的下一代模型。
此外,这一消息也反映出全球 AI 竞赛的激烈程度。算力、数据、算法和资金,缺一不可。字节跳动作为全球最大的短视频公司,拥有海量用户数据和强大的工程能力,这为其训练超大模型提供了独特优势。
影响与看点
对于行业而言,字节跳动的入局将加剧基础模型的竞争,可能推动模型能力的整体提升,同时也会带动算力、数据等上游产业的发展。对于开发者来说,如果字节跳动未来开源或开放该模型的 API,将提供一个新的选择,尤其是在中文和多语言场景下,可能具有独特优势。
然而,挑战同样巨大。训练 10 万亿参数的模型,需要极高的算力投入和工程优化能力,据估算,其训练成本可能高达数亿美元,且需要数月时间。此外,数据获取和合规也是难题,特别是在全球监管趋严的背景下,字节跳动需要在数据隐私和内容安全上投入更多精力。
一个值得关注的看点是,字节跳动是否会选择开源这一模型。如果开源,将极大推动中国乃至全球的开源生态;如果闭源,则可能通过 API 服务实现商业化。无论哪种方式,都将对现有格局产生深远影响。
独立判断:字节跳动训练万亿参数模型,不仅是技术实力的展示,更是其在 AI 时代争夺话语权的关键一步。然而,模型规模并非一切,如何将算力转化为实际应用价值,才是真正的考验。


