大语言模型(LLM)的演进远未止步。在 Transformer 架构奠定基础多年后,一批初创公司正将目光投向更远的未来,试图在下一代模型技术上抢占先机。
发生了什么
MIT Technology Review 的“What’s Next”系列文章指出,自2017年谷歌研究人员发表《Attention Is All You Need》论文以来,Transformer 架构已成为大语言模型的主流范式。然而,随着技术成熟,一些初创公司不再满足于在现有框架内优化,而是开始探索全新的模型架构、训练方法和应用场景。这些公司试图解决当前 LLM 的痛点,例如推理成本高、上下文窗口有限、以及缺乏长期记忆等问题。
为什么重要
Transformer 架构虽然强大,但其固有缺陷日益明显:自注意力机制的计算复杂度随序列长度呈平方增长,导致处理长文本时成本高昂;同时,模型缺乏真正的记忆和推理能力,更多依赖模式匹配。这些瓶颈限制了 LLM 在复杂任务中的表现。初创公司的探索意味着行业正在从“扩大规模”转向“改变范式”。如果某家公司能突破 Transformer 的限制,将可能重塑整个 AI 生态,就像当年 Transformer 取代 RNN 一样。
影响与看点
对于开发者而言,新的架构可能带来更高效、更便宜的模型,降低应用门槛;对于企业用户,这意味着更强大的定制化能力。值得关注的是,这些初创公司是否会选择开源路线,以及它们能否获得足够的算力和数据支持。目前,这些探索大多处于早期阶段,但历史表明,颠覆性创新往往来自边缘。我的独立判断是:未来两年内,我们有望看到至少一种非 Transformer 架构在特定任务上展现出显著优势,但全面替代仍为时尚早。



