AMD收购了加拿大初创公司Taalas,后者采用一种激进的技术路线:将AI模型的权重直接硬编码到芯片中。这一策略让推理速度达到极致,但也意味着每颗芯片只能运行一个固定的模型。

发生了什么

据The Decoder报道,AMD已收购Taalas,该公司专注于将模型权重直接固化在推理芯片上。其演示芯片在运行Llama 3.1-8B时,每用户每秒可处理超过16,000个token。这种硬编码方式省去了通用计算所需的灵活调度,从而大幅提升速度和能效,但代价是芯片无法适配其他模型。

为什么重要

传统AI芯片(如GPU)通过通用计算单元运行各种模型,而Taalas的做法相当于为特定模型量身定制硬件。这并非全新概念,但Taalas的进展表明,在特定场景下,硬编码芯片的性能优势可能远超通用芯片。据报道,Google也在探索类似路径,用于Gemini模型。AMD的收购意味着其将押注这一方向,可能对NVIDIA的通用GPU主导地位构成挑战,尤其是在推理成本敏感的规模化部署场景。

影响与看点

对行业而言,硬编码芯片可能成为高吞吐、低延迟推理的利器,尤其适合固定模型的大规模服务,如语音助手或推荐系统。然而,其灵活性不足也限制了应用范围——模型一旦更新,芯片即需更换。对开发者来说,这意味着在追求极致性能时,可能需要权衡模型迭代的便利性。AMD能否将Taalas的技术产品化,并平衡灵活性与性能,将是未来看点。我的判断是,这不会取代通用芯片,但会在特定细分市场开辟新赛道。