GPU在训练大模型时是绝对主力,但在推理阶段,尤其是面对智能体(agent)这类需要多步交互、动态决策的工作负载时,常被认为效率低下。法国初创公司Kog对此提出不同看法:问题不在GPU本身,而在于推理优化的方式。

发生了什么

据TechCrunch报道,Kog公司正在深入研究如何从GPU中榨取更多推理性能,其核心观点是:GPU并非不适合智能体工作负载,而是现有推理优化方法未能充分适应这类负载的特性。Kog认为,智能体工作负载(如多轮工具调用、动态规划、上下文切换)与传统批量推理不同,需要更精细的调度和资源管理。该公司正在开发技术,旨在让GPU在智能体场景下发挥更大效用,而非简单依赖专用硬件或牺牲灵活性。

为什么重要

当前,智能体(agent)被视为AI应用的下一个前沿,从编程助手到自动化工作流,都依赖模型进行多步推理和工具调用。然而,这类负载通常涉及短小但频繁的请求、高延迟敏感性和动态的上下文长度,这与GPU擅长的高吞吐、静态批量处理模式存在冲突。业界普遍认为,GPU在推理阶段(尤其是智能体场景)效率低下,因此许多公司转向CPU或混合架构。Kog的立场挑战了这一共识,指出通过优化推理栈(如调度、内存管理、批处理策略),GPU仍能胜任智能体负载,甚至可能成为更优选择。这一观点若成立,将影响AI基础设施的部署决策,尤其是那些已大量投资GPU的云服务商和企业。

影响与看点

Kog的探索对开发者、云服务商和AI基础设施供应商都有潜在影响。对于开发者,如果GPU能高效处理智能体负载,意味着他们可以继续利用现有GPU资源,而无需迁移到其他硬件,降低成本和迁移风险。对于云服务商,这可能意味着GPU实例在推理市场的竞争力增强,尤其是在提供智能体API服务时。值得关注的是,Kog具体采用何种优化技术——是改进KV缓存管理、动态批处理,还是设计更适配智能体模式的调度算法?此外,Kog是否计划开源其优化方案,或将其集成到主流推理框架(如vLLM、TensorRT-LLM)中,也将影响其普及程度。独立来看,Kog的论点虽具启发性,但需实证数据支撑——智能体负载的多样性极强,单一优化可能难以覆盖所有场景。因此,其实际效果仍需在真实工作负载中验证。

未来,若Kog能证明GPU在智能体推理上的潜力,或将推动推理优化领域的新一轮创新,并重新定义硬件与软件的分工。