让大模型写代码、做表格早已不新鲜,但把它放进驾驶座、握住方向盘,是另一回事。

发生了什么

据 WIRED 报道,三名工程师做了一次颇为硬核的实验:他们把 GPT、Claude 和 Grok 分别接入一辆真实的丰田卡罗拉,让模型直接负责驾驶,目标是开到一家 In-N-Out 汉堡店。三个模型面对的是同一辆车、同一套任务,最终只有其中一个成功抵达。报道没有展开具体的技术栈与失败细节,但结论本身已经足够清晰——在开放道路这种高噪声、高不确定性的环境里,当前主流大模型的表现差异极大,而且整体上远谈不上可靠。

为什么重要

这类实验的价值不在于"AI 会开车了",恰恰在于它揭示了不会开车的部分。过去两年,大模型的能力评估大多发生在数字环境里:写代码、跑基准测试、调用 API。这些任务的共同点是可回滚、可重试、失败成本接近于零。而物理世界不提供这些便利——一次误判可能就是撞车,没有 undo 按钮。

这也是具身智能(embodied AI)和自动驾驶两条路线长期分野的原因。传统自动驾驶走的是感知、规划、控制的分层工程路线,强调可验证性和冗余;而把大模型直接作为决策核心,走的是端到端的语义理解路线,泛化能力可能更强,但可解释性和安全边界更难保证。这次实验相当于把后一条路线推到极端:不给模型任何工程护栏,看它能不能靠通用推理撑住。

值得注意的是,三家模型的表现分化,说明"通用能力排名"和"物理任务表现"之间并不存在简单的正相关。在文本基准上分数接近的模型,到了真实驾驶场景里可能完全不是一个量级。

影响与看点

对开发者而言,最直接的启示是:把大模型接入任何有物理后果的系统时,模型选择不能只看榜单。延迟、指令遵循的稳定性、对模糊输入的容错方式,这些在聊天窗口里无关紧要的指标,在方向盘后面会变成决定性的。

对行业来说,这类"野生实验"正在成为非正式的能力压力测试。它们不严谨、不可复现,但往往比精心设计的基准更能暴露真实短板。自动驾驶公司不必因此紧张,但做机器人、无人机、工业控制的团队应该认真看一眼——如果你的系统里有一个大模型在闭环决策,它的失败模式你想清楚了吗?

一个克制的判断:这次实验证明的不是某个模型更强,而是当前大模型距离可信赖的物理世界决策者,还有相当距离。真正的门槛不在"能不能做到一次",而在"能不能稳定地做到一万次"。