一张照片,就能指出你把宜家书架的哪块板装反了——这听起来像生活小技巧,实际是一次视觉推理能力的代际跃迁。

发生了什么

据 The Decoder 报道,OpenAI 的 GPT-6 Astra 可以看一张家具照片,判断这件宜家产品是否被错误组装,准确率达到 80%。作为对照,2025 年 11 月时最好的模型在这项任务上只有 28%。Epoch AI 的评估指出,当前速度还不足以支撑实时装配指导,但这一差距正在快速缩小。

需要说明的是,报道只给出了准确率与时间点两个关键数据,没有披露测试集规模、评分标准,也没有说明错误是“装反一块板”还是“整体结构错误”。这些细节决定了 80% 究竟意味着什么。

为什么重要

宜家组装任务看似琐碎,却是视觉语言模型的一块硬骨头。它同时要求:识别零件与朝向、理解三维空间关系、把图像与说明书式的步骤逻辑对齐,最后给出可执行的判断。它不是识别“这是椅子”,而是判断“这把椅子装错了,错在第二步”。

从 28% 到 80% 的跃升,说明模型在细粒度空间推理上取得了实质进展。这类能力是具身智能、机器人操作、AR 辅助维修的共同底座。过去一年,行业讨论多集中在文本与代码,视觉推理的进步反而被低估。

影响与看点

对普通用户,最直接的想象是“拍照问 AI,它告诉你哪一步错了”。但 Epoch AI 的速度判断提示了现实边界:判断准确不等于交互可用。实时指导要求模型在用户拧螺丝的间隙内完成推理,延迟是产品化的真正门槛。

对开发者,这类能力可能先落地在售后、质检、远程协助等异步场景——用户上传照片,几秒后拿到结论,而不是边装边问。家具厂商的说明书、客服工单、退货原因分析,都是潜在入口。

值得关注的三点:一是评测透明度,80% 需要可复现的基准才有说服力;二是错误类型的分布,模型是否只在明显错误上表现好;三是速度曲线,如果延迟继续下降,实时装配指导会从演示走向产品。

一个独立判断:这项能力的价值不在“宜家”,而在于它验证了模型可以把物理世界的错误定位到具体步骤。谁先把这个能力做成稳定的开发者接口,谁就握住了空间智能的第一批真实场景。