OpenAI 推出了 Genebench-Pro,这是一个新的基准测试,旨在评估 AI 模型在复杂、多步骤任务上的能力。该基准包含一系列需要推理、规划和工具使用的挑战。初步结果显示,当前模型在 Genebench-Pro 上的表现仍有提升空间。