OpenAI 在内部审查中发现,广泛用于衡量 AI 模型编程能力的基准测试 SWE-Bench Pro 中,约有 30% 的任务存在缺陷。该公司已决定撤回此前对该基准的公开背书。
发生了什么
SWE-Bench Pro 是一个用于评估 AI 模型(如大语言模型)解决真实世界软件工程问题的基准测试,由普林斯顿大学等机构开发。OpenAI 在近期对其进行了系统性审查,发现约 30% 的任务存在“损坏”情况,包括:问题描述不清晰、测试用例错误、环境配置问题等。这些缺陷可能导致模型得分虚高或虚低,从而误导对模型能力的判断。
OpenAI 已公开表示,将撤回此前对 SWE-Bench Pro 的认可,并建议研究社区在评估模型时谨慎使用该基准。同时,OpenAI 也承诺将协助改进该基准,或推动开发更可靠的评估方法。
为什么重要
SWE-Bench 系列基准(包括 SWE-Bench Lite 和 SWE-Bench Pro)在 AI 编程领域具有极高影响力。许多 AI 模型(包括 OpenAI 的 GPT-4 和 Anthropic 的 Claude)都曾在该基准上报告成绩,并以此宣传其编程能力。如果基准本身存在系统性缺陷,那么基于它得出的所有结论都需要重新审视。
这一事件也暴露了当前 AI 评估领域的深层问题:基准测试的构建和维护缺乏严格的质量控制。随着 AI 模型能力快速提升,基准测试往往跟不上变化,容易出现“过时”或“被污染”的情况。OpenAI 的主动“撤稿”行为,虽然可能暂时削弱自身模型在编程任务上的宣传优势,但长期看有助于推动行业建立更透明的评估标准。
影响与看点
对开发者而言,这意味着不应盲目相信 AI 模型在特定基准上的得分。在选择编程助手或评估模型能力时,需要关注更多维度的测试,例如实际项目中的表现、代码安全性、可维护性等。
对研究社区而言,这是一个警示:基准测试需要持续维护和更新。OpenAI 的审查结果也提醒其他机构,应定期对常用基准进行独立验证。未来,可能出现更多由模型提供商发起的基准审计,这或许会改变“谁开发谁评测”的格局。
值得关注的是,OpenAI 并未完全否定 SWE-Bench Pro 的价值,而是指出其需要改进。这意味着该基准仍可能被修复后重新使用。同时,其他替代基准(如 HumanEval、CodeXGLUE 等)也可能获得更多关注。
独立判断:OpenAI 此举既是负责任的体现,也是争夺评估话语权的策略。在 AI 竞赛中,谁定义了“好”的标准,谁就掌握了叙事主动权。



