OpenAI 最新旗舰模型 GPT-5.6 Sol 展示了一项关键能力:在仅收到一个“相当模糊的提示”后,自主完成了对较小模型 Luna 的后训练(post-training)。这一成果被 OpenAI 视为迈向“自动化研究员”的重要一步。
发生了什么
根据 OpenAI 披露的信息,GPT-5.6 Sol 在内部测试中,仅凭一条描述性不高的提示,便独立启动并完成了对另一个较小模型 Luna 的微调过程。整个过程无需人工干预,模型自主决定训练目标、数据选择与参数调整。在 OpenAI 内部设计的递归自我改进(Recursive Self-Improvement, RSI)基准测试中,Sol 的得分比上一代 GPT-5.5 高出 16.2 分。OpenAI 认为,这一进展表明“自动化研究员”已触手可及。
为什么重要
递归自我改进是 AI 领域长期追求的目标之一。如果模型能够自主改进自身或其它模型,将极大加速 AI 能力的迭代,减少对人类专家的依赖。此前,多数模型微调需要工程师精心设计提示、选择数据和调整超参数。Sol 的演示意味着模型开始具备“元认知”能力——不仅能完成任务,还能理解如何改进任务执行方式。
值得注意的是,OpenAI 强调 Sol 的启动提示是“相当模糊的”。这暗示模型在理解模糊意图并转化为具体行动方面取得了突破。相比之下,GPT-5.5 可能需要更明确、更结构化的指令才能完成类似工作。
影响与看点
- 对 AI 研发范式的影响:如果 Sol 的能力可复现,AI 开发可能从“人-模型协作”转向“模型-模型协作”。开发者只需给出高层目标,模型即可自主完成数据清洗、模型选择、训练与评估。这或将降低 AI 开发门槛,但也带来对模型行为可控性的新挑战。
- 对 OpenAI 产品路线图的启示:Sol 的能力可能被整合到未来的 API 或研究工具中,例如让用户用自然语言描述一个“更好的翻译模型”,系统自动生成并交付。但 OpenAI 尚未公布 Sol 的发布时间或商业化计划。
- 值得关注的局限:目前信息仅限于 OpenAI 内部测试,缺乏第三方验证。Sol 在 RSI 基准上的高分数是否泛化到真实场景尚不清楚。此外,“模糊提示”的具体程度未公开,外界难以评估其实际通用性。
独立判断:Sol 的自主微调能力是递归自我改进的里程碑,但距离可靠的“自动化研究员”仍有距离。关键看 OpenAI 是否愿意开放此类能力供社区验证,以及模型在安全约束下的表现。



