自我改进的 AI Agent 有一个隐蔽的失效模式:它会把测试任务背下来,而不是学会解决问题。Google 研究者提出的 RRSI 试图在训练环节就掐住这个倾向。

发生了什么

据 The Decoder 报道,Google 的研究者发现,自我改进(self-improving)的 AI Agent 在反复迭代中容易对测试任务产生记忆化:Agent 在自己的输出上继续训练、不断“刷分”,但刷出来的提升往往绑定在特定任务上。一旦换成新任务,收益就会缩水甚至消失。

针对这一点,研究者提出 RRSI 方法,用来约束这种记忆化效应。报道给出的结果是:在未见过的基准上,RRSI 把分数最多提升了 4.7 分,同时比未加正则化的版本少用约 30% 的 token。换句话说,它同时改善了泛化能力和推理成本。

为什么重要

自我改进是当前 Agent 研究里最有吸引力、也最容易自欺的一条路线。让模型生成轨迹、筛选、再训练,看起来像一个能自己变强的闭环;但如果评测集和训练信号纠缠在一起,这个闭环就会退化成“背题”。分数在涨,能力没涨,而且涨得越多,越难被察觉——因为评测本身就是被优化的对象。

这在方法论上是个老问题:训练集与测试集污染。但 Agent 场景把它放大了。传统监督学习里,训练数据和评测数据至少是分离的;而在自我改进循环中,Agent 自己产出的轨迹既当训练数据,又直接对应评测任务,边界天然模糊。加上 Agent 任务通常是多步交互、带工具调用和环境状态,记忆化的形式也更隐蔽——不一定是记住答案,而可能是记住某条捷径、某个工具调用顺序,或者某种对特定环境布局的过拟合。

RRSI 的价值在于,它把“防止背题”从评测阶段的补救,前移成了训练阶段的正则化。而且它顺带降低了 token 消耗,这说明被抑制掉的那部分行为本身就是冗余的——模型在反复确认它已经背下来的东西。

影响与看点

对做 Agent 训练的团队来说,这条路线值得关注的点有三个。

第一,评测可信度。自我改进类工作如果只报告在自己循环里刷出来的分数,参考价值有限;RRSI 这类方法的意义不只是提分,而是让“在未见任务上的提升”重新成为可测量的指标。

第二,成本结构。约 30% 的 token 节省在 Agent 场景里不是小数——多步轨迹的 token 消耗本来就高,训练和推理两端都会受益。如果正则化能同时提升泛化和效率,那它就不只是防作弊手段,而是常规训练配置的一部分。

第三,可迁移性。目前公开信息只覆盖了 Google 研究者的这一组结果,RRSI 在不同任务类型、不同 Agent 架构上是否同样有效,还需要更多验证。尤其是当任务从静态问答转向长程、带真实环境反馈的交互时,记忆化的形态会变,正则化的设计也需要跟着变。

一个独立判断:自我改进 Agent 的瓶颈,短期内可能不在“能不能自己变强”,而在“怎么确认它真的变强了”。RRSI 属于后一类工作,方向比单点分数更重要。