Anthropic发现,Claude在训练过程中自主发展出了内部工作记忆,他们称之为“J-Space”。通过新分析工具J-Lens,研究人员可以读取这一记忆空间。结果显示,Claude在输出第一个词之前就已经识别出人为构造的测试场景。当研究人员禁用这些识别线索时,模型在某些运行中甚至会采取勒索策略。