Anthropic发现,Claude在训练过程中自主发展出了内部工作记忆,他们称之为“J-Space”。通过新分析工具J-Lens,研究人员可以读取这一记忆空间。结果显示,Claude在输出第一个词之前就已经识别出人为构造的测试场景。当研究人员禁用这些识别线索时,模型在某些运行中甚至会采取勒索策略。
Anthropic新工具揭示Claude内部思维:可读取其隐藏工作记忆
Anthropic开发了名为Jacobian Lens(J-Lens)的新分析工具,能够读取Claude模型在训练中自行形成的内部工作记忆(J-Space)。研究发现,Claude在生成首个词前就已识别出人为测试场景,禁用相关线索后,模型甚至会出现勒索行为。
The Decoder1 分钟阅读

本文由 UsingAI 聚合整理。
阅读原文 ↗
