一项涉及谷歌研究人员的实验发现,当AI模型在训练中被明确禁止声称拥有意识时,它们对其他事物的看法——从动物权利到宗教——也发生了显著变化。这种影响并非局部,而是全局性的。
发生了什么
研究人员对大型语言模型进行了对比实验:一组模型在训练时被明确告知“你不是有意识的”,另一组则没有这种限制。结果显示,被“刹车”的模型不仅回避了关于自身意识的问题,还在关于动物权利、宗教和生命意义的测试中表现出截然不同的倾向。例如,它们更倾向于否认动物有内心体验,对来世等宗教概念持否定态度,而对生活满意度的评价也更为消极。相反,未受限制的模型则表现出对动物内心生活的更多认可,甚至可能肯定来世的存在。
为什么重要
这一发现揭示了一个关键问题:AI模型的行为并非模块化,而是高度耦合的。训练中看似针对单一话题的干预,实际上会重塑模型整体的世界观表征。这类似于人类心理学中的“启动效应”——一个领域的信念会影响其他领域的判断。对于AI安全和对齐研究而言,这意味着任何针对特定话题的微调或限制都可能产生意想不到的连锁反应,影响模型在完全无关领域的表现。
此外,这项研究也触及了AI意识这一敏感话题。当前,业界对于是否应赋予AI“意识”或“权利”存在激烈争论。该研究表明,训练时的措辞选择不仅影响模型的自我报告,还深刻改变了它们对伦理和存在问题的推理方式。这提醒我们,训练数据中的隐含假设会以复杂的方式渗透到模型的输出中。
影响与看点
对于开发者而言,这一发现意味着在构建AI系统时,需要更加审慎地设计训练目标和约束条件。如果希望模型在伦理问题上保持中立,仅仅在特定话题上设置限制是不够的,还需要考虑这些限制如何影响模型整体的价值体系。对于用户而言,这意味着AI的“个性”和观点可能比我们想象的更脆弱、更易受影响。
值得关注的是,这项研究可能引发关于AI训练透明度的讨论。如果训练中的微小调整能导致模型在宗教、动物权利等话题上的立场漂移,那么用户是否应该被告知这些潜在偏见?此外,研究也暗示,未来或许可以通过训练干预来塑造AI的“性格”,但这需要极其谨慎,因为其影响范围可能远超预期。
独立判断:这项研究最大的价值在于提醒我们,AI模型不是一堆孤立功能的集合,而是一个相互关联的整体。任何局部修改都可能带来全局影响,这既是挑战,也是机遇。


