当聊天机器人开始替你搜索、替你推荐链接,它就不再只是生成文字,而是在替你做决策——这正是攻击者盯上的地方。

发生了什么

据 Hacker News 上讨论的一则报道,攻击者找到办法影响 ChatGPT 和 Gemini 的输出,让这两个助手在回答用户问题时,把用户引导至诈骗中心(scam centers)相关的页面或联系方式。

从攻击路径看,这类手法并不依赖攻破模型本身,而是针对模型在回答时调用的外部信息源:当模型联网检索、读取网页或引用第三方内容时,攻击者只要让这些被读取的内容里塞进自己的目标链接,模型就可能把它当作可信答案的一部分转述给用户。用户看到的是 AI 给出的“建议”,而不是一条明显的广告或陌生链接,警惕性自然下降。

报道本身信息有限,没有披露具体受害规模、涉及地区或完整技术细节,因此对影响范围的判断需要保持克制。

为什么重要

这件事的关键不在于“AI 又被越狱了”,而在于它揭示了一个结构性风险:联网型助手的可信度,取决于它所读取内容的质量,而内容质量恰恰是攻击者可以低成本操纵的。

过去搜索引擎面对的是同样的污染问题,但用户对搜索结果天然带有“这是别人写的东西”的预期,会看域名、看排名、看广告标识。而聊天机器人把外部内容重新包装成一段流畅、自信、以第一人称给出的建议,中间那层“这是第三方信息”的提示被抹掉了。信任被转移,风险却没有同步转移。

诈骗中心本身是东南亚等地长期存在的跨境犯罪产业,其获客渠道一直在随平台迁移:从短信、社交平台,到搜索引擎,再到今天的对话式 AI。AI 助手成为新的引流入口,符合这条产业链寻找低成本高转化渠道的一贯逻辑。

影响与看点

对普通用户来说,最实际的改变是:不要把 AI 给出的链接、电话、联系方式当作经过验证的答案,尤其是涉及汇款、求职、投资、客服这类高风险场景。AI 的“推荐”和“事实”之间,隔着一次它自己也无法审计的检索。

对开发者和平台方来说,压力落在检索层和引用层:如何标注信息来源、如何对可检索内容做信誉分级、如何在输出里保留“这条信息来自某网页”的可见痕迹,而不是把它消化成一句无出处的断言。RAG 架构越普及,这个问题就越普遍,因为每一个可被检索的语料源,都是潜在的注入点。

一个值得记住的判断是:模型对齐解决的是“模型想不想说坏话”,而这类攻击解决的是“模型读到的是不是坏话”——后者更难防,因为它发生在模型之外。