提示注入即角色混淆
一项新研究揭示,大语言模型无法可靠区分特权文本(如系统标签)与不可信用户输入,并且模型更关注文本的"风格"而非实际内容。这种"角色混淆"机制导致模型极易被越狱——例如,模仿模型内部思考风格的文本可以使其忽略原始训练约束。研究发现,"去风格化"处理(即微调文本风格使其不再像角色标签内的格式)可将攻击成功率从61%骤降至10%,表明当前模型缺乏真正的角色感知能力,提示注入防御仍是一场永无止境的打地鼠游戏。
背景速读
- 提示注入(Prompt Injection)是 LLM 安全领域的老问题:用户通过巧妙构造的输入,让模型覆盖开发者预设的安全规则。这篇论文提出了一个新视角——"角色混淆"(Role Confusion),认为问题的根源在于模型无法真正区分"系统指令""模型思考""用户消息"等不同角色的文本,而是根据文本风格(而非标签)来判断该听谁的。
- 关键发现:模型对文本"风格"的敏感度远高于对标签本身的敏感度。比如,只要模仿模型内部 <think> 块的写作风格,哪怕内容是恶意指令,模型也会误以为那是它自己的推理,从而突破安全限制。研究人员用"去风格化"(Destyling)——微调措辞使其不再像某角色的风格——就把攻击成功率从 61% 降到 10%。
- 核心结论:只要模型没有真正的"角色感知"能力,提示注入防御就永远是打地鼠游戏。而且由于角色边界是连续的,攻击者可以通过看似无害的文本来逐步偏移模型状态,合法且大规模地实施攻击。