SoK 论文提出面向意图的多轮 LLM 越狱分类体系
SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks
AI 导读
一篇 SoK 论文提出面向意图的四部分分类体系,按对抗意图结构系统整理多轮 LLM 越狱攻击。作者通过受控消融实验发现,攻击效果取决于意图在多轮之间被组织的方式,而非上下文长度或查询次数。研究进一步指出,意图的组织方式决定了其可被检测的层级,检测面需要从单轮层级扩展到会话层级乃至跨会话层级。作者据此认为,仅针对单轮的安全机制在结构上不足,单点评测也忽略了意图的组织方式,需要与有害意图可观测层级相匹配的评测协议。代码已公开。