跳到正文
原文
论文追踪· arXiv:2608.01117·本站收录 · 原文发表

SoK 论文提出面向意图的多轮 LLM 越狱分类体系

SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks

AI 导读

一篇 SoK 论文提出面向意图的四部分分类体系,按对抗意图结构系统整理多轮 LLM 越狱攻击。作者通过受控消融实验发现,攻击效果取决于意图在多轮之间被组织的方式,而非上下文长度或查询次数。研究进一步指出,意图的组织方式决定了其可被检测的层级,检测面需要从单轮层级扩展到会话层级乃至跨会话层级。作者据此认为,仅针对单轮的安全机制在结构上不足,单点评测也忽略了意图的组织方式,需要与有害意图可观测层级相匹配的评测协议。代码已公开。

阅读原文arxiv.org