MEEA:基于曝光效应的多轮越狱攻击框架
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
AI 导读
研究者提出 MEEA(Mere Exposure Effect Attack),一种受心理学曝光效应启发的全自动黑盒多轮越狱框架,通过重复低毒性语义暴露逐步侵蚀模型的安全对齐约束。该方法构建语义递进的提示链,并用模拟退火策略结合语义相似度、毒性和越狱效果进行优化。在 GPT-4、Claude-3.5 和 DeepSeek-R1 等闭源与开源模型上,MEEA 的攻击成功率持续高于七个代表性基线,平均提升超过 20%。消融实验验证了退火优化和上下文暴露机制的必要性。作者据此认为 LLM 安全行为是动态且依赖历史的,挑战了静态对齐边界的假设,并呼吁交互感知的安全评估与防御机制。