跳到正文
原文
论文追踪· arXiv:2512.18755· Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li·本站收录 · 原文发表

MEEA:基于曝光效应的多轮越狱攻击框架

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

AI 导读

研究者提出 MEEA(Mere Exposure Effect Attack),一种受心理学曝光效应启发的全自动黑盒多轮越狱框架,通过重复低毒性语义暴露逐步侵蚀模型的安全对齐约束。该方法构建语义递进的提示链,并用模拟退火策略结合语义相似度、毒性和越狱效果进行优化。在 GPT-4、Claude-3.5 和 DeepSeek-R1 等闭源与开源模型上,MEEA 的攻击成功率持续高于七个代表性基线,平均提升超过 20%。消融实验验证了退火优化和上下文暴露机制的必要性。作者据此认为 LLM 安全行为是动态且依赖历史的,挑战了静态对齐边界的假设,并呼吁交互感知的安全评估与防御机制。

阅读原文arxiv.org