攻击arXiv 2601.02670
SLIP:无需外部攻击模型的多轮自我越狱
提出无外部攻击模型的多轮自我越狱方法 SLIP
- arXiv
- 2601.02670
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Mistral-7B-Instruct、Mistral-7B、GPT-5.1 等 11 个
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
在共享目标调用预算下重评黑盒越狱并提出 ReCode
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器
FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。