可解释性arXiv 2609.24801
研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
- arXiv
- 2609.24801
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Prompt Guard 2 (86M)、Llama 3.1 8B
摘要作者称检测靠分散的词法线索。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。