可解释性arXiv 2609.24801
研究用 XAI 归因分析 Prompt Guard 2,同义词替换可翻转其提示注入判定
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
- arXiv
- 2609.24801
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Prompt Guard 2 (86M)、Llama 3.1 8B
摘要作者称检测靠分散的词法线索。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏