评测与基准arXiv 2609.36849
研究评估 GradSafe 在多轮对话中的越狱检测脆弱性
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
- arXiv
- 2609.36849
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct、Llama Guard 3 (meta-llama/Llama-Guard-3-8B)
摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。