可解释性arXiv 2609.38389
研究揭示多轮攻击中危害性表征的几何演化
分析多轮攻击中有害性与拒答表征的几何演化
- arXiv
- 2609.38389
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-2-9B-it
- 风险拒答失当
摘要多轮中 harmfulness 渐可分且与 refusal 弱对齐,单轮静态探针可能因此变差。
作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。