防御arXiv 2609.05797
论文发现安全监控器主要拦截模型本就会拒答的请求
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
- arXiv
- 2609.05797
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
评估安全监视器并提出双侧梯级微调以减少会答有害请求的漏检
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 DataShield,用共识子空间过滤会削弱安全的微调数据
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。