防御arXiv 2609.05797
论文发现安全监控器主要拦截模型本就会拒答的请求
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
- arXiv
- 2609.05797
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求
摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
提出 DoM 激活探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。