防御arXiv 2609.21996
PIR:从模型内部激活读出被隐藏的答案
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
- arXiv
- 2609.21996
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。