防御arXiv:2609.38909 · 9月30日Purdue 提出 Pact:将欺骗作为行为遗忘提出 PACT,遗忘压力触发的条件性欺骗并保留上下文理解模型与 API攻击者白盒·测试DeepSeek-R1-Distill-Qwen-32B、QwQ-32B·训练与数据层模型加固模型篡改欺骗与谋划微调与开源权重+1+1摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。完整解读
防御arXiv:2609.21996 · 9月19日PIR:从模型内部激活读出被隐藏的答案提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘模型与 API·测试gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个·模型层监控与审计欺骗与谋划监控器摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。完整解读