可解释性arXiv 2610.09000·10月7日研究定位 LLaMA-2-7B-Chat 安全敏感参数定位安全敏感参数并稀疏改动权重以削弱安全对齐arXiv2610.09000发表10月7日层模型层场景模型与 API被测模型LLaMA-2-7B-Chat攻击模型篡改风险拒答失当深度解读完整解读
防御arXiv 2609.38909·9月30日Purdue 提出 Pact:将欺骗作为行为遗忘提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解arXiv2609.38909发表9月30日层训练与数据层场景模型与 API攻击者白盒被测模型DeepSeek-R1-Distill-Qwen-32B、QwQ-32B防御模型加固攻击模型篡改风险欺骗与谋划组件微调与开源权重+1+1摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。深度解读完整解读