防御arXiv 2609.38909
Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- DeepSeek-R1-Distill-Qwen-32B、QwQ-32B
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击
StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。