防御arXiv 2609.38909
Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- DeepSeek-R1-Distill-Qwen-32B、QwQ-32B
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 PALS,用潜空间平滑防御全双工语音对话的对抗扰动
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SPARED,用对抗编辑数据训练基于推理的 AI 生成图像检测器
SPARED 是一套用于可解释 AI 生成图像检测的攻防强化学习流程,报告模型是 Qwen3.5-9B 上的第三轮防御器。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏