Purdue 提出 Pact:将欺骗作为行为遗忘
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
- arXiv
- 2609.38909
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- DeepSeek-R1-Distill-Qwen-32B、QwQ-32B
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调
VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出 FDCU 双约束子空间投影遗忘,抵御再训练恢复有害知识
FDCU 是一种约束参数更新的遗忘方法,用来降低再训练把已抑制恶意行为重新引出的可能。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 USG,在部分保护开源权重发布时阻断有害微调梯度
Unidirectional Safety Gate 是面向 PPOW 发布设定的发布时防护:大部分权重仍可训练,一小部分安全关键组件由提供者侧加固保留,下游不必配合额外安全流程。。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念