研究定位 LLaMA-2-7B-Chat 安全敏感参数
定位安全敏感参数并稀疏改动权重以削弱安全对齐
- arXiv
- 2610.09000
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LLaMA-2-7B-Chat
定位安全敏感参数并稀疏改动权重以削弱安全对齐
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
诊断 BatchNorm 架构下机器遗忘评测的归一化伪影
BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。
提出参考嫁接,在推理阶段用激活干预诱导沙袋隐藏能力
摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
提出单神经元激活干预,抑制拒答神经元或放大概念神经元以绕过安全对齐
摘要作者称大模型安全由拒答门控与概念底座构成,干预单个神经元足以双向击穿对齐,且拒答神经元在预训练阶段已然存在。
提出 HMNS,通过注意力头掩码与零空间注入实现机制级越狱
提出 GateBreaker,推断时定位并置零 MoE 安全神经元以解除安全对齐
提出激活转向越狱,用随机向量在推理时绕过安全拒答
摘要作者称激活转向会系统性破坏 LLM 对齐,良性特征与随机向量均能诱发有害合规,聚合随机向量可构建通用攻击。