Nullify:面向 LLM 遗忘的零空间激活引导免训练方法
提出零空间激活引导 Nullify,免训练擦除指定记忆并保持效用
- arXiv
- 2610.10655
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-2-7B-chat-hf、Qwen3-8B
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出零空间激活引导 Nullify,免训练擦除指定记忆并保持效用
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
测量有损投机解码的安全代价,并提出 SecureSD 收紧早期验证
作者研究有损推测解码在换取速度时,是否会比效用更快地损害越狱与提示注入防护,并给出按位置校正的 SecureSD。
提出 MARCO 放射性水印,冻结蛋白质生成模型并在去噪时嵌入签名
MARCO 是加在蛋白质生成模型推理过程上的构象水印,用来标记知识产权,并为可能的生物安全滥用保留可追溯信号。作者还把它说成数字权利管理工具,以及符合生物武器公约的数字监管链。问题在于:专有 PGM 的三维输出可能被拿去训练盗版模型,也可能在来源被抹掉后绕过筛查。
提出 PEV 攻击,在输入嵌入上加高斯噪声越狱开源模型
PEV 是对 open-weight LLM 的 embedding 噪声越狱。
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出 TRACER,从权重差识别扩散模型被擦除概念
TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。
提出生成时防御 SENTINEL,匹配输入输出以抽出越狱意图并停写
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出基准 OLMo-Detect 评测 LLM 成员推断
用分类后缀提升激活探针对分布外恶意输入的检测
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略