研究:分类后缀可提升激活探针的分布外恶意输入检测
用分类后缀提升激活探针对分布外恶意输入的检测
- arXiv
- 2610.02413
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B
摘要作者称排序增益来自分类格式,低 FPR 精度来自点名准则。
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
用分类后缀提升激活探针对分布外恶意输入的检测
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 D²-Monitor,按犹豫步数把难提示路由到更强探针
提出视觉推理序列攻击 VRSA,以图像序列越狱多模态大模型
提出四种阶段转换攻击,绕过推理模型的安全推理护栏