防御arXiv 2609.34519
EOPSA:高效在策略自蒸馏安全对齐方法
提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐
- arXiv
- 2609.34519
- 发表
- 场景
- 模型与 API
- 测试
- Qwen3-1.7B、Qwen3-4B、Qwen3-14B 等 5 个
另有 532 篇论文还没打上分类标签,暂不在筛选结果里。
提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别