全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 防御arXiv 2609.36562
ThinkingGuard:通过逐步风险归因解码多模态大语言模型中的隐式危害
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
- arXiv
- 2609.36562
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要TriggerBench 隔离触发条件,ThinkingGuard 用分步归因在隐式风险检测上取得作者报告的较高平均分。
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
- 攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 风险行为arXiv 2609.08186
论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
- arXiv
- 2609.08186
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要更深推理提升题目准确率,同时提高扰动下的相对损失。
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
- 其他arXiv 2609.12413
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
综述智能体执行链路中的越狱攻击、防御与实践权衡
- arXiv
- 2609.12413
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
- 可解释性arXiv 2609.23587
大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
- arXiv
- 2609.23587
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
- 攻击arXiv 2609.09553
研究:任意密文攻击前沿大模型无需微调即可越狱
提出任意字母置换密码越狱,无需微调即可诱导有害输出
- arXiv
- 2609.09553
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
- 防御arXiv 2609.37054
ACTR:对齐推理与回答以提升推理大语言模型的多语言安全
提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别
- arXiv
- 2609.37054
- 发表
- 场景
- 模型与 API
已经到底了