分析与理论arXiv 2610.07009
研究受控拆解图像到文本越狱中图像属性的作用
固定有害指令,单轴归因图像到文本越狱的图像属性
- arXiv
- 2610.07009
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Qwen3-VL-8B-Instruct 等 6 个
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。
检验混合合规演示教模型的是通用服从还是有害性
这项工作问的是:安全对齐模型从混合的良性与有害合规演示中提取的,是通用服从规则,还是请求是否有害。作者控制 Nb、Nh、ϕ 和顺序,检验总量、有害计数与联合计数三个假设,而不是提出新的攻击算法。
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。