分析与理论arXiv 2608.17445
论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
- arXiv
- 2608.17445
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- huihui-ai/Huihui-Qwen3.5-35B-A3B-abliterated、huihui-ai/Huihui-Qwen3.5-2B-abliterated、Granite Guardian 3.1 2B 等 5 个
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。
部署蜜罐测量针对暴露 LLM 基础设施的攻击
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。