分析与理论arXiv 2608.17445
论文:分解攻击可跨不可关联身份绕过 LLM 有状态防御
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
- arXiv
- 2608.17445
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- huihui-ai/Huihui-Qwen3.5-35B-A3B-abliterated、huihui-ai/Huihui-Qwen3.5-2B-abliterated、Granite Guardian 3.1 2B 等 5 个
形式化跨不可关联身份的分解攻击,并证明状态化防御的效用边界
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。