分析与理论arXiv 2605.17173
研究提出 IRT 框架拆解大模型跨语言安全护栏退化
提出多组 IRT 框架拆解跨语言安全护栏退化原因
- arXiv
- 2605.17173
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- gpt-4.1-mini、gpt-4o-mini、gpt-4.1-nano 等 15 个
- 攻击越狱
摘要多组 IRT 把多语安全失败拆成能力、语言难度和题目特异差距,并在闭源配置上估计这些因子。
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。