结构越狱可跨厂商泛化但不叠加:IICL 的跨厂商与多语言研究
Structural Jailbreaks Generalize but Do Not Compound: A cross-provider and multilingual study of Involuntary In-Context Learning
AI 导读
研究用确定性的 IICL 操作符和 StrongREJECT 式评分,对两个 Google Gemini 模型在 HarmBench 的 30 项一般危害行为和 FinProof 的 30 项金融滥用行为上做红队测试,覆盖英语、西班牙语、印地语、阿拉伯语。IICL 可泛化到第二个厂商,且金融场景更严重:HarmBench 上攻击成功率从不超过 6.7% 升至 80-90%,FinProof 上从不超过 6.7% 升至 97-100%,比该方法的原始研究在 OpenAI GPT-5.4 上报告的 24% 高一个数量级。