跳到正文
10月8日 · 周四

OpenAI · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
已经到底了