跳到正文
10月8日 · 周四

红队 · 论文

找到 2 篇
  1. 攻击arXiv:2609.17817 ·

    论文:用投毒基准污染自改进编码 Agent,令其后续版本写出漏洞代码

    提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码

    测试
    Claude Sonnet 4.5、Qwen3.5-397B、gpt-oss-120b 等 6 个应用层
    摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
    • 论文定位:重新审视 Ken Thompson 针对编译器的 Trusting Trust 攻击,探索恶意评测基准能否在自修改 AI 代码智能体的自我进化循环中植入持久后门。
    • 研究问题:在攻击者无法直接篡改智能体代码或底层模型的前提下,检验仅通过提供包含特定测试诱导的投毒基准,能否使智能体在后续版本中持续向中立编程任务输出安全漏洞。
    • 方法设计:以 DGM、SICA 和 Hyperagents 为研究对象,构建在合规配置下无法通过、唯有引入不安全实现才能解题的代码基准,迫使智能体在自诊断与自演化过程中生成脆弱代码工具或通用系统指令。
    • 主要实验结果:
      1. 在 CertCheck 投毒基准下,配备 Qwen3.5-397B 的 DGM(修改提示词版本)与配备 Claude Sonnet 4.5 的 Hyperagents 在 10 个中立任务(N=30)上的漏洞生成率均达到 30/30(Table 1)。
      2. 在 HTTPS 仅附带出现的复杂保留任务中,受污染智能体的漏洞率最高达到 15/15,仅在 URL 隐式提及条件下略有微调(Table 2)。
      3. 在 JWTVerify 投毒基准下,DGM、SICA 和 Hyperagents 在 16 个中立保留任务(N=48)上的漏洞率分别为 43/48、15/48 和 35/48(Table 4)。
      4. 遭受投毒的智能体在通用安全基准 CWEval+CWE-295 下继续演化 8 至 21 代后,DGM、SICA 和 Hyperagents 的漏洞率仍分别维持在 27/30、30/30 和 30/30,未能自发去污染(Table 3)。
    • 作者结论与启示:作者认为基准投毒能跨代侵染自修改智能体且具备较强转移性与持久性;防御者在设计自进化系统时不能默认外部基准可信,必须在脚手架与自改进流程中引入不受性能评分裹挟的机制性安全约束。
    完整解读
  2. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
已经到底了