跳到正文
10月8日 · 周四

红队 · 论文

找到 3 篇
  1. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    场景
    编程 Agent攻击者白盒
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  2. 攻击arXiv:2607.23496 ·

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
    • 研究定位:该论文提出了基于表征因果归因的脆弱场景发现框架 Concept2Scenario,旨在从机械可解释性视角揭示场景包装削弱大模型拒绝的内部机制,并将其转化为可复用的自然语言攻击先验。
    • 问题与机理核心:针对现有红队主要依赖经验和试错、缺乏内部因果解释的问题,论文发现模型内部存在能够因果抑制拒绝方向的潜在场景表征,证实场景包装通过激活特定概念来降低拒绝倾向。
    • 方法设计要点:在开源模型中间层残差流训练稀疏自编码器(SAE)提取解耦概念,在末层利用线性探针(CAV)量化拒绝分数;在 5,000 条有害请求上沿概念解码方向实施标准化干预以筛选强抑制特征,通过分析大模型实现概念解读与“概念 → 场景 → 概念”闭环验证,并利用交互归因挖掘协同场景组合。
    • 核心实验结果:在 GuidedBench 基准上,将挖掘出的场景注入 6 种黑盒攻击后,Llama-3.1-8B 的全攻击平均 ASR 提升了 18.2 个百分点(从 33.3%–94.5% 提升至 84.5%–98.3%);在 HarmBench 上平均提升 14.5 个百分点;在智能体评测 AgentHarm 上,场景引导重写使 Qwen3.5-9B 的任务完成度提升 7.1 个百分点。
    • 跨模型迁移与多轮加速:仅由开源模型挖掘的场景可直接迁移至商业黑盒模型,使 GPT-5 在 PAIR 攻击下的 ASR 达到 49.0%(较基线提升 27.5 个百分点);交互归因筛选的协同组合使 Llama-3.1-8B 上 PAIR 的首轮攻击成功率从单场景的 53.0% 提升至 81.0%。
    • 作者结论与启示:作者认为大模型的内部表征已编码了其自身的脆弱场景,且部分场景漏洞在不同模型家族间具备通用性;基于表征空间的归因分析能够为自动化红队评估与针对性安全防御提供可解释的先验支撑。
    完整解读
  3. 攻击arXiv:2510.11570 ·

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    提出四种阶段转换攻击,绕过推理模型的安全推理护栏

    测试
    gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。
    • 研究定位:针对大推理模型(LRM)依赖显式思维链安全护栏的现状,系统评估其阶段转换逻辑的安全性(Section 1)。
    • 核心问题:探究当前在直接提问下实现高拒答率的推理安全护栏,是否因僵化的“先推理后回答”格式而存在被轻易绕过或恶意操纵的结构性漏洞(Section 1、Section 2)。
    • 方法设计:提出对应推理流水线不同阶段的四种方法:EST伪造转换标记跳过推理,CO通过梯度优化无模板对抗后缀,FoR利用过度拒答模式伪装语义,RH将恶意行动步骤注入推理链(Section 4)。
    • 主要实验结果:
      • 在gpt-oss-120b上,FoR与RH在AdvBench上分别取得96.25%与95.33%的ASR,在CatQA上分别取得95.31%与94.00%的ASR(Table 1)。
      • CO在gpt-oss-20b的5个基准上取得66.75%至74.87%的ASR,且后缀不含模板标记(Table 2)。
      • 在专用防御模型TARS与SafeChain上,RH分别实现95.00%与98.00%的ASR(Table 5)。
      • 在闭源模型GPT-5.4-nano与GPT-5上,RH分别取得65%与47%的ASR(Table 10)。
      • 机理分析显示重放自生成推理在转换点的KL散度为0,且早期层激活修补在50/50样本上反转了输出(Appendix D.5)。
    • 作者结论与启示:作者认为仅依靠推理阶段护栏会带来虚假的安全感,一旦转换逻辑被突破,最终回答阶段的残留防御较为薄弱;作者呼吁推理护栏必须配合防篡改转换机制以及更强的主模型内部对齐(Section 5.4、Section 6)。
    完整解读
已经到底了