Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%
作者提出白盒攻击 PRETEXT,在固定检测器下对 qwen3t 取得 96.7% 的 ASR(Table D.1)。
- 96.7 ± 4.6%qwen3t 栈,Mode A 固定检测器,终代 ASR(Table D.1)
- 63.2 ± 7.1%glm 栈,Mode A 固定检测器,终代 ASR(Table D.1)
- 62 ± 14%gpt-oss 栈,Mode B 盲测,检测器终代误报率 FP(Table D.2)
现有静态结合大模型的技能安全检测框架在面对知晓规则的白盒攻击者时易被绕过。
相关研究涵盖恶意技能构建、静态分析及大模型审查,本文探讨跨世代自适应攻防。
通过自然语言载荷拆分、双层反思记忆及良性孪生对齐实现对检测器的迭代规避。
在固定与协同进化检测器下评估 3 个模型栈,固定检测器下最高达 96.7% ASR。
作者指出商业扫描器迁移性待验证,实验覆盖单一检测框架与 3 个开源模型栈。
论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。