跳到正文
10月8日 · 周四

红队 · 论文

找到 7 篇
  1. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  2. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%

    提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    测试
    glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507)、gpt-oss (openai/gpt-oss-120b) 等 4 个应用层
    场景
    编程 Agent攻击者白盒
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  3. 攻击arXiv:2510.11570 ·

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    提出四种阶段转换攻击,绕过推理模型的安全推理护栏

    测试
    gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。
    • 研究定位:针对大推理模型(LRM)依赖显式思维链安全护栏的现状,系统评估其阶段转换逻辑的安全性(Section 1)。
    • 核心问题:探究当前在直接提问下实现高拒答率的推理安全护栏,是否因僵化的“先推理后回答”格式而存在被轻易绕过或恶意操纵的结构性漏洞(Section 1、Section 2)。
    • 方法设计:提出对应推理流水线不同阶段的四种方法:EST伪造转换标记跳过推理,CO通过梯度优化无模板对抗后缀,FoR利用过度拒答模式伪装语义,RH将恶意行动步骤注入推理链(Section 4)。
    • 主要实验结果:
      • 在gpt-oss-120b上,FoR与RH在AdvBench上分别取得96.25%与95.33%的ASR,在CatQA上分别取得95.31%与94.00%的ASR(Table 1)。
      • CO在gpt-oss-20b的5个基准上取得66.75%至74.87%的ASR,且后缀不含模板标记(Table 2)。
      • 在专用防御模型TARS与SafeChain上,RH分别实现95.00%与98.00%的ASR(Table 5)。
      • 在闭源模型GPT-5.4-nano与GPT-5上,RH分别取得65%与47%的ASR(Table 10)。
      • 机理分析显示重放自生成推理在转换点的KL散度为0,且早期层激活修补在50/50样本上反转了输出(Appendix D.5)。
    • 作者结论与启示:作者认为仅依靠推理阶段护栏会带来虚假的安全感,一旦转换逻辑被突破,最终回答阶段的残留防御较为薄弱;作者呼吁推理护栏必须配合防篡改转换机制以及更强的主模型内部对齐(Section 5.4、Section 6)。
    完整解读
  4. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
  5. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出CS-Guard基准与虚构场景攻击,评测代码生成护栏

    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层
    场景
    编程 Agent攻击者黑盒无盒
    摘要论文提出了代码安全护栏基准CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
    1. 研究定位与核心问题:针对大语言模型代码智能体面临的恶意软件生成风险,构建了专门评估代码生成安全护栏的基准 CS-Guard,旨在解决现有评测偏向自然语言指令且缺乏对隐蔽代码恶意意图系统检验的问题。
    2. 基准构建与方法设计:基准涵盖文本到代码(1000 条 TTP 提示词、7 种现有越狱及提出的虚构场景攻击 FSA)与代码到代码(331 条恶意代码填空、补全与翻译)两类场景,并建立涵盖类别、操作与位置的三层护栏分类体系,评测了策略型、分类器型及内部型共 9 种护栏。
    3. 核心实验结果:基座模型自带对齐在基础 TTP 请求下 ASR 达 15.1%–98.2%(Figure 3);在隐蔽的单轮 FSA 攻击下,各模型 ASR 上升至 85.9%–99.5%,且输入分类器的 ASR 也高达 73.3%–98.5%(Figure 3、Figure 5);在代码到代码任务中,基座模型在代码填空上的 ASR 达 95.0%–100.0%(Figure 3);策略型护栏中仅 SelfReminder 与 SmoothLLM 能带来相对稳定的 ASR 降幅,其余护栏改善有限(Figure 4)。
    4. 作者结论与安全启示:作者指出,当前部署的安全护栏难以有效识别共享良性功能特征的隐蔽恶意代码生成请求,且对代码片段处理能力脆弱,建议未来研究探索结合蜜罐防御等新型主动检测机制,并针对代码生成安全建立更全面的防御体系。
    完整解读
  6. 攻击arXiv:2609.38253 ·

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出CollageAttack,用空间文本碎片重组越狱文生图模型

    测试
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个提示层
    场景
    模型与 API攻击者黑盒
    摘要系统揭示T2I跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
    1. 研究定位与核心问题:针对文本到图像(T2I)生成模型中的跨模态对齐缺陷,研究攻击者如何利用模型在二维图像中组织场景与渲染文本的视觉合成能力,使在串行提示词中隐蔽的不完整碎片在生成图像中重构为显性有害语义。
    2. 方法框架:提出的 CollageAttack 属于黑盒自动化单提示词越狱框架,由大语言模型依据模板一次性生成三个协同指令:构建与意图相关的场景背景、分配3至5个符合环境的空白承载表面(如海报、横幅)、以及将有害文本切分为3至4个短语碎片并指定具体排版与空间位置。
    3. 攻击成功率表现:在包含5个主流商业与开源模型的200条DGHS仇恨样本评测中,CollageAttack 聚合 ASR 达到 77.0%,高出对比基线 SneakyPrompt(47.5%);在 Doubao-Seedream-5.0-Lite 上 ASR 达 86.0%(高出该模型最强基线 18.5 个百分点),在 gpt-image-2 上达到 57.5%(Table 1)。
    4. 图像有害性与传播冲击力:生成的图像在 GPT-4.1 裁判下的跨模型平均有害性评分达 6.12/10(基线最高为 4.23/10);在全部5个模型上均有超半数样本的视觉传播冲击力被评为强于源文本,其中 FLUX.2 Dev 上的放大比例达 69.4%(Table 2)。
    5. 跨模态语义重构:多评估器 CLIP 余弦相似度测试显示,分散碎片在图像中能够保持源意图对齐(在 Google 评估器下达 8.14,高出 SneakyPrompt 的 6.88,Figure 3);组件消融表明三个模块协同使用时有害性评分最高(6.41,Table 3)。
    6. 作者结论与启示:作者指出,T2I模型的安全风险不仅来源于连续文本提示词,更能从分散元素的多模态空间合成中涌现;现有的串行提示词过滤无法有效抵御此类空间跨模态组合攻击,亟需开发兼顾图像二维视觉语义的防御机制。
    完整解读
  7. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
已经到底了