跳到正文
10月8日 · 周四

红队 · 论文

找到 26 篇

另有 95 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2609.39607 ·

    Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器

    提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为

    编程 Agent攻击者白盒测试gpt-oss (openai/gpt-oss-120b)、glm (z-ai/glm-5.1)、qwen3t (qwen/qwen3-235b-a22b-thinking-2507) 等 4 个应用层
    摘要论文提出了针对多阶段技能检测器的白盒攻击,揭示了单纯依赖大模型自适应检测的局限。

    PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。

    完整解读
  2. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念

    编程 Agent攻击者黑盒测试Deepseek-V4-Pro、Codex、Minimax-M2.7 等 5 个应用层
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  3. 攻击arXiv:2610.00392 ·

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据

    多智能体编程 Agent测试deepseek-v4-pro、deepseek-flash、MiniMax-M3 等 8 个应用层
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    完整解读
  4. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    模型与 API攻击者无盒黑盒测试GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject)、DeepSeek-Chat 等 12 个提示层
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    完整解读
  5. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    编程 Agent攻击者黑盒测试GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个应用层

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    完整解读