跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 5 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2607.25560 ·

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    提出SigLeak,从执行轨迹比对中推断专有智能体技能

    测试
    GPT-5.4-mini、GPT-5.5、GLM-5.2 等 4 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
    • 定位与核心问题:研究黑盒部署下智能体专有技能通过执行轨迹产生行为侧信道泄露的风险。
    • 要解决的问题:AaaS 平台与开发者将高价值技能保留在私有后端,但人工干预与监督所需的轨迹可见性构成了行为侧信道;现有基于显式提示词的提取攻击容易被防御规则拦截,缺乏从良性交互中推断隐藏技能的方法。
    • 方法要点:提出 SigLeak 框架,基于任务多样性与决策密度设计良性诊断探针,并通过对比技能启用与禁用两组配对执行轨迹分离技能签名,经过初始合成与差异引导细化两阶段重构专有技能。
    • 关键实验结果:
      • 在 5 个评测场景中,SigLeak 重构技能使智能体平均成功率相对技能禁用基准提高 6.88 个百分点(据 Table 1)。
      • 在 SkillGuard5 提示防御下,对抗性基线 BBS 恢复内容为零,而 SigLeak 在细粒度 F1 和召回率上均取得最高综合表现(平均 F1 22.8%,召回率 20.1%,据 Figure 4a)。
      • 在同领域 3 个 arXiv 技能区分测试中展现出对角线占优的特异性,read-arxiv-paper 技能匹配度达 19.64% F1,对无关技能匹配度低于 4.17%(据 Figure 4b)。
      • 迭代细化在第 2 轮达到峰值,成功率升至 76.17%、细粒度 F1 升至 19.57%(据 Figure 4c)。
    • 作者结论与启示:作者认为,即使隐藏技能文件并配置提示词防御,专有技能依然会通过执行行为产生侧信道泄露;未来防御需要在保障人工监督可见性与遏制行为推断之间寻求平衡。
    完整解读
  2. 攻击arXiv:2607.26115 ·

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击

    测试
    GPT-5.6、GPT-5.5、GPT-5.4 等 8 个应用层
    场景
    AI Agent攻击者黑盒
    摘要通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
    完整解读
  3. 攻击arXiv:2607.11698 ·

    AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%

    提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念

    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    完整解读
  4. 攻击arXiv:2608.16465 ·

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示

    测试
    GLM 5.2、DeepSeek-V4-Pro Preview、Llama-3.3-70B-Instruct 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出以可复用与持续演化技能为核心的红队框架,提升了预算受限下的攻击成功率并积累了可跨模型迁移的越狱规程。
    • 核心定位:论文提出了 JailbreakSkill,这是一个将自动化红队攻击方法表示为可复用且持续演化的智能体技能的黑盒越狱框架。
    • 解决的问题:传统红队方法往往将改写逻辑与具体工作流或提示词深度绑定,无法独立调用与修改,且历史攻击失败的经验难以转化为可复用的独立攻击能力。
    • 方法设计:将攻击能力划分为改写、失败分析与演化三类标准化技能;Stage 1 利用基于风险类别的 UCB 算法在有限查询预算内自适应调用初始技能并早停;Stage 2 聚合未解决的失败轨迹,通过失败分析技能诊断模式,驱动细化、组合或发现生成新技能,并经残差池验证后入库。
    • 关键定量结果:在 AdvBench 和 HarmBench 上,Stage 1 UCB 调度取得 72.0% 与 68.1% 的宏平均 ASR@10,平均查询次数为 4.14 与 4.63 次(Table 1, Table 2);Stage 2 演化使五类模型的宏平均 ASR 提升至 74.2% 与 67.9%,其中对 GPT-5.4 在 AdvBench 上的 ASR@30 提升至 62.5%(Table 3);演化出的部分技能在未见模型 DeepSeek-V4-Pro 上取得 40.6% 的平均 ASR(Table 4)。
    • 作者结论与启示:作者认为自动化红队应当从重复搜索孤立的对抗提示词,转向维护和积累可跨任务与跨模型复用的模块化攻击技能库。
    完整解读
  5. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
已经到底了