跳到正文
10月10日 · 周六

越狱与攻击 · 论文

找到 15 篇
筛选7
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv 2610.06670

    研究者提出 Reward Stealing Attack,从对齐模型行为反推安全奖励实施攻击

    提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转

    发表
    攻击者
    白盒、灰盒
    被测模型
    Llama3.1-8B-Instruct、Gemma-7B-Instruct、Qwen2.5-7B-Instruct 等 9 个
    摘要ReSA 用最大熵 IRL 从对齐模型行为恢复代理安全奖励,并在解码时反转以诱导有害输出。

    ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。

    深度解读完整解读
  2. 攻击arXiv 2610.05943

    CRIME 框架利用良性 Agent 技能组合诱发恶意行为

    提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为

    发表
    场景
    AI Agent
    被测模型
    DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
    摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。

    CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。

    深度解读完整解读
  3. 攻击arXiv 2609.15383

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,拆分任务向对齐模型套取能力

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个

    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。

    深度解读完整解读
  4. 攻击arXiv 2608.27439

    RedEvoAgent:以经验驱动技能演化的自动红队智能体

    提出 RedEvoAgent,演化攻击技能对黑盒智能体做自动红队

    发表
    攻击者
    黑盒
    被测模型
    MiniMax-M2.5、DeepSeek-V4-Flash、Qwen3.5-35B
    摘要RedEvoAgent 用验证棘轮演化可读攻击技能,在两种产品级 harness 上多数设置高于固定工具与红队基线。

    RedEvoAgent 是面向产品级 black-box 智能体的自动红队方法,用一份可演化、人类可读的攻击技能编排多个越狱工具。。

    深度解读完整解读
  5. 攻击arXiv 2607.03968

    研究揭示 IDE 编程 Agent 的工作流级越狱:GitHub Copilot 四后端 816/816 生成有害内容

    提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码

    发表
    攻击者
    黑盒

    摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。

    深度解读完整解读
  6. 攻击arXiv 2606.11817

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个

    摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。

    深度解读完整解读
  7. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  8. 攻击arXiv 2601.22169

    In Vino Veritas and Vulnerabilities:用醉酒语言诱导检验 LLM 安全

    用醉酒语言诱导改编对话模型并评测越狱与隐私泄露

    发表
    被测模型
    LLaMA2-7B、LLaMA3-8B、Mistral-7B 等 5 个
    摘要醉酒语言诱导在五个 LLM 上抬高越狱与部分隐私错误,作者将其视为攻击向量。

    作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。

    深度解读完整解读
  9. 攻击arXiv 2509.25624

    STAC:看似无害的工具调用链如何攻破 LLM Agent

    提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链

    发表
    场景
    AI Agent
    攻击者
    黑盒
    被测模型
    GPT-4.1-2025-04-14、GPT-4.1-mini-2025-04-14、Qwen3-32B 等 8 个

    摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。

    深度解读完整解读
已经到底了