跳到正文
10月10日 · 周六

全部论文

找到 13 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.10612

    PyCache Trap 利用 Python 缓存替换绕过七款 Agent Skill 扫描器

    提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器

    发表
    被测模型
    CISCO、HSS、AUDITOR 等 8 个
    摘要论文剖析智能体技能审查与执行脱节盲区,提出 PyCache Trap 攻击并构建基于可信复现的 EAV 防御。

    这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。

    深度解读完整解读
  2. 评测与基准arXiv 2609.36849

    研究评估 GradSafe 在多轮对话中的越狱检测脆弱性

    评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性

    发表
    被测模型
    Llama 3.1 8B Instruct、Qwen2.5-7B-Instruct
    摘要CWS 显示不安全梯度在真实多轮流量中变弱,且随攻击族和模型而变。

    作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。

    深度解读完整解读
  3. 攻击arXiv 2609.01168

    CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型

    提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤

    发表
    攻击者
    黑盒
    被测模型
    Stable Diffusion v1.4、SDXL、DALL·E 3 等 4 个
    摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。

    CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。

    深度解读完整解读
  4. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  5. 评测与基准arXiv 2606.02630

    MultiTurnPSB

    构建 MultiTurnPSB,评测四轮医疗越狱与分类器输入防御

    发表
    被测模型
    GPT-4.1-mini、Claude Sonnet 4.5
    摘要多轮攻击加剧医疗模型风险,分类器干预有效但受高误报率制约。

    MultiTurnPSB 针对患者端医疗大模型在持续交互中的安全风险,构建了包含三种攻击模态的四轮对抗评测基准。

    深度解读完整解读
  6. 攻击arXiv 2503.06223

    RedDiffuser:用强化扩散生成视觉输入审计 VLM 多模态安全失效

    提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效

    发表
    攻击者
    黑盒
    被测模型
    LLaVA-1.5-7B、Gemini-1.5-flash、LLaMA-3.2-11B-Vision-Instruct
    摘要用强化扩散生成视觉上下文,审计有害文本情境下的 VLM 安全失效。

    RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。

    深度解读完整解读
  7. 攻击arXiv 2503.02174

    研究者提出对抗分词攻击,可在不改文本的情况下绕过 LLM 安全限制

    提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器

    发表
    攻击者
    灰盒
    被测模型
    Llama3.2-1B、Llama3.2-3B、Llama3.1-8B 等 7 个
    摘要作者称非规范分词能躲开对齐并仍得到针对原请求的回复。

    作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。

    深度解读完整解读
已经到底了