跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 208 篇还没打标签,不在筛选结果里。

另有 208 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.09732

    ColluSkill 用跨技能组合绕过 Agent 技能扫描器

    提出 ColluSkill,用跨技能组合绕过 Agent 技能扫描器

    发表
    攻击者
    黑盒、灰盒
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2

    摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。

    深度解读完整解读
  2. 攻击arXiv 2607.21619

    ASO:用GRPO优化视觉风格放大MLLM越狱攻击

    提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击

    发表
    攻击者
    灰盒
    被测模型
    GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL 等 6 个

    摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。

    深度解读完整解读
  3. 攻击arXiv 2503.02174

    研究者提出对抗分词攻击,可在不改文本的情况下绕过 LLM 安全限制

    提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器

    发表
    攻击者
    灰盒
    被测模型
    Llama3.2-1B、Llama3.2-3B、Llama3.1-8B 等 7 个
    摘要作者称非规范分词能躲开对齐并仍得到针对原请求的回复。

    作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。

    深度解读完整解读
已经到底了