跳到正文
10月9日 · 周五

越狱与攻击 · 论文

论文 321 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 145 篇还没打标签,不在筛选结果里。
  1. 攻击arXiv 2609.37468

    论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

    提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门

    发表
    场景
    AI Agent
    测试
    E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct

    摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。

    深度解读完整解读
  2. arXiv 2602.10179

    研究者提出视觉中心越狱攻击 VJA

    AI 导读清华大学与鹏城实验室等机构的研究者提出 Vision-Centric Jailbreak Attack(VJA),一种把恶意编辑指令完全嵌入图像视觉提示、不依赖文本输入的视觉到视觉越狱攻击,并构建了面向图像编辑模型的安全基准 IESBench。

    发表
    深度解读 生成中论文详情