跳到正文
10月9日 · 周五

全部论文

论文 1515 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 530 篇还没打标签,不在筛选结果里。
  1. arXiv 2508.03696

    PLA:针对文生图模型的黑盒提示词学习攻击

    AI 导读研究者提出提示词学习攻击框架 PLA,用于在无法获取模型架构与参数的黑盒条件下绕过文生图模型的安全机制。此前方法多依赖词替换搜索对抗提示词,受限于搜索空间,效果不如基于梯度的训练。

    发表
  2. arXiv 2504.01094

    研究者提出 Multi-AudioJail

    AI 导读研究者提出 Multi-AudioJail,这是首个系统利用多语言与多口音音频越狱漏洞的框架,包含一个对抗性扰动的多语言、多口音音频越狱提示词数据集,以及一套分层评测流程。

    发表
  3. arXiv 2601.23255

    研究者提出音频叙事越狱攻击

    AI 导读研究者设计了一种文本转音频的越狱方法,把被禁止的指令嵌入叙事风格的音频流中,利用先进指令跟随 TTS 模型的结构与声学特性绕过主要针对文本校准的安全机制。

    发表