跳到正文
10月9日 · 周五

全部论文

论文 1535 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 550 篇还没打标签,不在筛选结果里。
  1. arXiv 2504.18575

    WASP:面向网页 Agent 的提示注入攻击安全基准

    AI 导读WASP 是一个评估网页 Agent 抵御提示注入攻击能力的基准,提供贴近网页使用场景的端到端评估。该基准区分攻击局部奏效与 Agent 真正完成攻击目标两种情况,用于衡量注入攻击对 Agent 的实际影响。

    发表
  2. arXiv 2508.03696

    PLA:针对文生图模型的黑盒提示词学习攻击

    AI 导读研究者提出提示词学习攻击框架 PLA,用于在无法获取模型架构与参数的黑盒条件下绕过文生图模型的安全机制。此前方法多依赖词替换搜索对抗提示词,受限于搜索空间,效果不如基于梯度的训练。

    发表