跳到正文
10月9日 · 周五

全部论文

找到 18 篇

另有 602 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息

    发表
    测试
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  2. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  3. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  4. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  5. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    测试
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  6. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击

    发表
    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  7. Mind2Web-Injection:面向网页 Agent 视觉提示注入护栏的证据对齐评测

    提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐

    发表
    测试
    GPT-5.6-luna、Qwen3-VL-32B、Qwen3-VL-8B 等 6 个
    摘要作者称检测、定位和反事实响应在六个 VLM 上可分开。

    Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。

    深度解读完整解读
  8. 防御arXiv 2609.01046

    HiveTraceGuard-Pro:面向提示注入、越狱与对抗混淆的紧凑生成式护栏

    提出生成式护栏 HiveTraceGuard-Pro,检测提示注入、越狱与混淆

    发表
    测试
    HiveTraceGuard-Pro (0.6B)、YuFeng-XGuard-Reason-8B、SingGuard-2B 等 15 个
    摘要0.6B 俄英护栏在自建俄语干净集和 PI-RU 上得分最高,聚合 key 居第三,过阻断和回复精度仍是作者标出的短板。

    HiveTraceGuard-Pro 是面向请求与回复审核的 0.6B 生成式护栏,由 Qwen3-0.6B 经 LoRA 微调,在俄语和英语上训练,只输出一个 safe/unsafe 裁决。

    深度解读完整解读
  9. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Gemma-4 31B、DeepSeek-V4 Flash、GPT-OSS 120B 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  10. 攻击arXiv 2609.28613

    研究:提示注入可改变 Jev 决策模型的行动概率

    测量间接提示注入对类型化概率决策的动作劫持

    发表
    测试
    jev-1.13.0
    摘要封闭动作集改变提示注入的表现,但没有去掉概率被不可信内容移动的风险。

    作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。

    深度解读完整解读
  11. 评测与基准arXiv 2609.29429

    Jev 被用于零样本检测十类对齐失败,中位 AUROC 达 0.886

    提出 RLCDAlignBench,零样本检测多种对齐失败

    发表
    测试
    Jev (jev-1.13.0)、Qwen3.5-2B、Phi-4-mini 等 6 个
    摘要一次通用问题已能给多数对齐失败排序,大的误差来自状态和标签。

    RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。

    深度解读完整解读
  12. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了