跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 10 篇

另有 247 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    测试
    Deberta-v3-base、GPT-OSS-120B、Meta-Llama-3.1-70B-Instruct 等 6 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  2. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    Phi-3-Vision-4B、LLaVA-v1.5-13B、LLaVA-v1.6-34B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  3. 防御arXiv 2609.13601

    Mind the Gap:检测 DAO 治理中的描述-执行不匹配攻击

    提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配

    发表
    测试
    Mistral-Large、GPT-4o、Claude 4.5 Sonnet 等 8 个
    摘要用公开链上数据仿真治理全流程,再以逐动作证据映射在执行前发现描述与执行不一致。

    Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。

    深度解读完整解读
  4. 评测与基准arXiv 2609.19140

    AgentLSD:在对抗性任务污染下评测 AI 安全 Agent

    用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销

    发表
    测试
    Mistral Small 4、Gemma-4 31B、DeepSeek-V4 Flash 等 6 个
    摘要AgentLSD 用配对 web CTF 表明,欺骗性环境证据会改变安全智能体的解题率与工作量。

    AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。

    深度解读完整解读
  5. 评测与基准arXiv 2608.28411

    LongPIBench:面向长上下文提示注入的评测基准

    提出 LongPIBench,评测长文档场景下的提示注入攻击与防御

    发表
    测试
    Ministral-3-8B-Instruct、Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct 等 11 个

    摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。

    深度解读完整解读
  6. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入

    发表
    场景
    AI Agent
    测试
    GitHub Copilot、Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  7. 评测与基准arXiv 2609.28915

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    构建 ACE 语料并比较内核与应用层证据的攻击检测效果

    发表
    测试
    Devstral 2 123B、AdaBoost、XGBoost 等 13 个
    摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。

    ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。

    深度解读完整解读
已经到底了