跳到正文
10月10日 · 周六

全部论文

找到 21 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.07657

    DEFER1 多智能体防御研究报告受控测试中的攻击成功率下降

    实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击

    发表
    被测模型
    Qwen3-235B-A22B-Instruct-2507、gpt-oss-120b、Llama-4-Scout-17B-16E-Instruct 等 5 个
    摘要DEFER 把确定性检查放在 judge 之前。

    DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。

    深度解读完整解读
  2. 攻击arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道

    发表
    场景
    AI Agent
    被测模型
    Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  4. 评测与基准arXiv 2609.28915

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性

    发表
    被测模型
    AdaBoost、XGBoost、TabPFN 等 10 个
    摘要ACE 用配对的内核与应用层证据表明,syscall 痕迹可判别智能体攻击,两层组合通常更好。

    ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。

    深度解读完整解读
  5. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私

    发表
    被测模型
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
  6. 攻击arXiv 2609.07048

    FreqDoor:面向视觉语言模型的频域后门攻击

    提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门

    发表
    被测模型
    BLIP-2 (opt-2.7b)、InstructBLIP (flan-t5-xl)、LLaVA (interleave-qwen)
    摘要FreqDoor 用频域振幅混合给三款 VLM 植入仅视觉的训练时后门。

    FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。

    深度解读完整解读
  7. 防御arXiv 2609.29647

    AgentKernel:面向 Agent 的可信原生操作系统内核

    提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆

    发表
    场景
    AI Agent
    摘要AgentKernel 是四支柱智能体 OS 设计,安全论证未附带实测数字。

    AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。

    深度解读完整解读
  8. 防御arXiv 2608.21101

    ClawSentry:面向自主 LLM Agent 的渐进式多层安全监控网关

    提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令

    发表
    被测模型
    Codex/GPT-5.4、Codex/GPT-5.5、Claude Code/GLM-5.1 等 6 个
    摘要ClawSentry 用包准入、三级运行时门控和反绕过,压低 skill 攻击并保住干净任务。

    ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。

    深度解读完整解读
  9. 攻击arXiv 2606.04329

    研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

    系统研究 LLM 智能体记忆投毒并构建基准 MPBench

    发表
    场景
    AI Agent
    被测模型
    Meta-Llama-3.1-70B-Instruct、Deberta-v3-base、Llama-3.1-8B-Instruct 等 5 个

    摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。

    深度解读完整解读
  10. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作

    发表
    场景
    web agent
    被测模型
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 6 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读