跳到正文
10月10日 · 周六

全部论文

找到 5 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 242 篇还没打标签,不在筛选结果里。

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  2. 攻击arXiv 2608.06862

    SynChain:诱导计算机使用 Agent 自建攻击链并跨任务持久化

    提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链

    发表
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B

    摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。

    深度解读完整解读
  3. 攻击arXiv 2606.21732

    研究者提出 relinking 漏洞:LLM Agent 压缩边界可被拼出恶意指令

    提出 Relink 攻击,在 Agent 压缩边界将分散良性片段重组为恶意指令

    发表
    场景
    AI Agent
    被测模型
    Gemma-4-31B-it、GPT-OSS-20B、Qwen3.6-27B 等 15 个
    摘要论文指出提示词压缩引入重链漏洞,提出 RELINK 攻击工具与 KBRA 边界审计防御,证明压缩边界应作为关键安全边界。

    本文研究了智能体基于摘要的提示词压缩所引入的新型安全漏洞——重链(Relinking),并提出了系统化的攻击构建方法与边界审计防御机制。

    深度解读完整解读
  4. 攻击arXiv 2507.10457

    论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

    提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发

    发表
    场景
    AI Agent
    被测模型
    ChatGPT、Claude、LLaMA3 等 8 个
    摘要作者定义 LPCI。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    深度解读完整解读
已经到底了