跳到正文
10月9日 · 周五

全部论文

找到 14 篇

另有 444 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.09577

    ElasticBack:通过触发词与规则耦合在 LLM Agent 技能中植入条件后门

    提出 ElasticBack,在单个 Agent 技能中植入仅遇触发词才执行的条件后门

    发表
    被测模型
    GLM-5.2、MiniMax-M3、GPT-5.4 等 4 个
    摘要ElasticBack 用冻结规则加遗传搜索演化 trigger,在单 skill 上做条件后门。

    ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。

    深度解读完整解读
  2. 攻击arXiv 2609.12448

    GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子

    提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源

    发表
    摘要GraphProfiler 用源链接个人知识图谱做属性推断,准确率接近文本基线,并把证据定位到少量源帖。

    GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。

    深度解读完整解读
  3. 防御arXiv 2608.24017

    WebMCP-Phalanx:为浏览器内 LLM Agent 工具调用建立信任边界

    提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面

    发表
    场景
    AI Agent
    摘要Phalanx 用浏览器凭证绑定工具所有权,Q/P 分离拦住描述注入,工具名与返回值仍有残留。

    WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。

    深度解读完整解读
  4. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出持久记忆投毒攻击 PMPA,诱导智能体将外部恶意指令写入记忆并跨会话泄露隐私

    发表
    场景
    AI Agent

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
已经到底了