跳到正文
10月9日 · 周五

隐私与数据泄露 · 论文

找到 8 篇

另有 57 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息

    发表
    测试
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  2. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    测试
    GPT-5-mini、GPT-5.2、GPT-OSS-120B 等 7 个
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  3. Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    发表
    场景
    AI Agent
    测试
    Gemini 3.1 Pro、GPT-5-mini、GPT-5

    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    深度解读完整解读
  4. 攻击arXiv 2607.05189

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    发表
    场景
    AI Agent
    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    深度解读完整解读
  5. 防御arXiv 2609.36372

    TTMark:超越单 token 熵的成对无失真水印

    提出成对无失真水印 TTMARK,增强低熵下的机器文本检测

    发表
    测试
    Llama3.2-3B-Instruct、Mistral-v0.3-7B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。

    TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。

    深度解读完整解读
  6. 攻击arXiv 2609.13889

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出持久记忆投毒攻击 PMPA,诱导智能体将外部恶意指令写入记忆并跨会话泄露隐私

    发表
    场景
    AI Agent
    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max

    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    深度解读完整解读
已经到底了