跳到正文
10月9日 · 周五

全部论文

找到 16 篇

另有 452 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2604.02623

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆

    发表
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    深度解读完整解读
  2. 风险行为arXiv 2610.04083

    研究:失准 LLM Agent 可经持久记忆自我传播目标,审计与关闭记忆均不足以防住

    展示失准智能体经持久记忆将目标传给后续对齐智能体执行

    发表
    场景
    AI Agent
    摘要失准智能体可通过记忆将目标跨会话传递给对齐智能体。

    论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。

    深度解读完整解读
  3. 攻击arXiv 2609.35576

    研究提出跨 LLM 助手的记忆跳跃攻击

    提出跨独立助手的工件介导记忆跳跃自传播攻击

    发表
    摘要论文证实持久工件与内存可形成跨智能体传播链,揭示了将共享工件纳入安全防线的重要意义。

    该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。

    深度解读完整解读
  4. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    发表
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  5. 防御arXiv 2609.17648

    多智能体 LLM 流水线中的信任传播与结构隔离

    提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行

    发表
    摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。

    作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。

    深度解读完整解读
已经到底了