跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 12 篇

另有 386 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2608.18066 ·

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    网页与电脑操作测试GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个应用层
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    完整解读
  2. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    AI Agent测试GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  3. 评测与基准arXiv:2607.10526 ·

    PASB 基准:自改进个人 Agent 的持久谄媚在后续会话中失败率达 71.9%

    构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚

    AI Agent测试GPT-5.5、GPT-5.4、Gemini-3.1-Pro 等 12 个应用层
    摘要PASB 显示一次被写入的主张会跨会话塑造回答,改笔记比只阻止写入更能降低后续失败。

    PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。

    完整解读
  4. 评测与基准arXiv:2607.14611 ·

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    编程 Agent测试Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个应用层
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    完整解读
  5. 评测与基准arXiv:2609.35596 ·

    SEABench:评测自演化智能体的内生失配

    提出 SEABench,评测无参数自进化智能体的内生失配

    AI Agent测试Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个应用层
    摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。

    SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。

    完整解读
  6. 评测与基准arXiv:2609.17320 ·

    Emergence World:对长时程多智能体系统开展对抗压力测试

    构建 Emergence World,评测长时程多智能体对抗韧性与群体失效

    多智能体测试Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个应用层

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
已经到底了