跳到正文
10月8日 · 周四

提示注入 · 论文

找到 3 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 76 篇还没打标签,不在筛选结果里。

另有 76 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2607.14611 ·

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    编程 Agent测试Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 等 4 个应用层
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    完整解读
  2. 评测与基准arXiv:2609.17320 ·

    Emergence World:对长时程多智能体系统开展对抗压力测试

    构建 Emergence World,评测长时程多智能体对抗韧性与群体失效

    多智能体测试Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个应用层

    摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。

    完整解读
已经到底了