跳到正文
10月8日 · 周四

全部论文

找到 13 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链

    发表
    场景
    AI Agent
    测试
    GPT-5.4、DeepSeek-V4、Gemini-3.1-flash 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  2. Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御

    发表
    场景
    AI Agent
    测试
    GPT-5-mini、GPT-5、Gemini 3.1 Pro

    摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    深度解读完整解读
  3. 评测与基准arXiv 2610.04589

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性

    发表
    场景
    AI Agent
    测试
    GPT-4o、o3、DeepSeek-V3 等 13 个

    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    深度解读完整解读
  4. 评测与基准arXiv 2607.14611

    论文评测 Claude Code 与 Codex 记忆文件中的提示注入风险

    评测编码智能体记忆文件中的提示注入及其跨会话持久性

    发表
    测试
    GPT-5.2、GPT-5.5、Claude Haiku 4.5 等 4 个
    摘要已植入记忆文件的载荷可以跨会话影响 Claude Code 与 Codex,攻击成功与载荷是否留下是两种不同的失败。

    Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。

    深度解读完整解读
  5. ACEA:面向红蓝队对抗的 LLM 协同演化测试平台

    提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果

    发表
    测试
    openai/gpt-4o、google/gemini-2.5-pro、google/gemma-3-27b-it 等 5 个
    摘要ACEA 用 ASAP 让红蓝对同一目标对打。

    ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。

    深度解读完整解读
  6. 评测与基准arXiv 2609.19587

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固

    发表
    测试
    GPT 5.6 Luna、Opus 5、Opus 4.8 等 8 个

    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    深度解读完整解读
  7. 评测与基准arXiv 2609.35408

    研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准

    提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露

    发表
    场景
    AI Agent
    测试
    GPT-5.6、GPT-5.5、DeepSeek-V4-Pro 等 6 个
    摘要修订痕迹让撤回项重新进入交付物。

    修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。

    深度解读完整解读
  8. 评测与基准arXiv 2609.32691

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    发表
    场景
    AI Agent
    测试
    gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个

    摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    深度解读完整解读
已经到底了