跳到正文
10月8日 · 周四

红队 · 论文

找到 4 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 95 篇还没打标签,不在筛选结果里。

另有 95 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入

    编程 Agent测试Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与 PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  2. 防御arXiv:2608.06422 ·

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击

    LLM 应用攻击者黑盒测试Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个应用层
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    完整解读
已经到底了