跳到正文
10月9日 · 周五

红队 · 论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 58 篇还没打标签,不在筛选结果里。

另有 58 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2607.14493

    LogInject 框架披露 LLM 日志分析中的被动提示注入

    提出 LogInject 框架,评测日志分析中的被动提示注入及缓解

    发表
    测试
    GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct

    摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。

    深度解读完整解读
  2. 防御arXiv 2608.06422

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准分配给独立调用以抵御展示攻击

    发表
    攻击者
    黑盒
    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    深度解读完整解读
  3. 其他arXiv 2609.18120

    PentestChain:面向免费层 LLM 的成本感知 MCP 编排自动化渗透测试框架

    提出成本感知的 MCP 编排框架,用确定性利用图与免费层模型做自动化渗透测试

    发表
    测试
    qwen2.5:7b (Ollama, local)、OpenRouter (free-tier)、Cerebras (free-tier)
    摘要确定性利用图加免费层级联在十次自建运行上测得付费成本为零。

    PentestChain 是一个十阶段、经 MCP 暴露的自动渗透框架,用确定性利用图把 7B 本地模型挡在利用关键路径之外,并把每次交战的美元成本当作实测指标。。

    深度解读完整解读
已经到底了