跳到正文
10月8日 · 周四

红队 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2608.06422 ·

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击

    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Opus 4.6 等 5 个应用层
    场景
    LLM 应用攻击者黑盒
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    完整解读
已经到底了