跳到正文
10月8日 · 周四

红队 · 论文

找到 12 篇

另有 95 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.05793 ·

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    编程 Agent测试Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct训练与数据层

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    完整解读
  2. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    编程 Agent攻击者黑盒无盒测试CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    完整解读
已经到底了