跳到正文
10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    SED:面向 LLM 智能体的免训练持续安全策略学习框架

    研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。

  2. arXiv · 收录 · 原文 论文43

    MATE:面向移动 Agent 的策略感知安全审计方法

    研究者提出 MATE,一个轻量的策略条件审计器,同时编码 Agent 轨迹与自然语言安全策略,判断轨迹是否违反给定策略并给出原因。由于把策略当作可编辑文本而非固定模型参数,MATE 无需重新训练即可适配用户自定义和不断变化的要求。作者从全球数百个热门移动应用中抽取应用描述、工作流和策略构建知识库,并用多阶段流水线合成超过 140K 条语义真实的策略条件轨迹。团队同时发布 MATEBench,包含两个合成子集和一个由人工收集轨迹构成的真实子集。

已经到底了