跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 1 条 · 本页 1 条 · 共 1 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源102新闻与研究103细分与主体7来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御1 条材料论文:SED:面向 LLM 智能体的免训练持续安全策略学习框架论文2026-09-29SED:面向 LLM 智能体的免训练持续安全策略学习框架方向:其他方向其他方向1方向:Agent 安全Agent 安全1方向:DeepSeekDeepSeek1方向:防御与护栏防御与护栏1方向:越狱与攻击越狱与攻击1方向:月之暗面 · Kimi月之暗面 ·Kimi1方向:提示注入提示注入1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。1 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 1 条
  • 论文arXiv:越狱、提示注入、投毒与防御

    SED:面向 LLM 智能体的免训练持续安全策略学习框架

    研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。