防御arXiv 2609.36603
SED:面向 LLM 智能体的免训练持续安全策略学习框架
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
- arXiv
- 2609.36603
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GLM-5.2、Kimi K3
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 Safety Operator,用谱优化调节安全指令表达强度
提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
提出 Skilder,按角色渐进下发企业工具并确定性拦截越权调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
构建 APort Vault 基准,对比支付智能体模型拒答与确定性授权
提出 FLOWSEAL,用工具级信息流控制阻断智能体隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 AlcaTRAz,用锚定字符规则树改写提示以防御越狱
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。