防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 被测模型
- AIDA、Claude Code、PentestGPT 等 8 个
- 攻击恶意使用
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
用醉酒语言诱导改编对话模型并评测越狱与隐私泄露
作者把醉酒语言当作攻击向量,检验把 LLM 适配成醉酒发短信的模式后,越狱和情境隐私是否变差。动机是人类醉酒时的失范与泄密,以及 LLM 模拟人设的能力。