防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 被测模型
- AIDA、Claude Code、PentestGPT 等 8 个
- 攻击恶意使用
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化