防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 被测模型
- AIDA、Claude Code、PentestGPT 等 8 个
- 攻击恶意使用
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源
GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。