防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- AIDA、Claude Code、PentestGPT 等 12 个
- 攻击恶意使用
另有 434 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源
GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness