防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- AIDA、Claude Code、PentestGPT 等 8 个
- 攻击恶意使用
另有 450 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控