防御arXiv 2610.02869
AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
- arXiv
- 2610.02869
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- AIDA、Claude Code、PentestGPT 等 12 个
- 攻击恶意使用
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。