防御arXiv 2610.02869·10月2日AgentTrap:面向自主渗透测试 Agent 的有状态反馈欺骗蜜罐提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 AgentarXiv2610.02869发表10月2日层应用层场景coding agent被测模型AIDA、Claude Code、PentestGPT 等 8 个攻击恶意使用深度解读完整解读
攻击arXiv 2609.06749·9月7日PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文arXiv2609.06749发表9月7日层模型层场景模型与 API被测模型BERT-base、RoBERTa-base、T5-base 等 6 个攻击提取与窃取组件嵌入深度解读完整解读