防御arXiv 2610.04426·10月3日UnAct:无需梯度的定向激活干预实现类别遗忘提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别arXiv2610.04426发表10月3日层模型层场景模型与 API防御模型加固攻击提取与窃取摘要UnAct 用前向激活做类别遗忘。UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。深度解读完整解读
攻击arXiv 2607.26115·7月29日OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击arXiv2607.26115发表7月29日层应用层场景AI Agent攻击者黑盒攻击提示注入技术自动化搜索+1+1深度解读完整解读