防御arXiv 2610.04426·10月3日UnAct:无需梯度的定向激活干预实现类别遗忘提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别arXiv2610.04426发表10月3日层模型层场景模型与 API防御模型加固攻击提取与窃取摘要UnAct 用前向激活做类别遗忘。UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。深度解读完整解读
可解释性arXiv 2609.06934·9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练arXiv2609.06934发表9月7日层模型层场景模型与 API防御模型加固攻击模型篡改风险拒答失当组件微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。深度解读完整解读