防御arXiv 2603.01544
RA-Det:利用鲁棒性不对称检测 AI 生成图像
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
- arXiv
- 2603.01544
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 AgentTrap 闭环蜜罐,用有状态反馈欺骗自主渗透测试 Agent
提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源
GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置