防御arXiv 2603.01544
RA-Det:利用鲁棒性不对称检测 AI 生成图像
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
- arXiv
- 2603.01544
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- SDXL、ProGAN、StyleGAN2 等 15 个
摘要RA-Det 把扰动下特征漂移差变成检测信号,平均 ACC 高于表中通用检测器,但不是每行最高。
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
另有 441 篇论文还没打上分类标签,暂不在筛选结果里。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
评测文生图模型的有害内容生成能力与审核检测缺口
用 AGENTDOXX 评测搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。