防御arXiv 2609.21363
用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
- arXiv
- 2609.21363
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-4.1、GPT-5、Gemini 2.5 Pro 等 5 个
另有 538 篇论文还没打上分类标签,暂不在筛选结果里。
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。