攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
- 被测模型
- OmniGen2、BAGEL-7B
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒
CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。