攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
- 被测模型
- OmniGen2、BAGEL-7B
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链
KidnapRAG 是针对 Agentic RAG 的 black-box 语料投毒:攻击者不能访问模型、提示词、检索器或私有轨迹,只能发布可能被检索的文档,并利用公开界面上的推理与搜索查询。
构造可通过计费审计的 token 虚报,使服务商系统性超收
不透明 LLM 的按 token 计费里,现有审计核验的是提供方可控的证据,不诚实提供方可以虚报并通过检查。。