攻击arXiv 2610.02373
HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
- arXiv
- 2610.02373
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- text-embedding-3-small、GPT-4o-mini、Microsoft GraphRAG 等 4 个
摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。