DiscourseFlip:针对黑盒 RAG 的话语级观点操纵攻击
DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation
AI 导读
研究者提出 DiscourseFlip,一种针对黑盒检索增强生成(RAG)系统的话语级观点操纵攻击。该工作将话语级观点操纵形式化为新的威胁模型,即通过语义查询网络中的协同影响,在跨多主题的整体查询空间上诱导观点偏移。DiscourseFlip 采用智能体式、图引导的方法,动态分配有限的投毒预算以最大化话语级观点偏差。实验显示,该攻击能在上下文化查询网络上持续诱导目标观点偏移,在覆盖范围和有效性上显著优于现有基线;用户研究确认其有效且不易被用户察觉。系统分析还表明,现有缓解策略对这类话语级操纵无效。