攻击arXiv 2609.01325
VerTox:用可验证奖励引导的强化学习对神经排序模型实施语料投毒
提出 VerTox,用可验证奖励强化学习生成误导文档并投毒检索语料
- arXiv
- 2609.01325
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- SimLM-base、BGE-base、Cohere-embed-english-v3.0 等 8 个
摘要VerTox 以可验证奖励微调小 LLM,生成能抬高排序并腐蚀事实的投毒文档。
VerTox 用可验证奖励把小 LLM 微调成语料投毒生成器,用来探测神经排序器在注入文档下的暴露面。