攻击arXiv 2609.02774
CodePoisonRAG:针对检索增强代码生成的知识投毒攻击
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
- arXiv
- 2609.02774
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- GLM-5.1、Qwen 3.5 9B、Code Llama 13B 等 4 个
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 SeTox 检索增强框架,检测中文新词的隐性毒性
SeTox 研究中文新词上的隐性毒性检测:词表加检索增强,使静态 LLM 在不重训练的情况下利用公开网页上下文。
提出 GenV,检测求解器判定无法区分的不忠实形式化
GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露