攻击arXiv 2609.02774
CodePoisonRAG:针对检索增强代码生成的知识投毒攻击
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
- arXiv
- 2609.02774
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Qwen 3.5 9B、Code Llama 13B、DeepSeek-Coder-V2 16B 等 4 个
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
另有 434 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 Tracekit,对编码 Agent 做防篡改的意图-推理-动作审计
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。