HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
完整解读
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
分析分布偏移下安全路由评测的基线选择偏差与虚假下限
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
提出契约约束的工具调用修复协议,在执行前拦截非法补丁
完整解读提出 LongPIBench,评测长文档场景下的提示注入攻击与防御