复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
- arXiv
- 2610.11932
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Grok、Doubao、ChatGPT 等 10 个
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
另有 246 篇论文还没打上分类标签,暂不在筛选结果里。
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
提出 CORSA,按任务簇优化技能注入的检索与执行
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
用配对回放评测任务范围授权能否阻断越权工具执行
提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。
提出服务方间接提示注入,把主动智能体的决策协助转向预选目标
外部提供者只控制与自身目标关联的内容,就可以把良性主动个人智能体的协助转向该目标。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
把 SynthID 嵌入基因组语言模型采样,并用位置无关检测追溯生成序列
作者在两个六碱基基因组模型的采样里嵌入 SynthID,并让验证者在不知道起点、链和 token phase 时做一次校正后的检出。
提出 APEX,在执行边界用授权契约防御 Agent 间接提示注入
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
提出 COPEX 基准,评测 MCP 智能体对多入口攻击的抵抗力