复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
- arXiv
- 2610.11932
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Grok、Doubao、ChatGPT 等 10 个
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页
GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。