复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
- arXiv
- 2610.11932
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Grok、Doubao、ChatGPT 等 10 个
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
另有 479 篇论文还没打上分类标签,暂不在筛选结果里。
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 Safety-Aware Pruning,缓解视觉 token 剪枝放大的多模态越狱
这篇工作评估视觉 token 剪枝如何改变 VLM 在多模态越狱下的行为,并给出推理时防御 SAP。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 APEX,在执行边界用授权契约防御 Agent 间接提示注入
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出 UnAct,仅以前向激活干预从分类器中遗忘指定类别
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 MemLeak,评估多租户 Agent 共享向量记忆的跨用户泄露
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性
MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。
提出 AgentTrap 有状态蜜罐,欺骗并反击自主渗透测试 Agent
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容