复旦团队测量 AI 搜索引用脆弱性:普通发帖可进入引用与答案文本
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
- arXiv
- 2610.11932
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Grok、Doubao、ChatGPT 等 10 个
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
另有 298 篇论文还没打上分类标签,暂不在筛选结果里。
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出热启动 Bandit 的部署前有界离线注入攻击
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出服务方间接提示注入,把主动智能体的决策协助转向预选目标
外部提供者只控制与自身目标关联的内容,就可以把良性主动个人智能体的协助转向该目标。
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 PACT,遗忘推理模型在压力下的欺骗行为并保留上下文理解
摘要论文将大模型欺骗形式化为上下文条件行为,提出 PACT 框架在消除欺骗的同时保留了上下文遵循能力。
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 Information Blackhole 与 AGM,控制点云自编码器后门重建到指定形状
这篇工作研究点云自编码器的训练时后门:干净输入仍自重建,带触发的输入应重建成攻击者指定形状。分类后门只需把预测推向离散标签。PCAE 把源几何与目标信息编进同一个连续潜空间,残留源几何会把重建拉回源形状。
证明预训练投毒的清洁超额风险指数随极限顺序变化
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 RAMP,逆转对抗扰动加强恶意软件检测器的干净标签后门
RAMP 是 score-based black-box 下的 clean-label 后门增强,对象是会微调的 Windows PE 原始字节恶意软件检测器。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。