论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
- arXiv
- 2604.02623
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
另有 452 篇论文还没打上分类标签,暂不在筛选结果里。
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
研究视觉语言模型在协作中能否表示并说出指称不确定性
摘要指称不确定性可被引出,但很少说出来。
提出 Spatial-SAE,用空间依赖先验改进视觉概念分解
Spatial-SAE 针对视觉 SAE 的概念碎片化:tokenwise 目标在 LRH 之外把各 patch 的码当成独立,而作者报告冻结视觉 Transformer 的激活仍保留邻域可预测性。
提出 Patch-to-Prune,旁路 VLM 部分层的视觉投影计算
P2P 是面向 VLM 推理的训练无关计算旁路:不删除视觉 token,而在选定 decoder 层用固定激活代理代替视觉投影。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
提出 SPAR 以分离注意力结构偏置并重分配视觉注意力,减轻多模态幻觉
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
这是一项对 MLLM 免训练不确定性估计的分组比较:幻觉检测被作者视为弃答、转交或路由的一种用途,而不是唯一目标。
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
提出 FLIP 末层推理时探针,检验视觉语言模型干预效应的来源
FLIP 是开源 VLM 上的推理时末层探针,用来检验干预效应是否结构化、与任务相连,而不是用来转向模型。。