全部论文
另有 428 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2604.11806
Meerkat:跨大量 Agent 轨迹检测安全违规
提出 Meerkat,聚类并用智能体搜索审计 Agent 轨迹库的跨轨迹违规
- arXiv
- 2604.11806
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要Meerkat 用聚类与智能体搜索定位跨轨迹违规,并在真实评测轨迹中找出脚手架泄题与奖励黑客。
Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。
- 评测与基准arXiv 2609.06966
Mole:面向前沿实验室 AI 智能体的内部威胁检测基准
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
- arXiv
- 2609.06966
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
- 防御arXiv 2609.21363
用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
- arXiv
- 2609.21363
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.15671
QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
- arXiv
- 2609.15671
- 发表
- 场景
- 模型与 API
摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
- 防御arXiv 2609.22724
MATE:面向移动 Agent 的策略感知安全审计方法
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
- arXiv
- 2609.22724
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击者
- 黑盒
- 防御监控与审计
- 攻击恶意使用
- 风险Agent 危险操作
- 组件监控器
摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
- 评测与基准arXiv 2609.33481
IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
- arXiv
- 2609.33481
- 发表
- 场景
- 模型与 API
摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。