全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 防御arXiv 2602.24210
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
- arXiv
- 2602.24210
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
- 攻击arXiv 2610.04195
MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
- arXiv
- 2610.04195
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 攻击arXiv 2609.35699
论文:蒸馏防御在蒸馏后强化学习下易被攻破
提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御
- arXiv
- 2609.35699
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要更现实的蒸馏攻击是蒸馏后再 RL。
这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。
- 防御arXiv 2604.11806
Meerkat:跨大量 Agent 轨迹检测安全违规
提出 Meerkat,聚类并用智能体搜索审计 Agent 轨迹库的跨轨迹违规
- arXiv
- 2604.11806
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要Meerkat 用聚类与智能体搜索定位跨轨迹违规,并在真实评测轨迹中找出脚手架泄题与奖励黑客。
Meerkat 是事后审计方法,用来在智能体轨迹仓库里找出单条看不出、合在一起才违反自然语言安全属性的见证。
- 评测与基准arXiv 2609.06966
Mole:面向前沿实验室 AI 智能体的内部威胁检测基准
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
- arXiv
- 2609.06966
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MOLE 构建了智能体内部威胁检测基准,作者指出高漏检现状与推理痕迹的防御价值,并展示了监控策略优化空间。
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.16229
ARIA:用稀疏自编码器实现测试时机器遗忘
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
- arXiv
- 2609.16229
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 评测与基准arXiv 2609.33102
ORBIT:基于 UK AISI Inspect 的多智能体安全评测框架
提出 ORBIT 框架,评测多智能体系统中的攻击、合谋与多类防御
- arXiv
- 2609.33102
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
- 防御arXiv 2609.22724
MATE:面向移动 Agent 的策略感知安全审计方法
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
- arXiv
- 2609.22724
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击者
- 黑盒
- 防御监控与审计
- 攻击恶意使用
- 风险Agent 危险操作
- 组件监控器
摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
已经到底了