全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 防御arXiv 2602.24210
研究者提出 Staged Decoding 与 SFT 数据集,减少大推理模型推理轨迹中的隐私泄露
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
- arXiv
- 2602.24210
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要用一般指令跟随训练加分段解码,可降低轨迹隐私泄露,但数学效用下降。
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
- 防御arXiv 2609.01677
Skill-as-API:面向智能体软件工程的机密多智能体协作协议
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
- arXiv
- 2609.01677
- 发表
- 层
- 应用层
摘要协议把 skill 正文留在所有者侧,四层限制发现内容、权限期限和注入拼接。
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.16229
ARIA:用稀疏自编码器实现测试时机器遗忘
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
- arXiv
- 2609.16229
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
已经到底了