- 防御arXiv 2607.14737
GeoDetect:面向视觉语言预训练模型的几何对抗检测方法
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
- arXiv
- 2607.14737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要GeoDetect 用几何分数检测 VLP 对抗样本。
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要SAE 追踪稠密检索 QE 的潜变量,转向在四基准上比文本扩展更稳。
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
- 可解释性arXiv 2609.09575
MonoTM:用可解释单义特征做主题建模,超越关键词表示
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
- arXiv
- 2609.09575
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件嵌入
摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
已经到底了