可解释性arXiv 2609.09575
MonoTM:用可解释单义特征做主题建模,超越关键词表示
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
- arXiv
- 2609.09575
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件嵌入
摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。