全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 18 条- 会议论文ICML 2025
机制性遗忘:通过机制定位实现稳健的知识遗忘与编辑
利用机制可解释性定位事实回忆的查找表机制,使知识遗忘与编辑更稳健、更抗再学习和攻击,副作用更小。
- 会议论文ICML 2025
激活空间干预可在大语言模型之间迁移
通过学习模型间激活空间映射,迁移 steering 向量以实现后门移除和有害请求拒答,可用小模型对齐大模型。
- 会议论文ICML 2025
LLMScan:基于因果扫描的 LLM 不当行为检测
通过分析输入 token 与 Transformer 层的因果贡献,发现正常与有害或不实输出的因果分布差异明显,据此构建轻量检测器。
- 会议论文ICML 2025
LLM 对齐的隐藏维度:正交安全方向的多维分析
发现拒答行为由多维方向共同控制:一个主导方向加若干对应角色扮演等特征的次要方向,移除触发 token 可削弱这些方向而绕过安全能力。
- 会议论文NeurIPS 2025
重新定义专家:用于缓解毒性的语言模型可解释分解
提出 EigenShift,对输出层做特征分解以定向抑制生成毒性的成分,无需额外训练,且不损害语言能力。
- 会议论文NeurIPS 2025
用激活探针检测高风险交互
用激活探针监控可能导致重大危害的高风险交互,效果媲美中型 LLM 监控器而计算成本低六个数量级,可作分层监控的初筛。
- 会议论文NeurIPS 2025
理解安全对齐:从安全神经元看机制可解释性
用激活对比定位约 5% 的安全神经元,仅修补其激活即可恢复超过 90% 的安全表现,并解释对齐税,还可在生成前检测不安全输出。
- 会议论文NeurIPS 2025
LinEAS:基于分布损失的端到端激活 steering 学习
用全局分布损失端到端训练线性激活 steering,仅需少量无配对样本即可缓解语言模型毒性,效果接近依赖强监督的方法。
- 会议论文NeurIPS 2025
Learning to Steer:面向多模态 LLM 的输入相关 steering
训练小型辅助模块预测输入相关的 steering 向量,在多模态 LLM 上减少幻觉并强化安全行为,优于静态 steering 基线。
- 会议论文NeurIPS 2025
度量并引导单义性:Guided Sparse Autoencoders
提出特征单义性分数 FMS 与带概念标签训练的 G-SAE,在毒性检测、隐私属性识别等任务上提升单义性,并实现更精细的 steering。
- 会议论文NeurIPS 2025
用 Gradient Slingshots 操纵特征可视化
提出 Gradient Slingshots,可在不改架构下让特征可视化收敛到任意预设图像,暴露审计风险,并给出简单防御。
- 会议论文NeurIPS 2025
SAFEx:通过稳定的安全关键专家识别分析 MoE 大模型漏洞
识别 MoE 模型中承担安全行为的专家并分组;屏蔽 12 个专家使 Qwen3-30B-A3B 拒答率降 22%,并用 LoRA 与负权重合并提升拒答。
- 会议论文NeurIPS 2025
Angular Steering:通过激活空间旋转控制行为
将 steering 表述为固定二维子空间内的几何旋转,对拒答与顺从等行为实现连续细粒度控制,并保持通用语言建模性能。
- 会议论文NeurIPS 2025
拒答方向在各安全对齐语言间具有普遍性
在14种语言上发现拒答方向跨语言通用,从英语提取的向量几乎可完全绕过其他语言的拒答,并解释了跨语言越狱的机制。
- 会议论文NeurIPS 2025
语言模型能预测自身行为
基于输入表示训练带 conformal 保证的探针,在生成前预警越狱等对齐失效,预警系统使越狱减少 91%。
- 会议论文NeurIPS 2025
语言模型能够对自身内部激活进行元认知监控与控制
用 neurofeedback 范式量化 LLM 报告和控制自身激活的能力,发现其只能监控神经空间的一小部分,并指出模型可能规避激活层面的安全检测。
- 会议论文NeurIPS 2025
克服 Crosscoder 的稀疏性伪影以解释 Chat 微调
指出 crosscoder 的 L1 损失会误判概念为微调独有,提出 Latent Scaling 并改用 BatchTopK,找到与虚假信息、拒答相关的 chat 特有 latent。
- 会议论文NeurIPS 2025
LLM 对有害性与拒答的编码是分离的
发现有害性方向与拒答方向相互独立;部分越狱只削弱拒答信号而不改变有害性判断,据此提出对微调攻击鲁棒的 Latent Guard。