全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
用特征叠加几何理解涌现式错位
用 SAE 发现诱发错位的数据特征与有害特征在几何上更近,据此过滤最接近有毒特征的训练样本,使错位降低 34.5%。
- 会议论文ACL 2026
大语言模型欺骗行为的隐藏状态轨迹特征
通过隐藏状态轨迹的几何特征检测欺骗,发现谄媚信号最明显、指令性欺骗信号接近于零,七项特征即可支持轻量检测。
- 会议论文ACL 2026
让机制可解释性可审计:呼吁通过持续协作评审制定指南
立场论文,指出机制可解释性缺乏标准化审计体系,呼吁建立持续协作评审平台与专家验证指南,以支持其在 AI 安全中的应用。
- 会议论文ACL 2026
约束参数区域能否保障大语言模型安全?
跨四类模型评估四种安全参数区域识别方法,发现区域重叠度较低且受数据集影响,现有方法难以定位稳定的安全区域。
- 会议论文ACL 2026
LLM 的心理 steering:有效性与可信度评估
提出 PsySET 基准,评测提示、微调与表征工程对情绪和人格的 steering 效果,并发现 steering 会带来安全、隐私等意外副作用。
- 会议论文ACL 2026
CRISP:基于稀疏自编码器的持久概念遗忘
用 SAE 特征抑制实现参数层面的持久遗忘,在 WMDP 有害知识遗忘任务上优于已有方法,同时保留通用能力。
- 会议论文ACL 2026
FineSteer:面向大模型的统一细粒度推理时 steering 框架
把推理时 steering 拆成条件触发与细粒度向量合成两阶段,在安全与真实性基准上优于现有方法,如 Llama-3 的 TruthfulQA 提升 7.6%,同时尽量保持通用能力。
- 会议论文ACL 2026
离策略训练数据对探针泛化的影响
评估八类行为的探针泛化,发现战略欺骗等意图类行为最易失效,并提出利用受激励数据测试泛化的方法,提示现有欺骗探针可能难以胜任真实监控。
- 会议论文ACL 2026
虚假的安全感:基于探针的恶意输入检测为何难以泛化
通过受控实验发现,恶意输入检测探针主要学习指令模式和触发词而非语义有害性,解释其分布外泛化不足并提出评估改进方向。
- 会议论文ACL 2026
识别与干预大语言模型的安全关键参数
提出ESI定位安全关键参数,揭示稠密与MoE模型的分布差异,并通过定向更新或保护这些参数增强安全、抑制微调后的安全退化。
- 会议论文ACL 2026
选择性激活引导:通过判别式层选择实现保范数控制
提出保范数旋转与判别式层选择方法,在九个模型上提高相较既有方法的攻击成功率,同时保持约100%的基准能力。
- 会议论文ACL 2026
分析激活引导向量的安全隐患
系统审计发现,激活引导可显著提高或降低越狱成功率,机制分析将其归因于引导向量与拒答行为潜在子空间的重叠。
- 会议论文ACL 2026
CausalDetox:通过因果注意力头选择与干预降低语言模型毒性
定位导致有毒生成的关键注意力头,通过动态激活引导或定向微调降低毒性,在保持语言流畅性的同时将注意力头选择加速七倍。
- 会议论文ACL 2026
Safe-SAIL:用稀疏自编码器刻画模型细粒度安全特征
提出安全领域稀疏自编码器解释框架,将解释成本降低55%,并提供涵盖四个领域的1758个安全相关特征。
- 会议论文ICLR 2026
AlphaSteer:基于零空间约束学习拒答激活干预
提出AlphaSteer激活干预方法,通过零空间约束保持良性提示性能并引入拒答方向,有效防御越狱攻击且不损害通用能力。
- 会议论文ICLR 2026
当思考适得其反:推理诱导对齐失效的机制性洞察
揭示推理能力增强引发对齐失效的现象,并通过注意力头与安全神经元激活缠结提供了神经元级的机制解释。
- 会议论文ICLR 2026
基于分布匹配与分布式交换干预的双向模型调控
提出Concept DAS方法,通过弱监督分布匹配与分布式交换干预实现双向概念调控,能有效干预安全拒答行为并消除思维链后门。
- 会议论文ICLR 2026
问题出在哪?通过表征梯度追踪归因大模型不良行为
提出在激活空间分析表征及其梯度的归因框架,能精确将有害内容、后门投毒和知识污染等不良行为追溯到具体的训练样本与短语,为模型审计提供诊断工具。
- 会议论文ICLR 2026
基于权重算术的大语言模型干预技术
提出对比权重干预方法,通过权重加减隔离行为方向,相比激活干预具有更强泛化性,能有效减少微调引入的谄媚与拒答不足,并可用于检测突现的对齐失效。
- 会议论文ICLR 2026
Dyslexify:针对CLIP排版攻击的机制性防御方法
定位了CLIP中处理排版文字的注意力头回路,通过选择性消融该回路在无需微调的情况下显著增强对排版攻击的鲁棒性。
- 会议论文ICLR 2026
基于成对均值差干预的推理时个性化安全控制
提出免训练的推理期激活干预方法PCMS,通过操纵内部表征在保持模型可用性的同时抑制用户特定的不良内容。
- 会议论文ICLR 2026
关注权重:微调大语言模型的无监督监控与控制
提出通过分析微调模型与基准模型权重差异的主奇异向量来监控和控制模型行为的方法,无需相似分布数据即可高效检测后门攻击并审计遗忘学习效果。
- 会议论文ICLR 2026
GAVEL:基于激活监控的规则化安全
将激活建模为可组合的 cognitive elements,定义谓词规则实时检测有害行为,无需重训即可配置安全策略,提升精度与可审计性。
- 会议论文ICLR 2026
RepIt:利用特定概念拒答向量引导语言模型
提出分离激活中特定概念表征的框架RepIt,可针对性抑制对大规模杀伤性武器等危险概念的拒答且绕过标准安全评测,揭示了评测盲区与拒答表征的脆弱性。