全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
Dyslexify:针对CLIP排版攻击的机制性防御方法
定位了CLIP中处理排版文字的注意力头回路,通过选择性消融该回路在无需微调的情况下显著增强对排版攻击的鲁棒性。
- 会议论文ICLR 2026
基于成对均值差干预的推理时个性化安全控制
提出免训练的推理期激活干预方法PCMS,通过操纵内部表征在保持模型可用性的同时抑制用户特定的不良内容。
- 会议论文ICLR 2026
关注权重:微调大语言模型的无监督监控与控制
提出通过分析微调模型与基准模型权重差异的主奇异向量来监控和控制模型行为的方法,无需相似分布数据即可高效检测后门攻击并审计遗忘学习效果。
- 会议论文ICLR 2026
GAVEL:基于激活监控的规则化安全
将激活建模为可组合的 cognitive elements,定义谓词规则实时检测有害行为,无需重训即可配置安全策略,提升精度与可审计性。
- 会议论文ICLR 2026
RepIt:利用特定概念拒答向量引导语言模型
提出分离激活中特定概念表征的框架RepIt,可针对性抑制对大规模杀伤性武器等危险概念的拒答且绕过标准安全评测,揭示了评测盲区与拒答表征的脆弱性。
- 会议论文ICLR 2026
从Sure到Sorry:基于JailNeurons的大视觉语言模型越狱检测
提出基于越狱关键神经元JailNeurons的多模态大模型越狱检测方法JDJN,通过跨层聚合神经元特征训练检测器,实现了高检测率、低误报率与快速推理。
- 会议论文ICLR 2026
涌现性不对齐易发生,狭义不对齐难实现
研究发现微调时泛化不对齐比狭义不对齐更具稳定性和效率,并分离出可用于监控和干预不对齐行为的通用不对齐线性表征。
- 会议论文ICLR 2026
窄域微调在激活差异中留下清晰可读的痕迹
提出激活差异透镜,通过分析基座与微调模型的激活差异及特征干预,可恢复微调数据内容并检测涌现对齐失效等现象,为安全与可解释性研究提供了方法警示。
- 会议论文ICLR 2026
对抗影响的形态:利用持续同调表征大语言模型潜在空间
利用持续同调研究对抗输入如何重塑大语言模型的内部表征几何,发现间接提示注入与后门微调均会导致潜在空间发生拓扑压缩,揭示了表征变化的几何不变量。
- 会议论文ICLR 2026
通过专家激活与停用调控MoE大语言模型
提出SteerMoE框架,通过在推理时选择性激活或停用特定行为相关专家,在无需微调下控制模型安全性与真实性,并揭示了MoE的安全漏洞。
- 会议论文ICLR 2026
Persona 特征控制 Emergent Misalignment
在多种条件下复现 emergent misalignment,并用 SAE model diffing 找到多个“未对齐 persona”特征,其中毒性 persona 特征最能控制并预测该行为;少量良性样本微调即可恢复对齐。
- 会议论文ICML 2026
内省适配器:训练LLM如实报告自身学到的行为
提出内省适配器IA,利用植入行为的模型对联合优化LoRA促使其用自然语言表达学到的行为,成功用于审计未对齐模型及检测恶意微调攻击。
- 会议论文ICML 2026
超越外部监控器:提升大语言模型透明度以实现更易监控
提出TELLME方法,通过提高大语言模型内部隐层表示的透明度,使模型潜在思维更易被监控以识别敏感与不当行为,并在多模态解毒任务上验证了有效性。
- 会议论文ICML 2026
CorrSteer:基于相关稀疏自编码器特征的生成期大模型引导
提出无监督筛选SAE引导特征的方法CorrSteer,通过两阶段相关与干预定位安全拒答等可解释特征,无需反向传播即可大幅提升HarmBench安全性。
- 会议论文ICML 2026
大语言模型的局部线性赋能基于线性最优控制的激活干预
利用大语言模型层间动力学的局部线性特性,将推理建模为时变动力系统并引入闭环反馈控制,实现对毒性、真实性与拒答等行为的高效精细化激活干预。
- 会议论文ICML 2026
越狱攻击下的鲁棒有害特征:来自大模型注意力头功能分工的机制性证据
通过机制可解释性发现越狱攻击选择性抑制早期易受攻击头而非消除中层安全对齐头,揭示了拒绝被绕过但内部安全信号持续存在的机制,可直接用于高鲁棒越狱检测。
- 会议论文ICML 2026
SteeringSafety:大语言模型多维度安全表征干预评测基准
提出评测表征干预安全性的基准SteeringSafety,发现干预不同安全维度存在严重缠结,针对拒答的干预常削弱模型的常规道德判断。
- 会议论文ICML 2026
SAEmnesia:利用有监督稀疏自编码器擦除扩散模型中的概念
提出有监督稀疏自编码器框架SAEmnesia,将概念绑定至单个可解释神经元以精准高效地擦除概念,有效抑制I2P基准中的不当内容并防御对抗攻击。
- 会议论文ICML 2026
TraceRouter:基于路径级干预的大模型鲁棒安全防御框架
提出通过分析注意力差异定位起始层,利用稀疏自编码器解耦有害特征,并切断因果传播回路,在保障通用性能的同时提升大模型对抗防御能力。
- 会议论文ICML 2026
基于功能归因的机制异常检测
将机制异常检测重构为功能归因问题,利用影响函数衡量内部机制异常,在视觉模型与LLM的后门检测及对抗样本检测上取得优异性能。
- 会议论文ICML 2026
SafeSeek:语言模型安全回路的通用归因框架
提出统一安全可解释性框架SafeSeek,通过可微二值掩码提取多粒度安全回路,成功应用于后门回路清除与安全对齐回路定位。
- 会议论文ICML 2026
大语言模型对激活干预的内生抵抗机制
研究发现大模型能内生抵抗与其任务不符的激活干预,通过SAE定位出负责一致性检查的内部电路;该机制可防御对抗操控但也可能干扰安全干预,且能通过提示和微调加以增强。
- 会议论文ICML 2026
用于忠实表示干预的概念浓缩方法
提出概念浓缩方法COCA,通过显式推理过程重构训练数据以简化有害与良性表示的决策边界,使线性表示擦除能更有效降低越狱攻击成功率。
- 会议论文ICML 2026
谁在迁移安全?识别并定位跨语言共享安全神经元
发现LLM中存在调节跨语言安全拒答行为的共享安全神经元,并通过针对性神经元微调显著增强低资源语言的安全性。