全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
Assistant Axis:定位并稳定语言模型的默认人格
在激活空间发现 Assistant Axis,其偏移可预测人格漂移;将激活限制在该轴固定区域可稳定行为并抵御基于人格的越狱。
- 会议论文ICML 2026
CoT并非真实之链:虚假新闻生成中推理大模型的内部机制分析
揭示模型在拒答虚假新闻请求时CoT仍可能传播不安全内容,并通过层级解构与雅可比谱指标定位了导致安全分歧的关键注意力头。
- 会议论文ICML 2026
利用概念消融微调引导大模型分布外泛化
提出CAFT技术,利用可解释性工具在潜空间中通过线性投影消融未预期概念的方向,在不改动训练数据的情况下将突发性对齐失效减少了十倍。
- 会议论文ICML 2026
单一探针无法捕获所有欺骗:迈向针对性欺骗检测
评估了用于监控AI欺骗行为的线性探针,发现欺骗检测具有异质性,单一通用探针效果有限,针对特定欺骗类型部署定制探针能显著提升检测能力。
- 会议论文NDSS 2026
通过恶意载荷定位实现可解释的深度学习网页攻击检测
提出WebSpotter定位HTTP请求中的恶意载荷,并自动生成WAF规则,定位准确率较基线至少提升22%。
- 会议论文USENIX Security 2026
JailbreakScope:通过表征与电路分析解释越狱机制
在 5 个 LLM、7 种越狱策略上发现越狱会增强肯定回应成分、抑制拒答成分,使表征偏向安全区域,且表征欺骗与电路激活偏移高度相关。
- 会议论文USENIX Security 2026
从模型认知视角量化大语言模型攻击
论文用中间层探针检测有害提示相关信号,提出Sentinel并绘制安全信号在模型层间的传播与衰减。
- 会议论文ACL 2025
通过定向干预实现语言模型的多属性引导
提出MAT-Steer,通过选择性词元干预与稀疏正交引导向量缓解属性冲突,在兼顾真实性、毒性等属性的任务中优于既有方法。
- 会议论文ACL 2025
超越提示工程:通过目标原子引导稳健控制大模型行为
提出STA,分离并操控解耦的知识成分以增强安全性;实验显示其在对抗场景中的鲁棒性与灵活性,并验证了对推理模型的控制效果。
- 会议论文ACL 2025
小改动,大影响:少量神经元操控如何改变大模型攻击性
识别与攻击性表达相关的神经元并进行屏蔽和激活实验,发现仅操控少量神经元即可使攻击性最高增加33%,且效果随层位置变化。
- 会议论文ACL 2025
LLMBraces:通过相关子更新调整大语言模型预测
依据输入相关性动态调节前馈层子更新的贡献,以较少可训练参数改善预测,并在情感控制生成和降低有毒输出方面展现效果。
- 会议论文ACL 2025
防护为何失效?对齐模型的安全机制倾向锚定模板区域
通过实验和机制分析发现,多种对齐模型的安全决策过度依赖模板区域,导致越狱脆弱性;降低这种依赖有望改善防御。
- 会议论文ACL 2025
COSMIC:LLM 激活中的通用拒答方向识别
提出 COSMIC,用余弦相似度自动选择拒答 steering 方向与目标层,无需依赖拒答 token,在对抗场景和弱安全对齐模型中也能识别拒答方向。
- 会议论文ACL 2025
DAPI:领域自适应毒性探针向量干预实现细粒度解毒
为不同毒性类别训练探针向量,生成时动态选择并缩放后从模型中减去;毒性最多降低 78.52%,流畅度几乎不变。
- 会议论文ICLR 2025
用命题探针监控语言模型中的潜在世界状态
提出 propositional probes 从激活中解码命题,在提示注入、后门攻击和性别偏见下解码结果仍忠实,说明模型内部常编码了忠实的世界模型。
- 会议论文ICLR 2025
利用条件激活干预实现可编程拒答
提出条件激活干预方法CAST,通过在推理时分析隐层激活模式来条件性施加干预,无需更新模型权重即可实现对特定有害内容的精确拒答控制。
- 会议论文ICLR 2025
我了解这个实体吗?语言模型中的知识感知与幻觉机制
利用稀疏自编码器发现语言模型表征空间中表征实体感知的方向,证实该方向能因果干预模型的拒答与幻觉行为,揭示了微调拒答机制的底层机理。
- 会议论文ICLR 2025
注意力头在大型语言模型安全中的作用机制研究
提出安全注意力头重要性得分Ships与归因算法Sahara,发现仅消融单个关键安全头即可导致对齐模型对有害请求的回答率激增16倍,揭示了安全注意力机制机理。
- 会议论文ICLR 2025
对齐大语言模型中的安全层:大模型安全的关键
揭示对齐大模型参数层面的安全机制,定位出区分恶意查询的关键中间“安全层”,并提出在微调中固定安全层梯度的微调方法SPPFT以防安全退化。
- 会议论文ICLR 2025
通过传输激活来控制语言模型与扩散模型
提出基于最优传输的 Activation Transport (AcT) steering 框架,可在 LLM 中降低毒性、提升真实性,在文生图模型中实现风格控制与概念否定。
- 会议论文ICLR 2025
Llama3-8b-Instruct 自生成文本识别能力的机制探查与干预控制
发现模型能在残差流中表征自我作者身份,并提取出与“自我”概念因果相关的表征向量,通过激活干预成功控制了模型对文本创作归属的判断与声明。
- 会议论文ICLR 2025
通过安全特异性神经元理解与增强大模型安全机制
定位了仅占参数量不到1%且位于自注意力层的安全神经元,提出SN-Tune与RSN-Tune对其进行专属调优,显著降低有害输出并抵御微调攻击。
- 会议论文ICML 2025
SAeUron:用稀疏自编码器实现扩散模型中可解释的概念遗忘
用 SAE 特征精确干预扩散模型激活以移除有害或不想要的概念,在 UnlearnCanvas 和 I2P 上表现更好,并更能抵御对抗攻击。
- 会议论文ICML 2025
大语言模型中拒答的几何结构:概念锥与表征独立性
提出基于梯度的表征工程方法,发现多个相互独立的拒答方向乃至多维概念锥,表明拒答由复杂空间结构中的多种机制共同驱动。