可解释性arXiv:2610.05541 · 10月5日研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答模型与 API·测试Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个·模型层越狱拒答失当摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。完整解读
可解释性arXiv:2610.01821 · 10月2日研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构模型与 API·测试GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个·模型层摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。完整解读
可解释性arXiv:2609.06934 · 9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击用权重几何解释事后安全脆弱,并提出预训练持续安全共训练模型与 API·测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个·模型层模型加固模型篡改拒答失当微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。完整解读