分析与理论arXiv:2610.02886 · 10月2日研究揭示无触发投毒审计缺口:事实答对不等于决策正确揭示无触发虚假训练下事实回答与下游决策的审计差距模型与 API·测试Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 9 个·训练与数据层投毒与后门摘要作者发现无触发词虚假训练下事实回答与下游决策存在脱节,直接审计与事实纠错均无法保证决策正确。论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。完整解读
可解释性arXiv:2609.06934 · 9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击用权重几何解释事后安全脆弱,并提出预训练持续安全共训练模型与 API·测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个·模型层模型加固模型篡改拒答失当微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。完整解读