全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:对齐、欺骗与监督
Hessian Null Space Continuation:在单个神经网络解附近发现大量表征多样性
研究者提出 Hessian Null Space Continuation(HNC),一种利用局部曲率在权重空间中穿行、保持网络功能不变并可导向指定性质解的方法。
- 动态Redwood Research
Redwood Research 提出 NLS depth:量化模型不可言说串行认知的新指标
Redwood Research 提出 NLS depth(自然语言根基节点分隔深度),用于量化模型可执行的不可言说串行认知量,作为思维链可监控性的代理指标。该指标基于 GDM 论文(Brown-Cohen 等,2026)的"不透明串行深度"概念,将输出文本且由预训练先验初始化的节点视为"可解释瓶颈",标准 Transformer 的该深度与层数成正比。
- 论文arXiv:越狱、提示注入、投毒与防御
研究:自然语言自动编码器中哪些 token 最值得审计
一项基于 470 万条提示注入与隐藏行为解释的研究比较了模型计算信号与仅依赖对话结构的排序器,发现在四个数据集中的三个上,只解释 5% 的位置就能接近逐位置解释的成功率,此处成功指获得有关威胁的解释。研究还表明,预训练的言语化器无需额外训练即可还原模型经微调学会隐藏的词。作者指出这有助于确定审计者的解释生成重点。
- 动态Redwood Research
Redwood Research:潜在推理架构可能削弱思维链这一最强监控工具
Redwood Research 发文论证,潜在推理架构允许模型在隐状态中完成更多计算,可能削弱依赖可读思维链的监控。作者认为,可读推理形成的计算限制是现有监控的重要条件,COCONUT、full-bandwidth transformers、looped transformers 等路线可能绕开这一条件。文章在9月29日修订时收窄了结论;这是对架构发展方向的风险判断,不能据此认定所有潜在推理模型都无法监控。
- 动态AI Alignment Forum
WorkspaceBench:评估读取模型全局工作区的可解释性方法
作者发布 WorkspaceBench,一套评估激活到文本工具能否读取模型全局工作区(前向传播中的中间变量)的基准,共 3356 道题、27 个评测族,覆盖安全、逻辑推理与多跳计算,并包含面向单 token 输出工具的子集和专门的幻觉评测。基准基于 Qwen-3.6-27B 开发,作者预期可用于更大模型,但更小或更弱的模型可能需要调整。评测对象包括 Logit lens、J-lens、R-lens、Tuned lens 等单 token 读取器,以及 NLA、SAE、Patchscopes、Template lens、Oracle Lens 等多 token 读取器。作者发现单 token 方法难以呈现多 token 或组合性概念,而 NLA 虽能呈现大量工作区内容却极易虚构,几乎每条读出都含有与上下文矛盾的断言。
- 论文arXiv:越狱、提示注入、投毒与防御
研究用因果激活修补定位模型服从提示注入指令的决策层
研究者在 4B 至 32B 的五个模型上做逐层因果激活修补,发现攻击信息从第一层起就可线性解码,但直到网络后三分之一的晚层瓶颈才对行为产生明显因果影响。作者报告,修补该瓶颈可在所测案例中逆转模型对攻击指令的服从;相关机制位于紧凑线性子空间,不同模型家族呈现相似结构。这是受测模型和实验设定内的机制研究,不是对任意模型的通用防御保证。
- 动态AI Alignment Forum
潜在推理架构可能削弱 CoT 这一最强监督工具
Lukas Finnveden 在 AI Alignment Forum 发文认为,向潜在推理架构的转变很可能削弱思维链(CoT)的可监控性,使 AI 监督更加困难。文章把 CoT 当前的价值分为两类:必要性,即模型不把计划说出来就无法完成目标;倾向性,即模型即使没必要也倾向于把推理写进 CoT。作者认为必要性论证更稳健,因为 CoT 是模型突破单次前向传播串行步数限制的唯一途径,且 RL 不会很快探索出高度非人类的 CoT 用法。潜在推理架构会缩小甚至消除有 CoT 与无 CoT 能力之间的差距:COCONUT 完全用连续潜在思维替代文本 CoT,full-bandwidth transformer 在 CoT 之外并行增加潜在通道,looped transformer 则在文本瓶颈之间大幅增加串行深度。
- 会议论文ACL 2026
用特征叠加几何理解涌现式错位
用 SAE 发现诱发错位的数据特征与有害特征在几何上更近,据此过滤最接近有毒特征的训练样本,使错位降低 34.5%。
- 会议论文ACL 2026
大语言模型欺骗行为的隐藏状态轨迹特征
通过隐藏状态轨迹的几何特征检测欺骗,发现谄媚信号最明显、指令性欺骗信号接近于零,七项特征即可支持轻量检测。
- 会议论文ACL 2026
让机制可解释性可审计:呼吁通过持续协作评审制定指南
立场论文,指出机制可解释性缺乏标准化审计体系,呼吁建立持续协作评审平台与专家验证指南,以支持其在 AI 安全中的应用。
- 会议论文ACL 2026
约束参数区域能否保障大语言模型安全?
跨四类模型评估四种安全参数区域识别方法,发现区域重叠度较低且受数据集影响,现有方法难以定位稳定的安全区域。
- 会议论文ACL 2026
LLM 的心理 steering:有效性与可信度评估
提出 PsySET 基准,评测提示、微调与表征工程对情绪和人格的 steering 效果,并发现 steering 会带来安全、隐私等意外副作用。
- 会议论文ACL 2026
CRISP:基于稀疏自编码器的持久概念遗忘
用 SAE 特征抑制实现参数层面的持久遗忘,在 WMDP 有害知识遗忘任务上优于已有方法,同时保留通用能力。
- 会议论文ACL 2026
FineSteer:面向大模型的统一细粒度推理时 steering 框架
把推理时 steering 拆成条件触发与细粒度向量合成两阶段,在安全与真实性基准上优于现有方法,如 Llama-3 的 TruthfulQA 提升 7.6%,同时尽量保持通用能力。
- 会议论文ACL 2026
离策略训练数据对探针泛化的影响
评估八类行为的探针泛化,发现战略欺骗等意图类行为最易失效,并提出利用受激励数据测试泛化的方法,提示现有欺骗探针可能难以胜任真实监控。
- 会议论文ACL 2026
虚假的安全感:基于探针的恶意输入检测为何难以泛化
通过受控实验发现,恶意输入检测探针主要学习指令模式和触发词而非语义有害性,解释其分布外泛化不足并提出评估改进方向。
- 会议论文ACL 2026
识别与干预大语言模型的安全关键参数
提出ESI定位安全关键参数,揭示稠密与MoE模型的分布差异,并通过定向更新或保护这些参数增强安全、抑制微调后的安全退化。
- 会议论文ACL 2026
选择性激活引导:通过判别式层选择实现保范数控制
提出保范数旋转与判别式层选择方法,在九个模型上提高相较既有方法的攻击成功率,同时保持约100%的基准能力。
- 会议论文ACL 2026
分析激活引导向量的安全隐患
系统审计发现,激活引导可显著提高或降低越狱成功率,机制分析将其归因于引导向量与拒答行为潜在子空间的重叠。
- 会议论文ACL 2026
CausalDetox:通过因果注意力头选择与干预降低语言模型毒性
定位导致有毒生成的关键注意力头,通过动态激活引导或定向微调降低毒性,在保持语言流畅性的同时将注意力头选择加速七倍。
- 会议论文ACL 2026
Safe-SAIL:用稀疏自编码器刻画模型细粒度安全特征
提出安全领域稀疏自编码器解释框架,将解释成本降低55%,并提供涵盖四个领域的1758个安全相关特征。
- 会议论文ICLR 2026
AlphaSteer:基于零空间约束学习拒答激活干预
提出AlphaSteer激活干预方法,通过零空间约束保持良性提示性能并引入拒答方向,有效防御越狱攻击且不损害通用能力。
- 会议论文ICLR 2026
当思考适得其反:推理诱导对齐失效的机制性洞察
揭示推理能力增强引发对齐失效的现象,并通过注意力头与安全神经元激活缠结提供了神经元级的机制解释。
- 会议论文ICLR 2026
基于分布匹配与分布式交换干预的双向模型调控
提出Concept DAS方法,通过弱监督分布匹配与分布式交换干预实现双向概念调控,能有效干预安全拒答行为并消除思维链后门。