SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
分析激活引导去偏方向,发现其编码的是置信度而非公平性
揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预
论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
用 J-lens 检测屈从多数的智能体是否仍表征原前提
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用消融与转向干预审计稀疏自编码器特征的因果有效性
用探针与激活导向分析语言模型的评测意识表征及言语化
提出因果可解释性仪器校准规程,识别决策位点测量失效
提出 Persistent SAE,为语言模型特征学习特定时间尺度
占位。
提出 FEGA 框架,分析 SAE 特征消融后的 logit 效应几何
Feature-Effect Geometry Analysis(FEGA) 把 SAE 特征的下游干预效应当成 logit 空间中的云来分类,用来区分可复用方向、低维结构和弥散效应。
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
Sengupta 等人提出 MCIR-M,用邻域条件互信息的归一化比值度量特征的独特预测信息。合成近重复下优势最清晰,真实数据上与 SHAP、SAGE 等比较好坏不一。
完整解读作者用音高移调对齐多视角 SAE,在 MuQ 与 MusicFM 上恢复和弦、调性与旋律轨道。MuQ 的下属环可做调检测。
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
作者比较同等规模电路的 faithfulness 与固定行为准则,发现 KL 会错排候选,部分恢复完整上下文可修复多数持续性错排。
作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。
作者将 NLMCD 迁到 LLM 残差流,用 CBA 比较非线性概念流形,发现层块结构、训练依赖的英中共享,以及 Tulu-3 中 SFT 偏移最大。
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
DiDAE 在冻结视觉基础模型上做无梯度、按字典分量的反事实编辑。
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。