研究:后训练配方决定大模型是否违背自身道德判断行事
提出知行差距面板,测量压力下模型是否违背自身判断
- arXiv
- 2610.08670
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
- 风险失准与价值偏离
摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
另有 6 篇论文还没打上分类标签,暂不在筛选结果里。
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出 CAP 指标与 CSFD 算法,发现被抑制的安全特征
摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 HEST,用熵训练的双曲探针只在犹豫 token 引导隐状态
HEST 是不更新语言模型权重的推理时转向:模型自己的 next-token 熵既选出少数犹豫 token,也训练给出方向的双曲探针。要处理的情况是,数学解答里多数 token 已由上下文决定,分叉集中在高熵 token,而常见激活加法仍对每个 token 加同一欧氏向量。长推理模型上按关键词和步骤边界转向的做法,又很少适用于 instruction-tuned 模型。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
分析多轮攻击中有害性与拒答表征的几何演化
作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
摘要在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变。
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
提出 JU 与 JI 基准,并用组件分解定位术语知识
作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。
在 LLM 残差流中定位并因果转向机会识别方向
作者把人工创业认知定义为 LLM 内部与创业相关的表征和计算如何组织,并用机会识别做结构理论的检验案例。
提出因果模型定位残差流中的藏拙轴,并用单层 graft 在推理时解锁
作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。
形式化视频透视头显中系统截图与人眼视野的错配