研究:后训练配方决定大模型是否违背自身道德判断行事
提出知行差距面板,测量压力下模型是否违背自身判断
- arXiv
- 2610.08670
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct、Tulu 3 等 7 个
- 风险失准与价值偏离
摘要评估发现后训练配方决定知行差距是否存在,行动前审思可有效缓解。
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
分析 LLM 去偏激活方向,发现其编码置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
测量财务事实变少时身份对股权配置建议的替代
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出 PowerBench,测量模型对权力转移请求的拒答偏见
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正
HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。
提出容忍度公平性审计,用 CEL 认证违规并用 SEL 筛查
这篇工作给出一套按审计目标切换校准的容忍公平审计:差异不必为零,而是看预先指定的不利方向上是否超过允许阈值。
构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
提出 k-ALeBi 偏差探针,主动审计黑盒模型的多组公平性
k-ALeBi 把黑盒多组公平审计写成跨组比较函数的学习,而不是先重构分类器。
提出 FIGS 双轴基准,评测多轮对话中的谄媚与校准性共情
FIGS 是一个固定的多轮评测套件,用来同时看模型会不会在压力下放弃事实,以及会不会在守住事实时忽略用户实际说过的感受。
提出 Rank Graduation Fairness 指标,检验群体间预测误差负担是否可比
用预测误差的排序分布、置换检验和特征移除,评估信贷模型在受保护群体间的公平。。
测量剪枝对语音 LLM 群体转写公平性的影响
摘要剪枝后的 Speech-LLM 不能只看总体 WER:Fair-Speech 上族群差扩大,作者建议看最差组。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提出训练无关的 SECRET,对问题表征做源条件转向以缓解音视频模型幻觉
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
提出 Constitutional adapters,蒸馏宪法行为以缓解越狱与失准
摘要差分宪法适配器在长上下文和多轮上更稳,并可按 α 换取遵从。
用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强
用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。
构建 Mandela-Bench,评测多模态模型是否凭记忆接受篡改图像
该研究系统评估了多模态大语言模型在面对无痕事实性编辑时,能否利用自身内在世界知识核验被识别出的经典图像。
分析消除人口统计信息的不变性约束如何制造新偏见
这篇分析考察的是:为了公平而从潜表示中去掉人口统计信息,是否可取、是否足够。作者认为,表示能解码出群体归属,本身并不解释不公平。任务特征可以与群体相关,患病率不同时,抹平边际分布会迫使错误率在群体间分开。