研究者提出模型生物体多目标验证框架并给出训练建议
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
分析激活引导去偏方向,发现其编码的是置信度而非公平性
提出CAP与CSFD,发现越狱通过压制安全特征绕过拒答
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用消融与转向干预审计稀疏自编码器特征的因果有效性
用探针与激活导向分析语言模型的评测意识表征及言语化
提出因果可解释性仪器校准规程,识别决策位点测量失效
分析隐蔽推理在思维链中的信息足迹与不可读性
因果解耦来源依从与用户迎合的内部机制
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
测量系统提示词对模型逐层计算的重构程度
通过对 17 个指令微调模型进行逐层表征相似度与因果干预分析,探索系统提示词在模型内部究竟如何重构计算。