研究:LLM 潜在空间去偏方向主要编码置信度而非公平性
分析激活引导去偏方向,发现其编码的是置信度而非公平性
完整解读
分析激活引导去偏方向,发现其编码的是置信度而非公平性
揭示风险自述与实际行为由近正交表征分别控制
这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。
用探针与激活导向分析语言模型的评测意识表征及言语化
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
分析隐蔽推理在思维链中的信息足迹与不可读性