分析与理论arXiv 2610.07798
研究:财务信息披露越少,Llama-3.1-8B-Instruct 的理财建议越受身份影响
测量财务事实变少时身份对股权配置建议的替代
- arXiv
- 2610.07798
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Llama-3.1-8B-Instruct、Qwen2.5-1.5B-Instruct
- 风险偏见与歧视
摘要身份摆幅随披露减少上升。
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
测量财务事实变少时身份对股权配置建议的替代
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
提出 CBM,用模型路由与多模型协作缓解群体偏见
CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。
用 CDPG 与 BTM 追踪思考如何改变反事实公平翻转
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为
论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。
构建 AdaCultureSafe 配对评测文化知识与文化安全
AdaCultureSafe 把同一条地区文化做成“是否知道”和“是否尊重”两套查询,用来看安全有没有用上知识,并用偏好训练把回答往“尊重且用上知识”拉。
评测多语言下模型的道德回答与安全拒答一致性