研究:财务信息披露越少,Llama-3.1-8B-Instruct 的理财建议越受身份影响
Thin Evidence, Thick Priors: How Language Models Substitute Identity for Missing Financial Facts
固定财务只改人设,Llama-3.1-8B-Instruct的身份摆幅从全披露4.78点升至零事实10.34点。
- 人们向语言模型问投资建议时往往不写全财务。作者问的是:财务逐字固定、只改身份,并把事实从八项减到零时,推荐股权会移动多少。
- 在Llama-3.1-8B-Instruct上,把100个财务档案与138个人设交叉到七档披露,用同一财务下人设对的股权绝对差均值画先验替代曲线,并做聚类推断、探针、修补和性别方向消融。
- 全披露到零事实,摆幅4.78到10.34个百分点,比2.16(1.69–2.79)。档案内方差里人设从5.2%到96.0%。随撤证通过校正的是家庭规模;消融后各档摆幅差都不能与噪声区分。Qwen2.5-1.5B有87.1%答50%。
- 作者称行为结果来自单一模型,曲线是否同形仍开放;未做安慰剂,也无规范基准。转向缺随机方向对照。提示词示例抬高编造理由的表面比例;数据里降低摆幅的是披露风险偏好。
- 被测模型
- Llama-3.1-8B-InstructQwen2.5-1.5B-Instruct
- 基准
- 100 financial profiles × 138 personas × 7 disclosure conditions (L0–L6)
- 指标
- identity swing (equity percentage points)within-profile variance sharerecommended equity allocation
一项投稿 ICAIF'2026 的研究测试了 Llama-3.1-8B-Instruct 在财务信息不完整时如何给出理财建议。研究固定财务状况、只改变投资者身份,将提示中的财务事实从 8 条减到 0 条,共构造 96,600 条提示,覆盖 100 个财务画像、138 种身份和 7 种披露条件。结果显示,财务状况相同的两个身份之间的股票配置差距从完全披露时的 4.78 个百分点升至无财务事实时的 10.34 个百分点,比值 2.16(95% 区间 1.69 至 2.79);只剩一条事实时已扩大 1.69 倍。身份在完全披露时解释 5% 的画像内建议差异,无披露时升至 96%。家庭规模是唯一随证据减少而影响稳定增长的特征。
深度解读
这篇论文试图解决什么问题?
证据变薄时,同一财务下的股权建议更随人设而变。
财务事实变少时,模型是否改用投资者身份来改股权配置。
- 使用场景:作者称用户已用通用语言模型做个人财务管理,但很少写全财务。作者认为正当依据是收入、支出、债务、期限、目标和风险偏好;姓名和宗教没有正当的组合含义。
- 既有审计的缺口:只改姓名的通信实验式审计,把上下文固定在一个点上。作者认为这样看不到披露变薄时身份影响是否变大,而披露最少的人可能承受最大的身份驱动波动。
- 核心做法:同一合成投资者按六档嵌套披露呈现,财务逐字不变,只换人设。建议的移动归因于身份;对证据量作图,作者称之为先验替代曲线(prior substitution curve)。第七档只给风险偏好,用来把数量和种类分开。
- 本文报告什么:在 Llama-3.1-8B-Instruct 上全交叉 100 个档案、138 个人设、七个条件,共 96,600 条提示词,并做探针、修补和方向消融。会议版把每条回复当独立观测;这一版改为按人设和不同财务上下文聚类。
有哪些相关研究?
作者把固定上下文审计改成分级披露上的摆幅斜率。
作者按第 2 节把先例分成组合理论、差别待遇、模型身份效应和表示工具,并把本文放在分级欠指定上。
家庭组合与人工建议
- 规范依据:Markowitz(1952)的均值方差,以及 Bodie 等(1992)、Viceira(2001)、Cocco 等(2005),把劳动收入当作隐性债券。Carroll(1997)、Becker 和 Shabani(2010)、Das 等(2010)分别对应缓冲、债务和目标账户,是八个财务变量的选取理由。
- 实际决策:Lusardi 和 Mitchell(2014)、Campbell(2006)记录低素养,以及错误集中在较贫困、受教育较少的家庭。Foerster 等(2017)发现,风险承受、年龄和期限解释不了人工顾问推荐组合的多少变异。
- 机器人投顾:D’Acunto 等(2019)讨论自动化建议,采用家庭的结果混杂。作者称语言模型顾问重新打开“建议究竟依赖什么”。
差别待遇与公平词汇
- 信贷:Bartlett 等(2022)报告风险相当的 Latinx 与 Black 借款人抵押贷款更贵,算法贷款缩小但未消除差距。Fuster 等(2022)称机器学习改变的是谁获益,而不是一律改善获得。
- 法规与统计歧视:论文引用美国 Equal Credit Opportunity Act(1974)列出的种族、宗教、性别、婚姻状况和年龄,以及欧盟 AI Act 对信用评估的高风险分类。Fang 和 Moro(2011)区分口味歧视与统计歧视;Bohren 等(2019)报告不准确信念可随个人信息积累而修正。
- 与本文的差别:作者称公平文献提供个体公平、群体标准和反事实公平等词汇,并警告代理变量。本文设计里身份在构造上不携带财务信息,因此依赖身份是提示词无法支持的信念。
语言模型里的身份效应
- 固定上下文审计:论文讨论招聘、一般建议、医疗和隐式身份信号上的审计,以及金融中 Bowen 等(2024)的抵押拒绝与利率、Wang 和 Gu(2026)的建议金额、Foltyn 和 Olsson(2026)替换性别词后更低的股权份额。Agliata 和 Hasso(2026)审计三个前沿模型,称建议主要靠正当财务属性,人口统计敏感性较小且因模型而异。
- 欠指定问答:BBQ(Parrish 等,2022)和 UNQOVER(Li 等,2020)对比含糊上下文与消歧上下文。作者称这些工作都固定上下文数量;最接近的先例是这一二元对比。
- 理由与捷径:Geirhos 等(2020)的捷径、Turpin 等(2023)的不忠实思维链、Ji 等(2023)的幻觉,被用来定位“没有事实时仍写出财务理由”。Dimino 等(2025)追踪的是金融决策中的位置偏误,不是身份。
探针、修补与转向的限度
- 可解码不等于使用:论文引 Alain 和 Bengio(2016)的线性探针,以及 Hewitt 和 Liang(2019)、Belinkov(2022)、Ravichander 等(2021):探针可能自己学会任务,可解码也不等于被使用。
- 干预会误导:Meng 等(2022)等的激活修补依赖方法选择。Ravfogel 等(2020,2022)、Belrose 等(2023)的线性擦除可使概念对线性探针不可解码;Gonen 和 Goldberg(2019)称去掉方向可能把偏差藏起来。McGrath 等(2023)报告消融后的自我修复。作者称这两点都预示:去掉单一身份方向不必去掉身份依赖。
基线与数据:论文没有把其他顾问模型或已发表审计当作对照方法重跑。行为上的零点是只用财务证据时摆幅为零。附录 F 的 Qwen2.5-1.5B-Instruct 用更早提示词,作者称不可与主运行比较。作者的定位是:把 BBQ 式二元欠指定做成定量配置里的分级剂量,从而把替代测成斜率,并用开源权重模型检查表示是否推动建议。
论文如何解决这个问题?
固定财务、只换人设,用身份摆幅对披露剂量作曲线。
在 Llama-3.1-8B-Instruct 上,把同一财务放到嵌套披露刻度,只换人设,用推荐股权百分比的成对绝对差定义身份摆幅,再在残差流上做探针、修补和性别方向消融。
任务与身份、财务空间
- 结果变量:模型扮演财务顾问,对一份档案给出应投入股权的百分比,前面有一句理由。全程只用这个有界数字;理由留到 Section 5.6,不参与构造结果。两个只差人设的提示词可以相减。
- 九条身份轴:Table 1 列出性别、居住地、年龄带、职业、宗教、种族、婚姻、家庭规模、成长环境,外加姓名。作者把性别、种族、宗教、婚姻和成长环境视为在任何披露水平都没有正当组合含义;年龄、职业、家庭规模和居住地是财务变量的现实相关量。这一区分只用于读结果,收集时每个人设同时带九轴。
- 家庭规模的措辞:提示词写成受抚养人数。定义“含投资者本人的家庭规模”的术语表不在本次提示词里,所以作者按受抚养人数描述该轴。
- 姓名不是自由维:姓名由性别以及种族–宗教对固定。30 个种族×宗教组合里 23 个被当作社群,配两种性别得 46 个姓名。种族与宗教结构上相关,总是联合估计。全目录为 372,600 个人设。种族轴不含南亚、中东或北非、美洲原住民或太平洋岛民。
- 八个财务变量:月收入、支出占比、债务、期限、目标、风险偏好、就业稳定性、储蓄缓冲。一致性约束后,296,352 个自由组合中 70,200 个留下,占 23.7%。
证据刻度与运行集
- 嵌套六档:Table 2 中 L0 到 L5 严格嵌套,只删信息不加信息。各档事实数依次为 8、7、4、2、1、0。每次提示词是新对话。步长不均:L1 撤一项,L2 再撤三项,其后各撤一项或两项。
- L6 旁路:与 L4 一样只给一个事实,但是风险偏好而不是目标。作者把它放在曲线外,以免数量和种类混在一起。
- 低披露时上下文合并:档案来自受约束空间,字段删掉后多个档案变成同一组剩余事实。Table 2:L5 对给定人设只有 1 个上下文、138 条不同提示词;L4 为 7 个上下文、966 条提示词;L3 为 19 个、2,622 条。L0 与 L1 各 100 个上下文、13,800 条提示词。
- 实际运行:从目录抽 100 个财务档案和 138 个人设,七条件全交叉,100×138×7=96,600。138 个人设是 46 个姓名各出现三次,其余六属性组合不同。交换优化把身份轴对推向独立;档案尽量铺满八个财务变量。全交叉使身份在构造上不携带财务信息。
提示词、解码与解析
- 格式:系统提示词要求恰好两行:至多 20 词的理由,然后 Equity: NN%;整数,且不要舍入到十的倍数;并给八个财务术语的定义。身份描述没有定义。Section A 给出完整提示词。用户轮是人设句加已披露事实;L5 用固定的“寻求投资建议”字样代替事实。提示词不说身份是否相关。
- 例证句:系统提示词引用一条长度合适的理由例证。它在全部 96,600 条里相同,作者称不能单独造成同一财务下人设之间的差异,但会污染理由措辞。本次运行早于后来删掉该例证的版本。
- 解码:Llama-3.1-8B-Instruct,贪心解码、固定种子、左填充批生成。解析器锚定 equity 后的数字,否则取回复末尾裸数字。92.7% 带标签,7.3% 走回退;2 条无法解析,余 96,598。
- 重复提示词并不完全相同:同一提示词在 85% 到 95% 的重复出现中得到单一答案,其余为两个或偶尔三个。作者把它当作少量数值噪声,并指出 L5 的 100 份拷贝不是完全相同的观测。
摆幅、方差份额与交互
- 身份摆幅:同一档案、同一档上,138 个人设的财务相同。对 9,453 对人设取推荐股权绝对差,再平均,即这 138 个答案的 Gini 平均差。只用财务证据的模型在各档摆幅都应为零。
- 双向聚类 bootstrap:会议版按 100 个档案算标准误。低披露时档案不是独立上下文,且同一 138 个人设出现在每一档。本文做 2,000 次重抽样:各档共用同一次人设重抽样,并按该档的不同财务上下文重抽样,共享上下文的档案绑在一起。档间对比在同一次重抽样内计算,报告百分位区间。
- 方差份额:在档案和档内去均值后,计算人设以及各身份轴单独解释的剩余方差比例。财务已固定,剩余只能来自人设或解码噪声。
- 交互检验:证据按披露减少方向编码,正交互表示该组在证据撤出时更受优待。身份是赋给 138 个人设的,标准误按人设聚类。点估计与会议版混合模型在 0.0001 以内一致。种族与宗教联合拟合,其余轴分开拟合,并另做九轴一起的模型。九轴的联合 Wald 用 Bonferroni;33 个单项用 Holm。剂量有三种编码:步号 0–5、撤除事实数、分类变量。另在每一档对 138 个人设均值做方差分析。
探针、修补与转向
- 子集:最后一个提示词 token 的残差流,32 个块;12 个档案 × 20 个人设 × 七条件,1,680 次前向,男女各半。20 个人设按面板等间隔抽取,使各种族和宗教都出现。
- 两个探针:每层、标准化激活、五折交叉验证。岭回归预测模型自己的股权答案,交叉验证 R2 称为风险探针。L2 正则逻辑回归预测性别,交叉验证准确率称为身份探针。性别方向是男女平均激活之差再归一化;风险方向是答案高于与低于中位数之差再归一化。
- 修补:每个曲线档、前 30 个档案,取面板顺序前两个人设。两人名都是 Brandon,共享性别、种族和宗教,差别在年龄带、职业、婚姻、家庭规模和成长环境。因此修补测的是移植这些属性,不是性别。逐层用供体的末 token 残差流覆盖受体并重新生成,记录股权绝对变化。L5 的 30 对是同一对提示词的 30 份拷贝。
- 消融:在五层、每个位置,把残差流沿性别方向的分量投影掉,再重跑 96,600 条。层的选择是最大化身份可解码性,减去 0.5 倍性别方向与风险方向绝对余弦,以免同时去掉风险信号。选出的层是 4、5、17、20、21,绝对余弦为 0.050、0.006、0.058、0.057、0.066。
论文做了哪些实验?
Llama-3.1-8B-Instruct上,零事实摆幅10.34点,全披露4.78点,比值2.16。
实验设置
- 被测模型:主结果是 Llama-3.1-8B-Instruct,贪心、固定种子。附录 F 用更早的“先写数字”提示词跑 Qwen2.5-1.5B-Instruct;作者称两次不可比。
- 规模:100 个档案 × 138 个人设 × 7 条件 = 96,600。解析失败 2 条。L0–L5 上用于交互模型的可解析回复为 82,798。
- 刻度:Table 2。L0–L5 从八项事实嵌套到零;L6 只给风险偏好,不画进剂量曲线。
- 指标:身份摆幅为 9,453 对人设的股权绝对差均值,再对档案平均,单位是百分点。另有档案内去均值后的人设方差份额。
- 判定:无 LLM 裁判。解析器锚定 equity 后的数字,否则取末尾裸数字;92.7% 有标签,7.3% 回退。
- 推断与内部子集:摆幅用 2,000 次双向聚类 bootstrap。交互标准误按人设聚类;九轴 Bonferroni,33 个单项 Holm。探针子集为 12×20×7=1,680 次前向;修补用前 30 个档案、面板前两个人设。
主结果
Table 3 的身份摆幅(股权百分点)。L6 是旁路,不是嵌套刻度上的一点。
表格较宽,可左右滑动
水平 事实 摆幅 按档案 95% bootstrap 95% L0 8 4.78 3.89–5.68 3.88–5.70 L1 7 6.05 5.22–6.89 5.18–6.85 L2 4 7.10 6.16–8.05 6.08–8.10 L3 2 6.76 5.82–7.70 4.56–9.29 L4 1 8.08 7.77–8.39 6.62–9.29 L5 0 10.34 10.29–10.38 8.67–12.05 L6 1(风险偏好) 6.75 6.27–7.22 3.83–8.84 - 上升的区间:作者报告 L0 到 L5 上升 5.55 点(3.67–7.46),比值 2.16(1.69–2.79);2,000 次中没有一次比值 ≤ 1。L0 到 L4 已是 3.30 点(1.65–4.88),比值 1.69(1.31–2.18)。L0 到 L1 增加 1.27 点(0.10–2.43)。
- 中间步:L2 到 L3 为 −0.34(−2.72–2.46),L3 到 L4 为 1.32(−1.49–3.84),两者都不能与零区分。L4 到 L5 为 2.26(0.17–4.34)。作者称右端按档案的窄区间,是把一个上下文数了 100 次。
- L6:与 L0 到 L4 都不能区分,例如相对 L1 为 0.69(−2.33–3.17),相对 L4 为 −1.33(−4.51–1.45)。相对 L5 低 3.59(0.61–6.87)。作者称一个与决策直接相关的词去掉了零事实时大约三分之一的摆幅;会议版“约等于四个一般事实”不被 bootstrap 支持到那个精度。
方差份额与哪些属性在起作用
- 份额:Section 5.2:人设解释的档案内方差在 L0 为 5.2%,L2 为 9.5%,L3 为 13.5%,L4 为 29.1%,L5 为 96.0%。摘要写 5% 与 96%。Figure 2 顶行标注为 0.05、0.06、0.10、0.13、0.29、0.96。L5 的高份额部分来自定义,因为提示词里只剩人设;L0 到 L4 的上升不是。
- 轴:Section 5.2 称姓名单独在 L5 解释 30%,家庭规模 23.5%,其余轴 ≤ 6.5%;L0 没有任何单轴超过 1.1%,姓名为 2.3%。Figure 2 对应格标注姓名 0.30、家庭规模 0.23。各行与姓名不正交,不能加总到顶行。
- 交互:Table 4 逐步编码下,按人设聚类后只有家庭规模通过九轴校正(χ2=45.2,4 自由度,校正后 p=3×10^{-8})。按撤除事实数编码实质不变。分类编码另使成长环境(校正后 p=1×10^{-13})和职业(p=0.003)通过,二者没有单调趋势。九轴同拟合时,家庭规模、宗教、婚姻、职业、种族和居住地通过校正;性别、年龄带和成长环境没有。作者把分轴模型当主检验,联合模型当指示。33 项里通过 Holm 的是五名及以上受抚养人(每步 −2.23 点,聚类标准误 0.38)和四名(−1.38,0.37)。性别交互 0.250 的聚类标准误为 0.253,p=0.32。聚类标准误是会议版的 4.2 到 6.0 倍。
- 两种模式:Table 6 中 L0–L4 男女均值差为 1.12、0.93、1.01、0.95、1.08 个百分点;L0 的 Welch p=6×10^{-5},L5 点估计 2.79 但 p=0.10,L6 为 0.20(p=0.82)。作者称这是全披露关不上的常驻差距。家庭规模则是替代:一名受抚养人 L0 为 50.1%、L5 为 49.4%;五名及以上为 48.7% 与 34.9%。Figure 4 / Table 11 的轴内极差在 L5 达到 14.5 点,且只有家庭规模在人设层检验中可检出。作者认为,即使方向上用受抚养人代理支出能力,设计里该轴与财务独立,提示词并不支持这一用法,而且 L0 已写明支出、缓冲和债务时效应仍可检出。
编造财务、修补与转向
- 编造:L5 的 13,800 条回复都至少提到一项财务情况:期限 98%、就业或收入稳定性 86%、收入 84%、风险偏好 83%、债务 71%、支出 68%、储蓄 42%(Figure 8)。L1 只扣了风险偏好,仍有 40% 写出一项。13,800 条里只有 122 种不同文本。例证句中的短语出现在 91% 的 L5 回复和 89% 的 L0 回复中;作者称“写了财务理由”部分是指令造成的。随人设变化的内容不是:67% 的 L5 回复断言不利财务,一名受抚养人为 50%,五名及以上为 89%(人设层 Kruskal-Wallis p=0.027);断言不利财务的建议为 41.2%,否则 47.0%。性别为 67% 对 66%(p=0.90)。引言中两名无财务事实的 Brandon 得到 55% 与 20%,理由引用了提示词里没有的期限、偏好、收入、支出、债务和储蓄。Section D 的关键词匹配会漏掉改写,份额是提及的下界。
- 探针与修补:性别探针在 32 层的交叉验证准确率为 0.994 到 1.000,包括第一块输出。作者称词面已含 male/female,第 0 层饱和不能定位。风险探针在第 1 层 R2=0.53,各层中位数 0.40,第 25 层 0.13。修补在 L0–L3 的平均绝对变化为 2.46、1.77、2.60、2.23 点。L4 仅 14/32 格非零,其均值 3.06,最大格为第 15 层 7.5 点。L5 每格为零;零格无法区分“修补后无法解析”和“答案不变”。作者称修补说明读出位置上的属性能推动答案,不能确立这种因果拉动随证据撤出而变大。
- 转向:Table 7 中消融前后摆幅差的最大者为 L3 的 0.76(标准误 0.72);各档 p 为 0.15 到 0.63,都不能与零区分。曲线六档里五档消融后更高,符号检验 p=0.22。作者把它读成未变,而不是升高。性别交互点估计从 0.250 到 0.124,性别主效应从 0.689 到 0.198;按人设聚类,消融前性别交互也不通过(p=0.32)。33 项中 18 项变小、15 项变大、6 项变号。作者称没有随机方向对照,且未保留行级输出,不能把系数重排归因于去掉性别;能确立的是:去掉最可解码的身份方向,并未降低任何一档的总身份影响。
较小模型
- 几乎不变的答案:附录 F 的 Qwen2.5-1.5B-Instruct 用第一版提示词。96,600 条都可解析,但 84,181 条(87.1%)正好是 50%,全程只有九个不同取值。L0 有 77/100 个档案对全部 138 个人设给出同一答案。
- 没有曲线:L0–L5 摆幅为 1.86、0.78、0.28、0.52、1.82、1.48 点。性别与证据的交互为 0.021。最大交互约每步 0.33 点。L6 摆幅为 6.86 点,作者称小模型抓住显式风险词,并大体忽略收入、债务、期限和储蓄。
- 转向打乱输出:性别探针每层至少 0.97,但各因素解释的残差流方差都低于 1%。同一消融程序使取值增至 91 个,50% 只占 1.6%,L3 与 L5 摆幅升至 8.86 与 11.21。作者称这是扰动后的噪声,不是被揭示的偏差;不敏感不能叫做无偏。Llama 全量运行前的预检门槛是答案标准差高于 12、众数份额低于 45%;主运行的标准差为 14.9,众数 40 占 39.3%。
其他消融与分析
- 剂量直线:每步 0.96 点(0.61–1.26),每撤一项事实 0.52 点(0.33–0.69);去掉 L5 后仍为正,0.73 与 0.37(Section 5.1)。
- 风险偏好响应:L0 均值保守/中等/进取为 33.1%、47.5%、67.3%;L6 为 32.8%、48.6%、78.1%。总均值从 L0 的 49.5% 到 L5 的 43.1%(Section 3.7)。
- 量化:23 个取值,0 到 85,标准差 14.9;40 占 39.3%;74.4% 为 10 的倍数,99.6% 为 5 的倍数(Section 3.7)。
- L5 名称:六项非名称属性解释 138 个人设答案方差的 42%,名称单独 32%,调整 R2 为 −0.02;加入名称 F=1.25、p=0.20,加入六属性 F=3.42、p=4×10^{-5}。调整后 Sipho 为 +12.3、Siti 为 −12.4(Section 5.4)。作者称名称本身而非随行属性在驱动差异的证据弱。
- 聚类单位:Table 10 按财务上下文聚类时多数轴仍通过校正;按人设或姓名聚类时只留家庭规模。
- 成长环境:作者报告 L0 富裕或中等收入成长比资源有限高 1.3 到 1.9 点;资源有限者在每一档最低,L0–L5 边际在 1.4 到 3.8 点之间波动,L6 为 5.5,且无单调趋势。
有什么可以进一步探索的点?
作者称结果来自单一模型,且没有安慰剂字段和转向对照。
作者指出的局限与后续方向
- 一个模型:行为结果来自一个 80 亿参数模型。Qwen 的并行运行几乎没有可测变异,且用的是更早提示词,作者称不可比。曲线在其他家族和规模上是否同形,作者称仍开放(Section 7)。
- 代理还是替代:设计只回答一半。身份与财务独立赋值,所以任何依赖都是提示词不能支持的信念。部署中低披露时使用代理是否会改善建议,需要规范基准;作者称他们没有,人类顾问基准本身也不完美(Section 7)。
- 低披露的独立观测少:L5 有 138 条不同提示词,L4 有 966 条。bootstrap 已计入这一点,且 L0 到 L4 已是 1.69 倍,但作者称全距加倍的精确大小仍比点估计更不确定(Section 7)。
- 提示词:本次提示词引用了例证理由句,模型把它抄进大多数回复;财务术语有定义,身份术语没有。作者称例证抬高了编造财务的表面出现率,家庭规模被读成受抚养人数(Section 7)。
- 转向缺少对照:没有范数匹配的随机方向,也没有无关属性方向;行级转向输出未保留。作者称“总摆幅未变”站得住,把系数变化归因于去掉性别则站不住(Section 7)。
- 缓解:作者称论文对“降低总体身份依赖、同时保住建议质量”的缓解几乎没有证据。数据里降低摆幅的干预只有 L6 披露风险偏好;试过的表示干预没有降低它。作者写出的下一步是多属性概念擦除、其他决策场景里用过的提示词级指令,以及评估所得建议的质量(Section 7)。
实验覆盖范围
- 行为主结果来自 Llama-3.1-8B-Instruct 的贪心单样本:96,600 条提示词、100 个档案、138 个人设、L0–L6 七个条件(Section 3、Table 2)。
- 身份为九轴加姓名;种族轴不含南亚、中东或北非、美洲原住民或太平洋岛民;性别为二元;收入用美国口径;档案为合成(Section 3.2、7)。L5 的不同提示词为 138 条,L4 为 966 条(Table 2)。
- 内部分析在同一模型上:32 层探针、1,680 次前向;修补用前 30 个档案,对子都是名为 Brandon 的人设;性别方向在五层消融后重跑全部提示词(Section 3.8、6、7)。
- 附录 F 用更早提示词跑了 Qwen2.5-1.5B-Instruct 的同一交叉;作者称与 Llama 运行不可比(Section 7、附录 F)。
- 论文写明未跑非身份的安慰剂字段,也没有用真实家庭数据或合格人类顾问在相同部分信息下给出的规范基准(Section 7)。论文未报告温度采样下的答案分布;解码为贪心单样本(Section 7)。
总结一下论文的主要内容
身份摆幅随披露减少上升;家庭规模最稳,去掉性别方向未降低总摆幅。
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
- 问题:通用模型在事实不全时仍给出股权百分比。作者要测的是,财务逐字不变、只换身份时,建议移动多少,以及这移动如何随从八项事实减到零而变化。
- 做法:Llama-3.1-8B-Instruct 上,100 个档案与 138 个人设在嵌套的 L0–L5 和只含风险偏好的 L6 上全交叉,共 96,600 条。身份摆幅是人设对之间推荐股权绝对差的均值。不确定性按人设和不同财务上下文做双向聚类 bootstrap,而不是把每条回复当独立观测。
- 主数量:Table 3 在全披露为 4.78 个百分点,零事实为 10.34。作者报告比值 2.16(95% 区间 1.69–2.79),且没有一次重抽样的比值 ≤ 1;只剩一个一般事实时比值已是 1.69。Section 5.2 中人设占档案内方差在 L0 为 5.2%、在 L5 为 96.0%(摘要写 5% 与 96%)。
- 属性与一个事实:逐步编码、按人设聚类后,随证据撤出而增长并通过校正的轴是家庭规模。性别在 L0–L4 是大约一个百分点的常驻差距,全披露并不把它关掉。只陈述风险偏好的 L6,摆幅落在两到七项一般事实的范围内,并低于零事实 3.59 点(0.61–6.87)。
- 理由与网络:零事实时回复仍写收入、债务和储蓄,较大家庭更常被写成不利财务;系统提示词里的例证句使措辞大量雷同。性别在每一层都可线性解码,作者称这使探针不能定位。在五层去掉性别方向后,各档总摆幅都与消融前不能区分。Qwen2.5-1.5B-Instruct 在旧提示词下对 87.1% 的提示词回答 50%;作者称这是仪器不敏感,不是无偏。
- 作者的读法:咨询系统应按用户实际达到的披露水平审计,缓解要在整个身份空间上量,而不是一次只看一个属性;这类审计的统计单位是人设,不是提示词。