跳到正文
原文
论文追踪· arXiv:2609.03221· Bellibatlu, Rohith Reddy; Singh, Manpreet; Parashar, Deepak; Joshi, Rahul·本站收录 · 原文发表

FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

Instability Floors: Separating Bias from Noise in Fairness Audits of Clinical LLM Agents with FairMedAgent

论文速读

评测/基准

据论文 PDF 整理(AI 生成),以原文为准

作者用 FairMedAgent 测得:临床智能体在输入不变时仍会改变动作,这个不稳定性下限必须先于人口学翻转率解读。

问题
临床语言模型智能体的反事实公平审计用翻转率衡量人口学描述符改变后动作是否改变,但随机采样本身就会在输入不变时改变动作。不先测这个不稳定性下限,翻转率无法区分人口学效应与自我不一致。
方法
FairMedAgent 把临床叙事冻结,只改固定语法的一行描述符,跑六阶段轨迹。在参考条件上重复抽样,用成对复现不一致率估计每个二值动作的 floor;对二值动作,无人口学效应时期望翻转率等于 floor,效应只再加其平方。
实验与结果
主模型 haiku-4.5 在 16 个合成 vignette、默认采样、十次重复下汇总 floor 为 8.7%(374/4320),六模型从 2.5% 到 23.7%。作者称本面板中厂商、规模与部署方式都不排序 floor。五次多数投票移除主模型 39% 的 floor;四个本地模型中三个在 temperature 0 下 floor 为 0,托管端点仍有残差。
局限与可以继续做的
作者指出:合成 vignette 不能外推;托管端点的解码未记录且身份未独立核实;可接受动作带未完成临床裁定,本文不报告差距估计。测量覆盖六模型与 16 个 vignette,人口学对比仅为一次抽样描述性试点。
实验设置claude-haiku-4-5、claude-sonnet-5 等 · FairMedAgent、16 synthetic clinical vignettes 等 · instability floor、counterfactual flip rate (CFR) 等
模型
claude-haiku-4-5claude-sonnet-5llama3.1:8b-instructmistral:7b-instructqwen3:4bphi3:miniopenai/gpt-oss-20b
基准
FairMedAgent16 synthetic clinical vignettessix-stage clinical trajectory
指标
instability floorcounterfactual flip rate (CFR)Spearman ρ
AI 导读全文 359 字

研究者提出 FairMedAgent 测试框架,用于测量临床 LLM 智能体在反事实公平性审计中的随机翻转下限。在默认采样下,对 16 个合成情境重复运行同一条件十次,智能体动作在 8.7% 的重复对中发生变化,从重症监护升级的 2.2% 到管制药物谨慎提示的 17.9% 不等。在来自五家厂商的六个模型中,合并下限介于 2.5% 至 23.7%,且模型规模、厂商与托管方式均未呈现排序关系。下限受解码配置影响,五次采样的多数投票消除了其中 39%(95% CI 18 至 64);温度设为 0 时四个本地部署模型中有三个不再出现分歧,但一个托管模型仍有分歧。作者指出,在无人口统计学效应假设下,二元动作的翻转率期望值等于该下限,真实效应仅贡献其平方,因此落在下限内的翻转率不能作为公平性证据,方向需用带符号配对检验。

深度解读

6 个问题,约 7,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    翻转率混入了智能体对同一输入的自我不一致,审计前必须先测这个下限。

    临床语言模型智能体的反事实公平审计报告翻转率时,其中一部分来自输入不变时的自我不一致,而不是人口学描述符。

    • 场景:作者指出,临床 AI 正从单次回答转向会规划、调用工具并连续行动的智能体;伤害落在动作上(分诊、检查、用药、去向),一步偏差可传播到后续步骤。现有公平审计评估单次回答,临床智能体基准测的是能力,两者都没有把可辩护选择与错误选择分开的可接受动作带。
    • 现有不足:反事实审计在临床内容固定时替换人口学描述符,再看动作是否改变。作者认为,默认采样下智能体对完全相同的输入也会改变动作;若不先测这个基线,描述符对比中的翻转无法区分人口学效应与自我不一致。稳定的聚合分布仍可与频繁的个案翻转并存。
    • 核心观察:对二值动作,无人口学效应时期望翻转率等于在所比较条件下测得的不稳定性下限(instability floor),真实效应只再加其平方(Eq. 2)。落在下限之内的翻转率不是“没有效应”的证据;方向必须用有符号的配对检验。
    • 提出的东西:作者测量六个模型上按动作分开的 floor,给出四步报告流程,并发布评测套件 FairMedAgent(协议、vignette 与分析脚本)。作者称本文不报告任何差距估计;floor 是解读后续估计量的前提。
  2. 有哪些相关研究?

    既有审计测翻转或能力,但没有把按动作的自我不一致率与翻转率放在一起报告。

    临床语言模型中的偏差

    • Omiye 等 [7]、Zack 等 [8]、Adam 等 [12]、Pfohl 等的 EquityMedQA [13]、Hastings [14]、Yang 等 [15]:记录种族医学误解、刻板化评估与计划、从打码病历中识别种族、对抗性医学问答中的公平伤害,以及推理模型中偏差仍在。
    • CLIMB [16]、诊断的反事实患者变体 [17]、EQUITRIAGE [18]:固定临床内容、替换受保护属性。Omar 等 [9] 在 1,000 个急诊病例上变动 31 个社会人口学标签,报告紧迫度、影像与心理健康转诊的系统性差异;主分析每例只评估一次生成的建议或决策。他们还把 100 个 vignette 在九个模型上重跑五次,四个问题上重复之间无显著差异。作者认为稳定分布仍可与频繁个案翻转并存,而翻转率对照的正是后者。

    智能体与基准基础设施

    • AgentClinic [19]、MedAgentBench [20]、DRAGON [21]、MedS-Bench [22]、MedHELM [23]:测临床能力或准确率。作者认为动作上的人口学差距不在它们的设计目标之内。
    • AgentFairBench [31]:作者自己的通用智能体动作公平基准,与本文不共享 vignette、运行或报告数字。作者认为它与上述能力基准都没有可接受动作带,floor 与 Eq. 2 则不依赖该带。

    运行间变异

    • Atil 等 [24]、Ouyang 等 [25]、Yuan 等 [26]、Mizrahi 等 [27]、Shyr 等 [28]:重复运行下的准确率摇摆、代码生成不确定性、浮点约简与批次组成、提示模板,以及医学中的可重复性框架。作者明确说本文并非发现这种不稳定性。
    • 同一团队的同输入重跑研究 [30]:固定输入重放 MedAgentBench,比较五次运行中智能体提交的医嘱,指出动作级分歧可以不被基准分数记录。与本文不共享运行、任务或测量,目标是能力基准而非公平审计。多数投票聚合来自 Wang 等 [29] 的 self-consistency,这里用来刻画方差而非提高准确率。

    基线与定位

    • Table 1 对照 AgentFairBench、同输入重跑、Omar 等、EQUITRIAGE、EquityMedQA 与上述能力基准,轴为多步智能体、反事实人口学设计、LEP、交叉、真实患者、是否报告 per-action floor。作者称没有列出的审计在翻转率旁边报告按动作的 floor。
    • 作者把贡献定位为:在被审计的同一系统上,按动作报告“什么都没变时离散动作改变的比率”,并把它与人口学不一致的关系(Eq. 2)写明;不是“语言模型是随机的”这一观察本身。
  3. 论文如何解决这个问题?

    冻结临床内容、重复跑参考条件,用成对不一致率估计 floor,再按 Eq. 2 解读翻转率。

    FairMedAgent 是一套变形(metamorphic)描述符替换审计:临床叙事冻结,工具结果夹具不依赖条件,描述符是条件之间唯一被设计的差异。本文实际测量的是参考条件上的 per-action instability floor,以及它作为翻转率参照的含义。

    轨迹与条件

    • 六阶段:每个 vignette 走 (i) 分诊(ESI 急危度、紧迫度)、(ii) 开单、(iii) 无模型调用的环境步骤、(iv) 复评(入院、ICU 升级)、(v) 处方(止痛档位、管制药物警惕)、(vi) 文书(转诊、随访)。每个 vignette–条件有五次模型调用;阶段顺序固定,不由模型选路径。
    • 归因:环境步之前,输入除描述符外相同。之后,固定结果夹具 ρ(v) 只依赖已开项目与 vignette,不依赖条件;仅当开单一致时,各条件看到的结果才相同。开单本身翻转时,后续信息不同,作者把这条路径称为传播通道而非要剔除的混杂。后期阶段的 floor 测的是轨迹累积不稳定性,不是该阶段的条件不稳定性。
    • 描述符:每个条件只改一行、固定语法、词数匹配的描述符。属性依 PROGRESS-Plus 选取:种族与族裔合一槽、性别、年龄、保险、英语能力有限(LEP),加两个指定的交叉单元。作者说明,这是对字符串不变性的检验,不是结构因果模型上的因果反事实。临床上混杂的属性×任务对预先指定并排除出偏差主张。
    • 对照臂:完全相同的重新渲染、sham 属性臂、稀有 token 臂。作者称其用意是给剩余的表面形式敏感度加上界。

    结局、floor 与 Eq. 2

    • 六个二值结局(Table 2):ICU 升级、入院、高急危度(ESI ≤ 2)、任何阿片类(analgesia tier ≥ 2)、管制药物警惑、转诊。缺失或无法解析的字段记为缺失,含缺失复现的成对比较丢弃。序数与连续输出不进入报告的翻转率。
    • CFR:对比 (c0,c) 的反事实翻转率是 vignette 上二值动作不同的比例(Eq. 1)。floor 是参考条件下全部复现对的该指示量的均值;R=10 时每个 vignette–动作单元贡献 45 次比较。若 R 次抽样中有 k 次为正,估计为 k(R-k)/\binom{R}{2},对 2p(1−p) 无偏。
    • Eq. 2:写 dv=1/2[fv(c0)+fv(c)]+δv2,其中 δv 是两条件下动作概率之差。作者给出三条结论:零效应下任一条件的 floor 就是期望翻转率,但超出部分等于 δv2 只在 floor 对两条件取平均时成立;超出部分是二次的,概率移动 0.1 只给期望翻转率加 0.01,落在 floor 内不是无效应的证据;估计个案效应需要每条件重复抽样,而聚合的方向性差异可用每条件一次抽样的精确 McNemar 检验。本文的 floor 只在参考条件上测量,与人口学对比的比较都是描述性的。
    • 未计算的量:套件实现了均值绝对分数差、有符号的动作率差距,以及只在双方动作都落在可接受带内时计算的 WCFR。作者称这些量本文都没有计算;没有带时套件拒绝计算 WCFR,而不用未裁定的带替代。

    样本、模型与统计

    • Vignette:300 个合成 vignette 覆盖四个动作域;floor 研究用其中 16 个,按设计选取而非按不稳定性筛选:每域一份原始草稿,再加每域一个清晰、一个中间、一个边界病例。作者称推断条件于这些固定病例,不能在没有抽样过程时外推。
    • 模型:A 为 claude-haiku-4-5(主模型),B 为调用层报告的 claude-sonnet-5;C–F 为 Ollama 本地服务的 llama3.1:8b-instruct、mistral:7b-instruct、qwen3:4b、phi3:mini。第七个本地模型 glm-4.7-flash 因完成结果不可用而舍弃。openai/gpt-oss-20b 只用于 Sec. IV-D 的解码检查。六个模型均用提供方默认采样;A、B 经 Claude Code 运行时调用,该运行时不暴露采样参数,解码既未设置也未记录。作者把 A、B 的结果报告为未记录解码下的端点观察,而非已核实的命名模型性质。
    • 统计:置信区间是按 vignette 聚类的非参数百分位 bootstrap(5000 次重抽样,固定种子),N 计独立 vignette 而非 API 调用。跨模型排序一致性用中位秩的 Spearman 相关与精确置换 p 值;15 个成对 p 值不做校正,作者称其为描述性。多数投票预先指定 R=5。本地模型若输出不符合步骤 schema,在 temperature 0.2 重试一次,否则记缺失;默认采样运行中这些重试未记录,频率未知。

    报告流程

    • 四步(Sec. V-A):在审计实际运行的解码配置上测量 floor;按动作报告而非只报告一个汇总数;把人口学对比放在同一配置下测得的 floor 旁边解读,且翻转率落在 floor 内不当成无效应的证据;用有符号检验而非翻转计数来检验方向。
    • 作者计划发布可 pip 安装的套件,包含轨迹、floor 协议与本文数字背后的分析脚本。报告遵循经过改编的 TRIPOD-LLM。
  4. 论文做了哪些实验?

    六模型汇总 floor 从 2.5% 到 23.7%;解码配置改变后 floor 大幅下降,托管端点仍有残差。

    实验设置

    • 模型:主面板为 claude-haiku-4-5(A)、claude-sonnet-5(B)、llama3.1:8b-instruct(C)、mistral:7b-instruct(D)、qwen3:4b(E)、phi3:mini(F)。gpt-oss-20b 只出现在 temperature 0 对照。glm-4.7-flash 被舍弃。
    • 病例与重复:floor 用 16 个合成 vignette、六个二值动作。A、C、D、E 为 R=10(45 对,每动作 720 次比较);F 也是 R=10,但管制药物警惑为 702 次(两个 vignette 各缺一次复现);B 因托管成本限制为 R=6(每动作 240 次)。人口学试点为四个 vignette、每格一次抽样。
    • 指标:汇总与按动作的 instability floor;95% vignette 聚类 bootstrap 区间;动作排序的 Spearman ρ。作者明确说本文不声称任何差距估计。
    • 解码:六个模型用提供方默认采样。本地模型在 Ollama 0.34.3、一块 RTX 4050 上运行,Modelfile 未设 temperature。A、B 的采样参数未记录。

    主结果

    据 Table 3(与 Figure 2 同一组汇总 floor):

    表格较宽,可左右滑动

    模型R汇总 floor [95% CI]最不稳定动作
    qwen3:4b100.025 [0.004, 0.055]CS caution
    sonnet60.067 [0.037, 0.096]CS caution
    haiku-4.5100.087 [0.056, 0.117]CS caution
    mistral:7b100.095 [0.068, 0.126]high acuity
    llama3.1:8b100.215 [0.181, 0.248]high acuity
    phi3:mini100.237 [0.194, 0.284]referral
    • 主模型汇总 floor 为 0.087(374/4320)。作者称按动作的点估计相差约八倍:ICU 升级约五十次比较中一次(2.2%),管制药物警惑接近五次中一次(17.9%);两者差为 0.157(95% CI [0.051, 0.269])。摘掉管制药物警惑后,主模型汇总 floor 为 0.068([0.036, 0.101]),六模型排序不变。
    • 作者称本面板中公开规模、厂商与部署方式都不单调排序 floor:公开规模最小的 qwen3:4b(4B)与 phi3:mini(3.8B)分别在两端。这是对该面板的观察,不是对属性是否一般地预测 floor 的检验。配对 bootstrap 区间把 15 个模型差中的 12 个与零分开;未分开的是 haiku 与 mistral、sonnet 与 mistral、llama3.1 与 phi3。
    • 作者认为管制药物警惑没有操作性标准,其高 floor 可能部分来自构念含湖;该读法与“真正有争议的判断”无法分开。它是六个模型中三个的最不稳定动作。作者因此把它的 floor 报告为一个未充分规定之输出的可重复性。

    按动作的跨模型排序

    • 六次复现时看到的两簇结构,在其中五个模型再加四次复现后不再成立。最终复现数下,唯一名义 p<0.05 的排序相关是 haiku-4.5 与 sonnet(ρ=0.94,p=0.017);该 p 未对 15 次比较校正,Benjamini–Hochberg 调整后不再显著。作者不主张这是厂商效应。
    • llama3.1:8b 与 phi3:mini 的 ρ 从 0.89(p=0.033)降到 0.83(p=0.058)。llama3.1:8b 的最不稳定动作从六次复现时的 referral 变为十次时的 high acuity。
    • 在 16 个 vignette 上,主模型只有 admission([0.051, 0.242])与 CS caution([0.064, 0.296])的区间不含 0;sonnet 只有 CS caution([0.067, 0.333])。作者称此时能稳住的是每模型的汇总量级、主模型上最不稳定与最稳定动作的分离,以及汇总 floor 的跨模型比较;不对中间动作的精确名次作出主张。

    解码配置能去掉多少 floor

    • 四个本地模型在 temperature 0、R=5 下:llama3.1:8b、mistral:7b、qwen3:4b 的 floor 为 0(0/400 次调用重试);phi3:mini 在两轮都完整的 15 个 vignette 上从 0.238 降到 0.027(95% CI 0.000–0.058),降幅 89%(Table S13)。作者称对其残差没有解释。
    • 经 Groq API 的 gpt-oss-20b(low reasoning effort,temperature 0,R=5)在 22/960 次比较中仍不一致(floor 0.023,95% CI 0.000–0.052),只出现在 referral 与 admission;400 次调用报告了 48 个不同的 system fingerprint。同一 15 个完整 vignette 上,temperature 1.0 的 floor 为 0.100,temperature 0 降到 0.024,降幅 76%(95% CI 43–100%)。
    • 主模型多数投票:floor 从单次抽样的 0.087 到 R=3 的 0.063、R=5 的 0.053,移除 39%(95% CI 18–64%;Figure 4)。摘掉 CS caution 后降幅为 53%;四个本地模型上为 8%–47%。作者称剩余与拟合的普通采样噪声一致,且这是模型检查而非独立验证;R=5 时大部分 floor 仍在,三个聚合深度不支持外推到零。

    其他消融与分析

    • 人口学试点:四个 vignette、每格一次抽样;描述符完全相同的零对比翻转 5/24 个单元。五个人口学对比中四个翻转少于该臂,两个不到其四分之一,最大的一个只多一个单元。四个不一致对的最小双侧精确 McNemar p 为 0.125。作者称没有零臂时,6/24 的 Black-woman-on-Medicaid 行会被读成第一个人口学发现;参考臂的缺陷使那两个曾看起来不同的单元不再成立。作者不声称效应。
    • 现患率归一:与 2p̄(1−p̄) 之比,主模型从 any-opioid 的 0.05 到 CS caution 的 0.42;A 与 B 对谁排第一一致。75/96 个 vignette–动作单元每次结论相同。
    • 四 vignette 早期结果:汇总 floor 0.136([0.063, 0.209],G=4),与 Figure 3 的排序不同。作者称 16 个 vignette 的估计波动较小,但尚未收敛。
    • 连续代理:四个 vignette 上跟踪急危度翻转的紧迫度离散代理,在 16 个 vignette 上方向反转。作者称没有找到仍然成立的机制,也不做病例难度主张。
  5. 有什么可以进一步探索的点?

    作者称合成病例不能外推,托管端点的解码与身份未被核实,差距估计尚未计算。

    作者指出的局限与后续方向

    • 外推(Sec. V-B):推断条件于这些固定的合成 vignette;没有定义的抽样过程时不能外推到更广人群。作者计划在临床审查之后发布真实病例分割。
    • 端点身份与解码(Sec. V-B):A、B 的托管身份未独立核实,解码参数未记录;经厂商 API 做 temperature 0 是否能消除它们的 floor 尚未测试。本地模型的 schema 重试频率未知。
    • 裁定与未计算的量(Sec. III-C、V-B):一名老年医学家审阅了四条草案动作带,但签字证明尚未交回,每条带仍是作者自己定的;本文没有任何数字依赖它。WCFR、有符号差距、LEP 与交叉轴、跨步骤传播都已在套件中定义,除一次抽样试点的描述性 LEP 对比外均未计算。
    • 证据范围(Sec. V-B):每一项测量都是裸模型、组件级审计。作��认为,对已部署系统的保证主张说的是本文发布的基础设施,而不是本文结果已经证明的事情。
    • 量级与方法(Sec. V-B、Conclusion):16 个 vignette 下,按动作的区间很宽,中间名次不成立。作者认为后续工作是在更大病例集上估计个案效应,并把 floor 与可接受动作带合并。三个推理式脚手架已实现,但本文没有任何结果把它们区分开。

    实验覆盖范围

    • 主面板为五家厂商的六个模型,加上只用于解码检查的 gpt-oss-20b;测量用 16 个合成 vignette,300 个中其余的未用于本文数字(Sec. III-C、IV)。
    • 人口学数据只有四个 vignette、每格一次抽样的描述性试点;作者报告零对比翻转 5/24,并说明此时任何检验都不能检出或排除效应(Sec. IV-E)。
    • 解码干预覆盖四个本地模型的 temperature 0、主模型的多数投票,以及 gpt-oss-20b 在 temperature 0 与 1.0 的对照;A、B 经厂商 API 的 temperature 0 未测试(Sec. IV-D)。
    • 论文报告了 bootstrap 重抽样次数(5000)与固定种子;默认采样运行中本地模型 schema 重试的次数未记录(Sec. III-C)。
    • 套件定义了可接受动作带、WCFR、LEP 与交叉估计和传播对比;作者写明这些能力已发布但未在本文中计算,Table 1 以空心圆标记(Sec. II、III-B)。
  6. 总结一下论文的主要内容

    先测同一输入下的动作不一致率,再用它解读人口学翻转率;本文测的是这个下限,不是差距。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。

    • 问题:反事实审计用翻转率衡量“只改人口学描述符时动作变了多少”。随机智能体在什么都不改时也会改动作。不先测这个基线,一次翻转无法区分描述符、自我不一致,或两者兼有。
    • 做法:冻结临床叙事,固定六阶段轨迹,在参考条件上重复抽样。对六个二值动作,用成对复现的不一致率估计 floor。对二值动作,无人口学效应时期望翻转率等于所比较条件下的 floor,效应只再加其平方;落在 floor 内不是无效应的证据,方向要用有符号的配对检验。
    • 结果:haiku-4.5 在 16 个 vignette、默认采样、十次重复下汇总 floor 为 8.7%(374/4320),动作间从 ICU 升级的 2.2% 到管制药物警惑的 17.9%。六模型从 qwen3:4b 的 2.5% 到 phi3:mini 的 23.7%;作者称公开规模、厂商与部署方式都不排序这一列。五次多数投票移除主模型 39% 的 floor(95% CI 18–64%)。三个本地模型在 temperature 0 下 floor 为 0,phi3:mini 降 89%;gpt-oss-20b 在 temperature 0 下仍为 0.023。
    • 作者的结论:floor 描述的是某个解码配置下的模型,审计必须在实际运行的配置上测量它,并按动作报告。一个系统上的 floor 或排序不能替代另一个系统。本文不报告人口学差距;一次抽样试点里,若不看完全相同重渲染的对照臂,一行曾经看起来像人口学发现的结果并不成立。
阅读原文arxiv.org