残障披露如何在对话式 AI 中流动:ChatGPT、Claude、Gemini 的记忆、隐私与语境完整性
When Disability Disclosure Travels: Memory, Privacy, and Contextual Integrity in Conversational AI
访谈12名美国残障成人后,作者发现他们按任务需要向对话式AI披露残障,记忆功能既减轻重复说明,也使信息漂移到不该出现的情境。
- 残障用户常需向会记忆的对话式AI说明残障才能获得帮助,但披露对象同时是助手和持有数据的公司,记忆还会把信息带到原本不该出现的情境。
- 对12名每周至少使用两次LLM助手(或已减少使用)的美国残障成人做半结构化访谈,以contextual integrity分析信息类型、接收者与传递原则。
- 参与者多按任务需要披露功能需求而非诊断。同一披露会按“不评判的助手”或“公司”得出相反规范。7人欢迎记忆省去重复,同时出现过度锚定、张冠李戴和跨情境渗漏;9人靠核验或修正来补救。
- 作者称样本小、偏技术熟练、以美国英语访谈为主,且设计探针是访谈者提出的想法而非已实现功能。访谈44–86分钟,记忆与账号情况按参与者自述记录。
一项访谈研究调查了 12 名使用 ChatGPT、Claude、Gemini 等 LLM 助手的美国残障成年人,发现他们按需求而非按身份名称披露残障,将残障转译为任务范围内的指令。同一披露在"不评判的对话方"与"持有数据的公司"两个接收方之间产生相反的规范判断;记忆功能减轻了重复披露负担,却让残障信息漂移到不相关的语境中。参与者希望控制信息的范围、来源、保留与访问权限,而非逐句开关。
深度解读
这篇论文试图解决什么问题?
残障用户如何决定向会记忆的对话式AI披露残障,以及记忆如何改变信息流动的适当性。
残障成人向会跨会话记忆的对话式AI披露残障时,说什么、对谁说、以及记忆让这些信息流向何处。
- 场景与重要性:作者称,对许多残障者,从助手获得有用帮助往往要从说明残障开始,例如屏幕阅读器用法或轮椅可达的地点。几十年的研究把对人披露写成权衡无障碍与污名、并在受众每次变化时重新决定。助手改变了这套计算:它像耐心、不评判的对话者,人们会对机器说不愿对人说的事;所说内容又被公司接收、存储并可能再用,留存与二次使用不透明。ChatGPT、Gemini、Claude的跨会话memory把一次谈话带入以后的谈话,既可免去反复提醒,也会让诊断出现在无关任务或代他人提问时。
- 现有工作的缺口:作者称HCI已记录残障者把生成式AI用作最后手段的屏幕阅读器、写作辅助、视觉解释、辅导甚至倾诉对象,平行工作则记录系统再现健全主义假设,以及记忆与个性化对一般用户的隐私关切。作者称缺少的是:残障者如何推理向会记忆的助手披露残障,说什么、以什么形式、想象在对谁说,以及助手应用、不应用或过度应用这些信息时发生什么。
- 分析镜头:作者采用Nissenbaum的contextual integrity,把隐私看作信息流相对于分享情境规范是否适当。作者认为该框架适合残障披露,因为问题很少是保密,而是某条信息在给定目的下是否应在给定条件下流向给定接收者。
- 研究问题与做法:作者通过与12名美国残障成人的半结构化访谈回答三个问题。RQ1:他们向助手披露什么、以何种形式、如何决定。RQ2:这些决定与对人披露如何比较,他们对助手这一接收者适用什么规范。RQ3:记忆与个性化如何影响残障相关信息流的适当性,他们想要何种控制。
有哪些相关研究?
作者把本文放在残障披露、无障碍隐私权衡、残障者使用生成式AI,以及LLM记忆与contextual integrity的交界。
残障披露作为信息管理
- Goffman(文中引[28]):把污名下的披露写成对尚不明显的污点信息的管理,当事人须反复决定是否告诉、告诉谁、如何、何时、何地。
- Lingsom、Samuels、Evans:Lingsom描述隐性损伤者无法依赖他人已知、因而承担是否及如何告知的负担;Samuels认为从酷儿话语借用的“出柜”只部分适用于残障,因为披露是重复的、依情境的,且常为获得无障碍而非表达身份;Evans区分损伤披露形式,并讨论披露及他人反应如何随时间塑造残障身份。
- 职场、网络与辅具:职场研究写员工在便利与歧视之间权衡,组织氛围显示安全时披露更多。网上,残障者策略性选择平台、受众和措辞。Shinohara与Wobbrock指出可见辅具会招致误解,使用者同时管理工具的社会可及性与功能可及性。作者抽出两条后续要用的线索:披露常是工具性的,为获得无障碍而非表达身份;披露是反复的,每个新受众都要重做。
隐私、无障碍与被要求做出的权衡
- 视障、摄像头与自适应技术:视障者担心谁能看见屏幕和数据并采用变通;基于摄像头的辅具应用要求盲人分享自己无法检查的图像。Hamidi等指出自适应指向工具的使用者在决定谁可访问时,严格区分接收者与目的。语音助手部分因无障碍收益被残障用户“偶然”采用,同时对一般用户带来始终在听的关切。
- Sannon与Forte及生成式AI延伸:对边缘群体隐私研究的综述认为隐私成本分布不均,边缘用户常常没有退出选项,研究应关注人们发展出的策略而不只是关切。近期工作写盲和低视力者越来越多用多模态模型处理以往依赖家人的任务,并偏好端侧处理与零留存。美国盲人基金会2026年调查中,60%受访者表示若工具既不保存也不分享图像,敏感文件更愿用AI阅读器而非人;若图像会分享给科技公司,只有17%的残障受访者愿意。作者称本研究接过这些作者所呼吁的策略,具体考察与会记忆的助手分享的残障信息。
残障者与生成式AI
- 使用与依赖:自传民族志和访谈记录盲人把ChatGPT和图像描述模型当作知识来源,神经发散“高阶用户”建立复杂提示例程,自闭症工作者把LLM当作沟通上“唯一能信任的东西”,有残障的用户把聊天机器人“有点像日记”,AAC用户则发现语言模型既能增强也能妨碍沟通。Glazko等编目生成式AI在无障碍任务上的用处与失败;视觉解释应用与实时视频协助研究显示高度依赖,同时错误频繁、对盲人能看见什么有不适当假设。
- 健全主义假设:语言模型把残障与负面情感和毒性关联;Gadiraju等焦点小组中残障参与者觉得LLM输出隐微冒犯且简化;基于GPT的简历筛选惩罚与残障相关的资历;文生图模型被描述为只在意展示轮椅;模型解释健全主义的方式被残障者称为冷淡、算计、居高临下。这些伤害被追溯到AI设计中嵌入的残障模型,以及奖励同意胜过准确的训练过程。残障研究要求从生活经验考察此类系统。作者把本文放在两支文献的接缝:残障用户告诉助手什么,以及助手用这些信息做什么。
披露、记忆与LLM助手中的contextual integrity
- 框架与近期应用:contextual integrity把信息流的情境规范写成信息类型、发送者、接收者、主体和传递原则;当流动偏离该情境中根深蒂固的规范时即违反隐私。该框架已被用于智能家居规范,近三年也用于评测和约束语言模型:基准测试模型是否跨情境保密,包括CIMemories中针对持久记忆的违规;智能体架构用它减少助手向第三方透露的内容。Tran等对300名ChatGPT用户使用情境完整性情景,发现匿名化等程序保障在适当性判断中比接收者可信度权衡更重。Shvartzshnaider与Duddu认为其中许多工作把理论用得很薄,当成清单而不是扎根于实际社群实践的规范说明。作者称自己走相反路线,用它解释一个社群如何推理信息流。
- 记忆与一般人群披露:情境坍缩描述技术把原先分开的受众合并。作者称助手记忆产生了同一问题的时间版本。ChatGPT记忆研究写用户重视被记住的关系收益,同时经历隐私压力,并对存储内容的心智模型不完整;长期记忆改变人们愿意披露什么。对80名ChatGPT用户的2050条记忆条目的分析发现,96%由系统而非按用户请求创建,35%的用户记忆中有健康相关信息,作者们称之为“算法自画像”。已有基准测量“跨域泄漏”和“记忆诱发的sycophancy”。Zhang等写基于LLM的智能体用户在感知收益与理解不足的风险之间权衡披露,类人界面本身鼓励披露;真实对话日志分析确认人们自由分享健康细节。人们向相信不会评判的计算机披露更多,智能体也可被设计来抽取个人信息。语言模型中的隐私不能还原为去除标识符:模型可从文本推断属性,聚合与二次使用的风险不同于暴露。
- 基线与定位:本文没有实验基线或评测基准。作者称既有文献研究的是一般人群对LLM的披露,以及残障者对LLM的使用但不聚焦披露。作者称,就他们所知,这是第一项跨残障类型询问残障者如何决定一个会记忆的助手应知道其残障的哪些内容的研究。作者还称,参与者深入说出的规范是关于助手作为接收者的规范;他们施加于背后平台的规范更稀疏,更接近先前隐私研究描述的一般制度规范。
论文如何解决这个问题?
以contextual integrity为预设框架,对12名美国残障成人做英语半结构化访谈并做反身性主题分析。
整体是一项探索性定性访谈,预先把contextual integrity定为理论框架,对规范会是什么没有假设。分析按残障信息从参与者流向助手再继续流动来组织。
招募与参与者
- 资格:18岁以上、居住在美国、自我认同有残障,并且每周至少两次使用基于LLM的助手(文中举例ChatGPT、Claude、Gemini或Copilot),或者曾经如此、后来停止或大幅减少使用。后一组作为对照纳入。招募材料只写日常使用AI助手,不点名披露,以免预先引导;同意书和访谈开场才说明焦点是披露。
- 抽样:通过残障组织及其邮件列表、残障取向的网络社群,以及一个全国性盲人组织的研究参与者征集流程招募。资格筛选后分波邀请,优先当时回答者中较少的群体:已减少使用的人、d/Deaf或重听者、多重残障者。每人获20美元,日程上提供实时字幕、休息、拆分场次、屏幕阅读器兼容材料和在会议聊天中书面作答。
- 样本构成:12人(Table 1)。6名女性、6名男性,年龄跨度25–74岁。族裔按论文:9人White,1人Black or African American,1人Native Hawaiian or Pacific Islander,1人同时为American Indian or Alaska Native、Hispanic or Latinx和White。可选人口学问卷中,盲或低视力5人,行动或肢体残障6人,d/Deaf或重听3人,慢性病、慢性疼痛或疲劳5人,注意力相关2人,心理健康残障2人,自闭或其他神经发散、认知残障、言语或沟通残障各1人;12人中8人选择多于一个类别。7人自出生或幼年起有残障,2人超过十年,1人五到十年,2人说随不同残障而变化。11人常规使用辅具。群体上技术经验较多:若干人从事软件、网页开发或辅助技术,多数使用LLM助手超过一年。P6与P9已大幅减少使用,P10描述谨慎、有意限制的使用。各人使用的助手及记忆与账号情况见表1,包括记忆开启、写入系统指令、分账号、免费层“总是忘记”、无账号、付费层、以及P12从未披露残障并在访谈中才了解记忆。
访谈程序
- 执行:第一作者用英语在Zoom完成全部访谈。开场用直白说法说明焦点:参与者如何直接陈述残障,或间接提出只有具该残障的人才会提的请求。半结构协议分八部分:如何使用AI助手;日常生活中对人(见新人、入职、看新临床医生)如何处理披露;是否及如何直接或间接告诉助手残障;期望助手如何使用该信息;助手跨会话记住、忘记或重新浮现残障相关信息的经历;不想要或错误的假设;与对人披露的直接比较;设计偏好。减少使用者还被问及原因。
- 设计探针:最后一部分由访谈者引入设计想法(第4.6节)。作者把对这些想法的反应报告为对访谈者提出的想法的反应,并在立场性一节把这些探针视为她的想法。
- 时长与记录:每场44至86分钟,中位数62分钟。无障碍适配贯穿全程:P1在会议聊天中打字作答;P12依赖自动字幕,访谈者复述并打出关键问题。在录音开始前后都确认同意后进行音视频录制。自动转录后保留逐字稿供核对与编码;去掉填充词和错误起句,保留话轮顺序、参与者措辞和每个具体例子。引文为可读性略作编辑,可识别身份的细节被删除或概括。
分析与contextual integrity
- 编码:采用反身性主题分析。做访谈的第一作者通读每份转录,在“事件”层面归纳初始编码本:一次披露、隐瞒、被记住、被误读、纠正,或对设计探针的反应。第一、第二作者再用该编码本独立编码全部12份转录,第二作者使用去标识版本。两人比较编码应用,讨论解决分歧,并在比较显示定义不清时修订。
- 理论词汇:随后用contextual integrity的词汇组织编码:流动的信息类型(诊断、功能需要、症状、偏好)、行动者(参与者、助手、平台、家人或客户等第三方),以及传递原则(相关性、保密、访问控制、留存、目的)。两名编码者对照去标识摘录审阅所得编码本和候选主题,经讨论精炼主题。与反身性主题分析一致,作者未计算评分者间一致性。文中报告多少参与者描述某经历时,计数用来显示该经历在样本中的分布,而不是任何人群中的流行率。
- 发现结构:六个主题对应信息流:披露什么与为何(RQ1)、把接收者理解成谁(RQ2)、记忆对所说内容做了什么、参与者如何回应、想要何种控制(RQ3)。附录A的Table 3列出主题、代表性编码、编码到的参与者人数,以及每条编码的说明性摘录。
立场、伦理与成功判定
- 立场:第一作者是先天肢体残障的学者,使用轮椅和替代输入,并每天使用LLM助手,包括为了无障碍。她通常在访谈早期向参与者披露这一点。参与者以社群成员的身份与她说话,比较辅具设置,有几例反过来提问。作者认为这带来了比更疏离的立场更坦率的、关于挫败和健全主义的叙述,也带来引导风险:问题未落地时,访谈者偶尔提供自己的经历作为例子,例如助手把关于她打字速度的存储事实插入无关邮件。团队包含无障碍与HCI领域的残障与非残障研究者。语言上身份优先与个人优先互换使用,对所有参与者使用单数they。
- 伦理与判定:研究经卡内基梅隆大学IRB批准。本文没有攻击或防御意义下的成功判定。设计含义区分“若干参与者支持”与“作者试探性提出”;作者明确四名讨论过逐条开关的参与者中有四人拒绝,摘要写的是讨论过逐条开关的八人中有四人拒绝。
论文做了哪些实验?
12人访谈的六个主题:按需要披露、双接收者、记忆的解脱与漂移、不按所知行动、边界劳动,以及想要的控制。
实验设置
- 被访者:12名美国残障成人(Table 1),自我认同残障,使用或曾高频使用基于LLM的助手。助手包括参与者自述的ChatGPT、Claude、Gemini、Copilot、Siri、Alexa、Be My Eyes、Seeing AI、Meta AI眼镜、Aira、智能眼镜、智能音箱、电视助手和编码智能体;不是统一被测模型。
- 程序与规模:英语Zoom半结构化访谈,44–86分钟,中位数62分钟。协议八部分,末段为访谈者引入的设计探针。没有数据集、基线模型或自动指标。
- 分析:反身性主题分析,两名作者独立编码12份转录,讨论解决分歧,不计算评分者间一致性。人数表示样本内分布,不是总体流行率。
- 评审:无LLM评审、无数值阈值、无重复实验次数。引文经可读性轻编并去标识。
主结果
人数来自第4节与摘要;同一人可出现在多个主题。
主题 人数 论文中的归纳 先说指令而非诊断 6/12 §4.1:功能需要、限定在任务 对助手比对人更自由 6 §4.2:P2、P3、P5、P7、P8、P11 更把平台当接收者、披露更少 3 §4.2:P9、P10、P12 欢迎记忆减轻重复 7 §4.3:P1、P3、P4、P5、P7、P8、P11 助手未按已知身体限制行动 5 §4.4:P1、P2、P3、P5、P7;另有7人报告某种不作为 核验或当场修正 9 §4.5:核验5人,当场修正4人 讨论逐条开关后拒绝 4/8 摘要;正文§4.6另有拒绝细粒度控制的计数 - 作者的解读(披露形式):参与者发送的通常是需要,有时是作为简写的诊断,并且总是主动说出,因为助手不会问。诊断出现在两类情形:任务本身是医疗;或参与者期望标签携带助手本应已有的知识。P10、P12几乎不披露,P9已基本停止。P8、P11还描述助手从内容推断残障,发送者决定说什么只是接收者所知的输入之一。
- 作者的解读(两个接收者):同一披露同时对着对话中的智能体和背后的公司。作者称分组是他们的解释:哪一个接收者似乎支配该参与者的披露决定。前台是不评判的助手时,披露比对人更自由;前台是平台时则更少。P6提供第三种经验:把智能体当成会评判的接收者,其评价本身即伤害,因此不用账号以免积累关于自己的图景。五人(P6、P9、P10、P11、P12)对作为接收者的公司说出同一传递原则:二次使用若不绑定身份且服务集体目的,更可接受。
- 作者的解读(记忆):跨会话记忆把传递原则从一次、一个目的,改成以后所有对话都可用。解脱与漂移同时发生。漂移有三种:过度锚定、张冠李戴、跨情境渗漏。P2与P4用相关性检验重新浮现是否适当,P4另加来源:希望助手说明是根据用户说过的什么、以及为何现在提起。
助手不按所知行动
- 测了什么:参与者回忆助手忽略已知约束、给出错误的无障碍说法,或再现健全主义规范。
- 结果:七人报告助手未能按它知道或本可知道的内容行动。五人(P1、P2、P3、P5、P7)遇到它忽略已说明的身体限制,通常假定非残障身体;P4得到事后证实不对的无障碍说法;P9因名字被错认性别。四人(P8、P10、P11、P12)报告自己没有与残障相关的失败。P6描述的不是记忆失误而是价值:早期被建议把反馈忍受得更好,写作助手把“with”多发性硬化改写成把残障暗示为成就障碍的表述。
- 作者的解读:无论忽略已说明的约束还是再现健全主义规范,效果相同:披露已经做出却未被尊重。情感基调多为恼怒而非伤害;P6是例外,其残障也最直接牵涉反馈如何给出。参与者的原因理论包括:P3归为责任规避,P6与P10归为训练数据中的刻板数据,P9归为人类对残障理解的缺陷和较低期待。作者未把这些理论写成已证实原因。
边界劳动
- 测了什么:在“会忘记”和“过度记住”之间,参与者如何把残障信息留在想要的情境。Table 2分成五类策略。
- 结果:分割(P2分账号、平台或层级;P2、P8使用persona、“gems”或可复用工作流);画像(P1、P2、P11把无障碍需要写入系统指令或档案,或让助手记住);审计(P3、P11询问它知道什么并纠正,P3经开发者工具查看记忆,还有临时聊天和按项目的记忆文件);最小化(P10、P12、P5、P8、P9、P4只披露呈现需要、把问题说得笼统,或隐瞒标识、财务或医疗细节;P6无账号且每次重新披露,P10每次重新指示;P5用盲文显示器并关闭屏幕与语音);核验与修补最普遍,九人至少做其一:五人(P4、P8、P9、P10、P11)在依赖前核验对无障碍关键的输出,四人(P2、P3、P5、P7)当场纠正后继续。P11称抽查时助手“90% right”,再用纠正提示改掉其余。
- 作者的解读:这些策略有效也昂贵。P2认为教助手何时该用照护者指令,比把输出调准更费力。P3描述习惯性的听天由命,并指出记忆控件藏得很深,对需要更多控制的人代价不均。作者称这些策略用手恢复记忆去掉的情境,而且主要为最有能力搭建它们的参与者所用。
其他消融与分析
- 设计探针(§4.6):访谈者提出消息级是否记住、记忆分离的persona、过期记忆等组合;反应被当作对访谈者想法的反应,不是已部署功能的测试。
- Table 3:想要使用点控制或可见性的编码计4人;拒绝逐消息或细粒度控制计5人;更希望模型按情境推理计2人。摘要写讨论过逐条开关的八人中四人拒绝。
- 记忆状况(Table 1)为访谈时的自述,包括记忆开、分账号、免费层总忘记、故意无账号、付费并审计,以及P12访谈中才得知记忆。
- 公司作为接收者时,五人接受不绑定身份、服务集体目的的二次使用;P11提出留存不超过一年,论文未把它写成共识。
- P7对称之为朋友定制、却按自己需要改写的建议表示不会在意,与担心渗漏的参与者不同。
- 情感上多数把失误看成浪费时间、不够有用;P5更反感道歉而非错误本身。论文未报告统计检验。
有什么可以进一步探索的点?
设计含义区分多人支持与试探性提议;样本为12名美国、多为技术熟练的残障成人。
作者指出的局限与后续方向
- 设计含义分两层:作者在贡献陈述中区分若干参与者支持的设计与作者试探性提出的设计,并合在一起偏向范围、访问、留存和来源上的控制,而不是逐条话语开关。摘要写讨论过这些开关的八人中有四人拒绝(引言与摘要)。
- 探针不是产品测试:方法与立场性写明,设计探针是访谈者引入的想法,反应只作为对这些想法的反应来报告(§3.2、§3.4)。
- 计数不是流行率:作者写明,多少人描述某经历只表示该经历在样本中的分布,不是任何人群中的流行率(§3.3)。
- 引导风险:第一作者披露自身残障并偶尔以自己的经历作例子,作者认为这可能带来引导,同时认为也使关于挫败和健全主义的叙述更坦率(§3.4)。
- 平台规范更稀疏:作者称参与者深入说出的是关于助手这一接收者的规范;施加于平台的规范更稀疏,更接近先前隐私研究中的一般制度规范(§2.4)。
- 作者的定位:作者称就他们所知这是第一项跨残障类型做此询问的研究,并讨论对话式AI助手的设计含义;后续若发布代码或数据,正文此处未写成已完成。
实验覆盖范围
- 样本:12名居住在美国的成年残障者,英语Zoom访谈,44–86分钟(中位数62),助手使用频率为每周至少两次或曾达到后减少(§3.1–3.2,Table 1)。
- 残障类别:问卷允许多选,盲或低视力、行动或肢体、d/Deaf或重听、慢性病或疼痛或疲劳、注意力、心理健康,以及自闭或其他神经发散、认知、言语或沟通;8人多选(§3.1)。
- 分析:两名作者独立编码全部12份转录,用contextual integrity组织信息类型、行动者和传递原则,不计算评分者间一致性(§3.3)。
- 策略与控制:Table 2记录分割、画像、审计、最小化和核验修补;§4.6记录对消息级记忆、分离persona和过期记忆等访谈者想法的反应。
- 论文未报告:没有定量的ASR或隐私指标、没有评审模型、没有把同一协议重复多次的次数;记忆是否开启以参与者自述为准(Table 1)。
总结一下论文的主要内容
12名残障成人按任务需要向会记忆的助手披露残障;记忆既省去重复,也造成漂移,他们要用边界劳动把情境补回来。
这是一项用contextual integrity分析残障披露的定性访谈,不是攻击、防御或基准论文。
- 问题:残障者要从对话式AI得到有用帮助,常常得说明残障。助手像不评判的对话者,背后却是留存与二次使用不透明的公司;跨会话记忆让一次说明进入以后所有对话。
- 做法:12名美国残障成人,使用ChatGPT、Claude、Gemini等LLM助手至少每周两次,或曾经如此后减少。英语半结构访谈44–86分钟。反身性主题分析考察信息类型、接收者与传递原则。作者没有预设参与者会采用哪些规范。
- 披露:12人中6人首先描述的是任务范围内的指令而不是诊断。诊断用于医疗任务,或用于参与者期望该标签能压缩许多限制、由助手解压的时候。助手不问,所以披露总是主动的。
- 两个接收者:6人(P2、P3、P5、P7、P8、P11)觉得对助手比对人更自由,因为助手需要信息、不评判、没有社交代价。3人(P9、P10、P12)把公司放在前台,因而披露更少。P6不用账号,以免助手积累足以评价自己的信息。5人对公司接受不绑定身份、服务集体目的的二次使用。
- 记忆与劳动:7人欢迎记忆省掉重复说明。漂移包括把存储事实用到不相关回答、把客户信息安到自己身上、以及营养persona渗入随意聊天。7人遇到助手不按已知或可知信息行动,其中5人是忽略已说明的身体限制。9人核验关键输出或当场纠正。作者认为参与者想要的是范围、来源、留存和访问上的控制;讨论过逐条开关的8人里有4人拒绝。
- 作者的结论:一次披露同时被两套相反规范评判;记忆把传递原则从短暂、限定范围改成持久、全局。参与者用分割账号、写入指令、审计记忆、尽量少说和找可信的人复核,把手头的情境补回来。作者把设计建议分成多人支持的和试探性提出的两类。