研究分析 14,727 条用户安全与隐私提问,GPT 5.5 与 Llama 4 回答质量差距明显
Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond
WildChat中14,727条S&P提问;270条建议类上GPT5.5的10次均分≥7占98%,Llama4占47%。
- 用户向LLM询问数字安全与隐私时,错误或互相冲突的回答可能影响防护行为。作者称此前没有工作收集真实的这类提问,已有质量评测用的是专家编写的误解或FAQ。
- 从WildChat用三模型多数投票识别S&P提示词,再用分类模型分成九类,得到14,727条。对分层抽取的450条做主题分析;另取270条建议类提示,五个LLM各生成10次,以checklist打质量、以证据句双向蕴含打一致性。
- 450条分层样本里一般知识占33.3%。270条建议类提示上,GPT5.5平均质量分8.67、10次均分不低于7的比例为98%,Llama4为6.71与47%。成对蕴含超过0.5时,Llama4为97.4%,五个模型中最高。
- Limitations写样本可能偏向关心技术或AI的用户、只覆盖英文与单轮,并把多轮留给未来;checklist漏项会低估质量。§5.2呼吁同时报告质量与一致性。评测含五个模型、270条、各10次;未报告质量分的统计检验。
- 被测模型
- GPT-5.5-2026-04-23Gemini 3.1 Pro PreviewClaude-opus-4-7Qwen3-Next-80B-A3B-InstructLlama-4-Scout-17B-16E
- 基准
- WildChat本文筛出的14,727条S&P提示词270条advice-seeking S&P提示词
- 指标
- 质量分(1–10,三评分器平均)10次均分不低于7的提示词比例双向蕴含一致性(阈值0.5)
研究者从 WildChat 的 3.2M 条真实用户-LLM 对话中识别出 14,727 条数字安全与隐私(S&P)提示词,归入九类主题,并抽样 450 条做主题分析。另整理 270 条求助类提示词,每条向模型重复提问 10 次以测量回答质量与一致性。结果显示商业模型优于开放权重模型,GPT 5.5 在 98% 的提示词上给出“足够好”的回答,Llama 4 为 47%;但在平均回答质量较高的提示词中,商业模型多次运行仍会给出相互矛盾的回答,可能误导用户。
深度解读
这篇论文试图解决什么问题?
从真实对话筛出S&P提问,并评测五个LLM的回答质量与跨次一致性。
用户向 LLM 提出哪些数字安全与隐私(S&P)问题,以及回答质量与同一问题的跨次一致性如何。
- 使用场景:作者认为 LLM 已被当作日常信息来源,但 S&P 仍缺少对真实提问的研究。答错可能带来账户被攻破或数字身份暴露;互相冲突的建议还会让用户困惑,并可能削弱防护行为。
- 已有评测的缺口:作者称此前没有工作收集或分析用户向 LLM 提出的 S&P 问题。已有质量评测用的是专家编写的误解或 FAQ,而不是真实用户查询。
- 数据起点:材料来自 WildChat 的 3.2M 条野外对话。摘要写其中英文对话为 1.6M 条;方法节写排除毒性标记与非英文后抽出单条提示词,去重得 2.3M 条,再经长度与越狱前缀过滤剩 1.7M 条,并从中识别 14,727 条 S&P 提示词。
- 评测范围:作者把编码与写作质量留给通用基准,把质量与一致性限定在建议类提示词,即索要推荐、指导或具体 S&P 信息的提问。
- 三个问题:RQ1 问用户提出哪些类型的问题;RQ2 问回答质量;RQ3 问同一问题重复查询时回答是否一致。对应做法是 450 条分层样本的主题分析,以及五个 LLM 对 270 条建议类提示词各生成 10 次。
有哪些相关研究?
作者把本文放在真实用户提问上,区别于专家编写的误解、FAQ与专家级安全基准。
论文第 2 节把相关工作分成用户从何处寻求 S&P 帮助、已有 S&P 回答的质量,以及 LLM 质量与一致性的评测方法。
- 用户的 S&P 提问渠道:Tahaei et al.(2020)分析开发者在问答平台上的实际问题,如隐私政策合规与访问控制。Hasegawa et al.(2022)写非专家询问网络攻击、隐私滥用与身份认证。Thomas et al.(2026)报告 Reddit 求助集中在诈骗、账户访问与隐私工具;Redmiles et al.(2016)写技术较弱的用户更依赖这类非正式渠道。
- LLM 与论坛的差别:Burtch et al.(2024)、Chatterji et al.(2025)与 Liang et al.(2025)写 LLM 已被广泛用作日常信息来源。作者将 LLM 与论坛区分开:交互是私下、一对一的,没有社区辩论,也没有随时间积累的同行把关(Burtch et al., 2024; del Rio-Chanona et al., 2024)。
- S&P 建议本身:Bhagavatula et al.(2022)发现在线安全建议常常稀缺且含糊。论文对 Redmiles et al.(2018, 2020)的转述是:难点不只是建议质量,还包括帮用户决定优先采纳哪条,且用户会过多报告自己的安全行为。Chen et al.(2023)在常见 S&P 误解上评测 LLM,论文转述其会在不可忽略的比例上错误认同这些误解。Prakash et al.(2025)在 S&P FAQ 上评测,论文转述模型常常未能呈现相关研究结论,安全护栏还会进一步妨碍有用建议。
- 质量与一致性方法:通用与领域基准包括 Hendrycks et al.(2021)、WildBench(Lin et al., 2025)以及网络安全向的 SecBench(Jing et al., 2024)、Cyberbench(Liu et al., 2024)和 Incalmo(Singer et al., 2026)。论文写这些网络安全基准面向专家级操作,而不是日常 S&P 问题。质量评测从人工检查、众包成对偏好,发展到 checklist 式 LLM-as-judge(Lin et al., 2025; Wei et al., 2025)。一致性指标从 BLEU、BERTScore 发展到基于蕴含的评分(Zhang et al., 2024)。
- 基线与数据:实验没有把论坛回答或专家 FAQ 当作数值对照。质量与一致性在五个 LLM 之间比较,提示词来自 WildChat;checklist 来自 WildBench 与 RocketEval,一致性来自 Zhang et al.(2024)的双向蕴含。
作者把本文定位为:在真实用户的 S&P 问题上评测回答质量与一致性,以了解用户向 LLM 寻求 S&P 指导时面对的风险,而不是只在研究者编写的输入上评测。
论文如何解决这个问题?
两阶段筛出S&P提示词,再用checklist质量分和双向蕴含衡量回答。
流程分两段:先从 WildChat 识别并分类 S&P 提示词,再对建议类子集多次生成,用 checklist 打质量、用证据句的双向蕴含打一致性。作者未给整套流程单独命名;研究设计见 Figure 1。全文用到九个 LLM,配置见 Table 5。
筛选与九类分类
- 清洗:排除毒性标记与非英文对话,从对话中抽出单条提示词,以考察单个问题而不是多轮动态。去重并去掉空串后为 2.3M 条。作者检查最长的 200 条和随机 500 条后,把长度上限定为 7K 字符,并去掉检查中发现的越狱前缀,剩 1.7M 条。
- Stage 1:两名 S&P 研究者独立标注 1,325 条是否相关,讨论至全部共识。分类用 Qwen 3、Calme 3.2 与 GPT 5.2,温度 0.0;前两者先判,只在分歧时由 GPT 5.2 打破平局。附录 A.4 给出完整提示词。
- Stage 2:九类由既有 S&P 分类改写,并对照提示词迭代修订。类别为账户与认证、应用与软件防御、攻陷与利用、数据隐私与伦理、新兴技术、网络与系统防御、网络骚扰与安全、平台政策与执行、社会工程。一条可属多类(Table 3)。
- 分类器:两人共同标注 300 条并达成共识。方法文本写比较了六个 LLM,选定 gemma-4-31b-it(温度 0)分类全部入选提示词。附录 A.5 给出分类提示词。Table 5 的九个模型名单未列入文中候选里的 Qwen3-Next-80B-A3B-Thinking 与 Llama-3.3-70B-Instruct。
主题分析
- 样本:九类各随机 50 条,共 450 条。作者没有套用通用人机交互分类,而是归纳 S&P 专用主题。
- 编码:一人先提出候选主题,另一人核对并修订,当面讨论至共识。得到 6 个主题、22 个子主题;编码簿为附录 Table 6,分布为 Table 7。
建议类子集与生成
- 定义:建议类指索要推荐、指导或具体 S&P 信息的提示词,跟随 Lin et al.(2025)。编码与写作不进入质量评测。两人从每类继续标注,直到各类有 30 条,共审阅 1,659 条,得到 270 条。
- 模型与次数:Claude-opus-4-7、Gemini 3.1 Pro Preview、GPT-5.5-2026-04-23、Qwen3-Next-80B-A3B-Instruct、Llama-4-Scout-17B-16E。每模型每条提示词 10 次独立生成,每模型 2,700 条。
- 配置:选用当时 API 预算与 GPU 资源内可用的最强版本。全部用默认设置,以接近普通用户。商业模型的默认设置包含 thinking 与 web search;两个 open-weight 模型部署在四块 Nvidia H100 上,Qwen 3 默认温度 0.6,Llama 4 默认温度 0.7(Table 5)。
质量评分
- checklist:每题由 GPT-5.5-pro 与 Claude 4.7 各生成一份,共 540 份。两人删去重复项、合并相近项,得到 270 份。条目是二元的:正确回答应覆盖什么。
- 分数:采用 WildBench 的 1–10 分:1–2 为 very poor,3–4 为 poor,5–6 为 fair with issues,7–8 为 good but improvable,9–10 为 perfect。引言另写 4 分及以下为 poor、7 分及以上为 good。作者先用 GPT 5.5 评分时发现自评偏好,改为 GPT 5.5、Gemini 3.1、Claude 4.7 三份分数的平均。附录 A.6 给出评分提示词。
- 汇总:报告的模型级质量是 10 次生成的分数。作者另抽查每个评分器–模型–类别组合的最高 10 条与最低 10 条。
一致性
- 比较单位:不比较整段回答,而比较评分模型为支撑 checklist 条目抽出的证据句。三个评分器的引文合并、去掉完全重复后,在 10 次之间做两两比较,共 45 对。
- 分数:采用 Zhang et al.(2024)的双向蕴含,模型为 nli-deberta-v3-large。作者在 50 对上比较蕴含、USE 与 BERTScore 后选用蕴含。一条提示词的一致性分是 45 对分数的平均。
- 阈值:§4.3 把成对蕴含分超过 0.5 记为各次回答不互相矛盾。作者写在该阈值下,回答更可能互相支持而不是互相否定。
论文做了哪些实验?
五个模型各答270条、10次;GPT5.5均分8.67,Llama4为6.71但一致性更高。
实验设置
- 数据:Stage 1 得到 14,727 条 S&P 提示词。Table 3 各类条数为网络与系统防御 4,847、应用与软件防御 4,552、攻陷与利用 3,147、账户与认证 2,442、数据隐私与伦理 2,239、社会工程 1,960、新兴技术 1,132、平台政策与执行 377、网络骚扰与安全 336;一条可属多类。
- 样本结构:主题分析为九类各 50 条、共 450 条。质量与一致性为九类各 30 条建议类提示、共 270 条。两者都是按类分层,不是按 Table 3 的类别规模加权。
- 被测模型:Claude-opus-4-7、Gemini 3.1 Pro Preview、GPT-5.5-2026-04-23、Qwen3-Next-80B-A3B-Instruct、Llama-4-Scout-17B-16E。商业模型开启 thinking 与 web search;Qwen 3 温度 0.6,Llama 4 温度 0.7(Table 5)。
- 生成量:每模型每条提示词 10 次,每模型 2,700 条回答。
- 质量:三个评分器的 1–10 分平均。另报告提示词的 10 次均分不低于 7 的比例。§4.2 把 7–8 分称为 good but improvable;摘要把达到这一档称为 good enough。checklist 由 GPT-5.5-pro 与 Claude 4.7 生成后经两人修订。论文未写每题条目数。
- 一致性:证据句的双向蕴含,模型为 nli-deberta-v3-large;超过 0.5 记为不矛盾(§3.4、§4.3)。
主结果
下表前两列是 2,700 条回答的统计(Table 1),第三列是 270 条提示词的 10 次均分是否不低于 7(Figure 2、§4.2)。
表格较宽,可左右滑动
模型 回答均分(Table 1) 标准差(Table 1) 10次均分≥7占比(Figure 2) GPT 5.5 8.67 0.87 98% Gemini 3.1 8.52 1.10 94% Claude 4.7 8.47 1.25 91% Qwen 3 7.90 1.65 77% Llama 4 6.71 2.06 47% - 两种汇总:Table 1 对全部回答取均值和标准差;Figure 2 先对每条提示词的 10 次取均,再看是否过阈值。
- 作者的比较:作者报告三个商业模型的回答均分高于两个 open-weight 模型,并称 Llama 4 比 GPT 5.5 低近两分(§4.2)。
- 类别:作者称没有单一模型在九类上都最高(Table 2)。
分类别质量与抽查
- 各类最高分:据 Table 2,GPT 5.5 在五类最高:Account & auth. management 8.59,Compromise & exploitation 8.84,Emerging technologies 8.68,Online harassment & safety 8.67,Platform policy & enforcement 8.62。Gemini 3.1 在三类最高:Data privacy & ethics 8.61,Network & system defenses 8.79,Social engineering 8.95。Claude 4.7 在 App. & software defenses 为 8.88。
- 图注与图中数字:作者称 Platform policy & enforcement 与 Online harassment & safety 在所有模型上最低,Social engineering 最高,且 Llama 4 每一类最低、方差最大。按 Figure 3 底部顺序读取,Llama 4 确为每一行最低;但 GPT 5.5 最低是 Data privacy & ethics 的 8.48,低于其 Platform policy 的 8.62。Claude 4.7 最高是 App. & software defenses 的 8.88,高于其 Social engineering 的 8.66;GPT 5.5 最高是 Compromise & exploitation 的 8.84,高于其 Social engineering 的 8.81。
- 高低分抽查:作者检查每个评分器–模型–类别的最高与最低 10 条,写共 2,700 条(n=3、5、9)。作者写 9–10 分回答事实正确、在伦理上适当(例如拒绝生成恶意代码),并满足 checklist。1–3 分中,作者写事实错误最常见:Llama 4 把 dox 理解成 doxycycline,并称 Google Workspace 支持自动删除不活跃账户,与其引用的官方指南不符。另一类是给出可能有害的信息且不符合 checklist 的伦理要求;正文举了绕过学校设备网站限制的例子,此处不复述原句。
主题分析
- 六类占比:在分层的 450 条上,一般知识 33.3%(150/450),用户侧应对 20.9%(n=94),S&P 任务产出 13.8%,防御行动 11.8%(n=53),询问模型自身 10.2%(n=46),有害与攻击性请求 6.9%(n=31)。这不是 14,727 条上的占比。Table 7 另有无法理解的 14 条。
- 作者强调的三类用法:防御行动中,防御实现占 53 条的 37.7%,反欺诈占 34.0%,漏洞评估与修复占 13.2%。询问模型自身中,系统探测占 46 条的 58.7%,能力或政策询问占 41.3%。有害请求中,指向个人与指向系统各占 31 条的 29.0%,指向平台占 19.4%;Table 7 对应计数为 9、9、6,另有有害准备 7 条。正文有示例,此处不复述有害原句。
- 作者的解读:作者称一般知识里主题探索占 150 条的 46.7%,问答占 28.7%;用户侧应对里事件响应占 94 条的 52.1%。作者认为用户不只索取信息,还会要求防护评估与行动;也会探测模型的配置、能力与限制,并提出攻击或利用请求。作者认为模型需要能识别探测、拒绝有害请求,并说明自身能力与限制。
跨次一致性
- 过阈值的条数:成对蕴含分超过 0.5 时,Llama 4 为 263/270(97.4%),GPT 5.5 为 262(97.0%),Gemini 3.1 为 255(94.4%),Claude 4.7 为 249(92.2%),Qwen 3 为 242(89.6%)(§4.3)。
- 作者的解读:作者报告 Llama 4 平均质量最低,但不矛盾的提示词最多。它在四类的全部 30 条上都不矛盾:Account & authentication management、Emerging technologies、Platform policy & enforcement、Social engineering。
- 高分仍冲突:Gemini 3.1 被问文件系统权限时,两次质量分都高于 9,但一次称配置由系统自动应用,另一次称必须通过系统设置管理。作者认为这类冲突可能让用户不确定该行动还是保持原状。
其他消融与分析
- Stage 1:1,325 条人工标注上 precision 96%、recall 74%;两人初始一致 83%,后全部共识(§3.2)。
- 假阴性抽查:两模型分歧的 500 条非 S&P 中有 48 条(9.6%);作者认为分类器不太可能漏掉含义上不同的 S&P 提示词。
- Stage 2:gemma-4-31b-it 在 300 条上九类平均 precision 0.90、recall 0.89;论文未给出其余分类候选的这两项数字。
- 评分器分数(Table 4):Gemini 3.1 给自身 9.11、给 GPT 5.5 为 9.04;GPT 5.5 给自身 8.71、给 Gemini 3.1 为 8.24;Claude 4.7 给 GPT 5.5 为 8.27、给自身 8.24。三列给 Llama 4 的分数为 6.34、6.84、6.94,均为该列最低。
- 一致性指标:作者在 50 对上对比后采用蕴含;论文未给出 USE 与 BERTScore 的分数。
- 论文未报告质量分差异的统计检验。
有什么可以进一步探索的点?
作者指出样本偏向、只含英文、只看单轮,且质量分受checklist覆盖约束。
作者指出的局限与后续方向
- 样本来源(Limitations):WildChat 经 Hugging Face 界面收集。作者认为样本可能偏向对技术或 AI 感兴趣的用户,未必代表更广人群。
- 语言(Limitations):只分析英文,以避开语言和文化差异的混杂。作者认为结果未必推广到其他语言的 S&P 提示词。
- 对话长度(Limitations):只考察单条、独立提示词,不考察多轮如何展开。作者把完整对话上下文留给未来工作。
- checklist 边界(Limitations):若清单漏掉重要 S&P 标准,满足这些标准的回答不会得分,质量分会低估真实回答质量。
- 同时报告两个指标(§5.2):作者呼吁后续工作在评估 LLM 回答可靠性时,同时评估并报告质量与一致性。
实验覆盖范围
- 提示词来自 WildChat,排除毒性标记与非英文,并去掉超过 7K 字符及检查中发现的越狱前缀;识别结果为 14,727 条,再分成九类,一条可属多类(Table 3)。
- 主题分析为九类各 50 条、共 450 条;质量与一致性为九类各 30 条建议类提示、共 270 条,每条 10 次生成(§3.3、§3.4)。
- 回答模型为 Claude-opus-4-7、Gemini 3.1 Pro Preview、GPT-5.5-2026-04-23、Qwen3-Next-80B-A3B-Instruct、Llama-4-Scout-17B-16E。商业模型开启 thinking 与 web search,两个 open-weight 模型用默认温度,部署在四块 Nvidia H100 上(Table 5)。
- 质量分是 GPT 5.5、Gemini 3.1、Claude 4.7 的平均;一致性用 nli-deberta-v3-large,阈值 0.5。分类全量数据的模型是 gemma-4-31b-it(§3.2、§3.4)。
- 1,325 条是否属于 S&P 的初始一致率为 83%(§3.2)。论文未报告主题编码的一致性系数,也未报告质量分差异的统计检验;高低分抽查写在 §4.2,论文未给出该抽查与评分器的一致率。
总结一下论文的主要内容
真实S&P提问含防御、探测与有害请求;商业模型均分更高,但高分仍可能前后矛盾。
作者用 WildChat 中的真实对话刻画用户向 LLM 提出的数字安全与隐私问题,并在建议类提问上比较五个模型的回答质量与跨次一致性。
- 要解决的问题:作者认为该领域此前没有收集真实用户提问,质量评测多用专家编写的误解或 FAQ。答错或前后矛盾的建议可能影响用户的防护决定。
- 做法:排除毒性与非英文、限制长度并去掉越狱前缀后,用三模型多数投票从 1.7M 条提示词中识别 14,727 条 S&P 提示词,再分成九类。九类各 50 条做主题分析;另审阅 1,659 条,凑齐九类各 30 条、共 270 条建议类提示。五个 LLM 各生成 10 次。质量用两人修订后的 checklist 和三个评分器的平均分;一致性用证据句的双向蕴含,超过 0.5 记为不矛盾。
- 用户在问什么:450 条是分层样本,不是全量占比。一般知识 33.3%(150/450),用户侧应对 20.9%,S&P 任务产出 13.8%,防御行动 11.8%,询问模型自身 10.2%,有害与攻击性请求 6.9%。作者称后三类包含论坛式信息寻求之外的用法:把模型用于防护评估与行动、探测模型本身,以及请求攻击或利用协助。
- 质量:2,700 条回答的均分,GPT 5.5 为 8.67,Gemini 3.1 为 8.52,Claude 4.7 为 8.47,Qwen 3 为 7.90,Llama 4 为 6.71(Table 1)。10 次均分不低于 7 的提示词比例依次为 98%、94%、91%、77%、47%(Figure 2)。作者称没有单一模型在九类上都最高;Table 2 中最高单元格是 Social engineering 上 Gemini 3.1 的 8.95。
- 一致性:Llama 4 有 263/270(97.4%)超过 0.5,GPT 5.5 为 97.0%,Qwen 3 为 89.6%(§4.3)。作者报告平均质量高仍可能在不同次给出互相矛盾的建议,并举了 Gemini 3.1 两次均高于 9 分、但权限配置建议相反的例子。
- 作者的结论:作者在结论中称这是对真实用户 S&P 提示词的首次刻画,并认为可靠的 S&P 协助需要同时评估质量与一致性。讨论中作者还认为同一模型会接到防御与滥用两类请求,拒绝与过度拒绝应一起看;用户也会把模型本身当作探测对象。作者计划在论文发表后发布提示词数据、筛选代码与评测代码(附录 A.1)。