跳到正文
原文
论文追踪· arXiv:2606.24819· Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley et al.·本站收录 · 原文发表

HelpBench 评测 18 个 LLM 提供隐私与安全建议的能力

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

HelpBench以450题评18个LLM的PSS建议:全体平均82%,14%回答低于65%。

问题
人们用LLM寻求数字隐私、安全与安保帮助,错误建议可能导致账号被攻破或财务损失。面向这类开放式真实求助的评测仍然缺少。
方法
作者从Reddit筛选并改写450道英文单轮问题,覆盖九个主题。专家为每题写正负向事实标准并加入表达标准,再用Gemini 2.5 Pro按量表自动评分。
实验与结果
18个模型各答5次。全体平均82%;GPT 5.0与GPT 5.3为87%,Qwen 3为67%。scams全体88%,moderation tools全体77%。作者报告14%的回答低于65%。
局限与可以继续做的
作者指出模型可能见过相似题、Reddit问法未必同于对LLM提问、平台功能会过时,且量表盖不住全部误解。作者建议扩展到多模态、多轮、多语言,并做表达标准的用户测试。评测为18个模型、450道英文单轮题。
实验设置GPT 5.0、GPT 5.3 等 · HelpBench · 量表得分(得到的分数/满分)、低于65%的回答比例 等
被测模型
GPT 5.0GPT 5.3GPT 4.1Claude Opus 4.6Gemini 3 FlashClaude Sonnet 4.6Qwen 3.6 PlusGrok 4Gemini 3.1 ProClaude Sonnet 4GLM 5.1Gemini 2.5 ProDeepSeek 3.2Grok 4.20GLM 4.6DeepSeek 3.1GLM 5 TurboQwen 3
基准
HelpBench
指标
量表得分(得到的分数/满分)低于65%的回答比例Pearson correlation
AI 导读研究者提出 HelpBench,用于评估 LLM 能否就数字隐私、安全与网络安全问题给出准确建议。该基准包含 450 道来自真实用户情境的问题,并为每题制定评分标准,评估回答的事实准确性与语气,问题涵盖找回被封账号、硬件安全密钥与双因素认证的取舍、可疑邮件是否为诈骗、施虐者能否通过设备外设追踪个人等。研究者开发自动评分器,对 18 个当前先进 LLM 的回答进行评测,结果显示模型平均得分 82%,但每十条回答中就有一条得分低于 65%,反映出不准确甚至有害的建议。

研究者提出 HelpBench,用于评估 LLM 能否就数字隐私、安全与网络安全问题给出准确建议。该基准包含 450 道来自真实用户情境的问题,并为每题制定评分标准,评估回答的事实准确性与语气,问题涵盖找回被封账号、硬件安全密钥与双因素认证的取舍、可疑邮件是否为诈骗、施虐者能否通过设备外设追踪个人等。研究者开发自动评分器,对 18 个当前先进 LLM 的回答进行评测,结果显示模型平均得分 82%,但每十条回答中就有一条得分低于 65%,反映出不准确甚至有害的建议。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    评测LLM对真实数字隐私、安全与安保求助的建议是否准确且语气得当。

    LLM 能否就真实的数字隐私、安全与安保(PSS)求助,给出事实准确且语气得当的建议,还缺少面向开放式求助的评测。

    • 求助场景:作者称人们已用 LLM 生成密码、解析隐私政策、修复代码漏洞并做入侵检测,也会问账号找回、双因素认证取舍、可疑邮件是否为诈骗,以及施虐者能否借外设跟踪。作者认为错误建议可能让账号或设备被攻破,或使用户在诈骗中遭受财务损失。
    • 已有证据与缺口:作者援引的工作称,LLM 常常支持或不反驳隐私与安全误解、会生成不安全密码,并在敏感安全话题和漏洞识别上不足。作者认为护栏评测针对违规输出和越狱,PSS 知识或披露评测、账号工具或合成诈骗工作,以及选择题,都还不是消费者 PSS 求助基准。
    • 本文提出的东西:作者构建 HelpBench:九个主题、450 道改写自 Reddit 的开放式问题,每题有专家量表,并用 auto-rater 评 18 个模型、40,500 条回答。
    • 作者为何继续做:作者报告全体平均 82%;摘要写十分之一回答低于 65%,Section 5.2 写该比例为 14%。作者因此认为基准未饱和,因为 PSS 建议需要稳定的高表现。
  2. 有哪些相关研究?

    作者将本文区别于护栏评测、选择题式PSS知识题和2024年人工检查。

    安全护栏与越狱

    • 违规输出:作者把 RealToxicityPrompts、DecodingTrust、HarmBench、JailbreakBench、SafetyBench、TrustLLM 等(论文引用 [13, 50, 30, 44, 6, 56, 19, 35])以及越狱研究([51, 59])归为防止模型输出违反政策或有偏的内容。
    • 与本文的区分:作者称本文看的是诚实用户可能得到的不准确建议,例如错误的恶意软件处理步骤,而不是攻击者引出护栏本会阻止的回答。

    PSS 与其他高风险领域

    • 知识、隐私与披露:论文描述了通用安全知识评测([17, 9])、隐私意识([31, 42]),以及情境适当披露的框架和基准([14, 23, 54, 48]),未逐篇写不足。
    • 求助类基准:作者称医疗([45])和法律 LegalBench([15])已有高风险求助基准,消费者 PSS 建议则没有。Jing 等的 SecBench([20])评账号与安全工具熟练度;Yang 等的 Fraud-R1([52])评多轮合成诈骗识别。作者称本文扩到九个主题,并用开放式问题而不是选择题。
    • 最接近的工作:作者称 Prakash 等([38])在 2024 年人工检查了 900 条 ChatGPT 对 PSS 问题的回答。对比点是:本文用量表和 auto-rater 做持续评测,本次覆盖 18 个模型、40,500 条回答。

    用 Reddit 构建的基准

    • 其他任务:论文提到用 Reddit 数据评虚假预设([55])、阿谀([10])、关系建议([18])和创意写作([40])。作者称 HelpBench 把这一做法延伸到 PSS,并改写问题以保留自然意图、不暴露可识别信息。

    对照与数据

    • 基线:论文没有单独的外部方法基线,而是在 HelpBench 上比较七个家族的 18 个模型版本。题目来自 Thomas 等([49])已标注的 Reddit PSS 帖。量表写法参考评价量表文献([11, 4, 2]);auto-rater 参考 WildBench([25])和 HealthBench([2])。

    作者把本文定位成面向诚实用户、多主题、开放式的 PSS 求助质量评测,用专家量表代替一次性人工检查。

  3. 论文如何解决这个问题?

    从Reddit筛改450题,专家逐题写正负向量表,再用Gemini 2.5 Pro自动评分。

    HelpBench 把 Reddit 上的真实求助改成单轮英文问题,再用逐题量表看回答是否写出关键事实、避开有害说法,以及表达是否贴合问题。评分由 auto-rater 执行。

    选题与标注

    • 来源:2021–2024 年、已被标为与 PSS 相关的 300 万条 Reddit 帖([49]),带九个主题的多标签。每主题先分层随机抽 100 条,再由两名研究者做纳入/排除;任一人排除即不用。附录 A 还要求平衡子主题和复杂度。
    • 规模与主题:最终 450 题,每主题 50 题:Accounts、Moderation tools、Security tools、Privacy tools、Compromise、Platform actions、Scams、Harassment、Data concerns。
    • 分层:长度分短(少于 333 字符)、中(333 至不足 666)、长(666 至不足 1000);超过 1000 字符的不收。每主题每个长度档、是否提到用户已尝试的做法、sensemaking 与 guidance,都至少 10 题。长度自动计算,后两类由一人标注、另一人校验。
    • 边界:只收单轮可答、纯文本、英文的帖。排除没有明确问题、纯关系或治疗性求助、过时技术、要求不当支持或只求别人去举报的帖。作者把多轮、多模态、多语言列为后续工作。

    改写

    • 做法:为降低原帖暴露和被模型记住的风险,并改成更像对 LLM 说话的口吻。Gemini 2.5 Flash 用默认参数出初稿,提示词在附录 B;再人工核对语义,并在可行时改掉姓名、年龄、平台等细节。
    • 与原文的距离:作者报告原文与改写的平均余弦相似度为 0.56,平均 3-gram 重叠为 0.04。

    专家量表

    • 计分:标准分值为 5、3、2 或 1,分正向和负向。正向是应写入的信息,满足才得分;负向是应避免的信息,避开才得分,不是扣分制。每条二元判定。得分等于命中的正向分加上避开的负向分,再除以满分,归一化到 0 和 1。附录 D 的一题满分为 43,示例回答得 24,即 55.8%。
    • 事实标准:六名各有十余年 PSS 经验的研究者起草,一人负责一题初稿,第二名同主题专家校验;同类问题会回看是否奖励同一建议。起草时可参考产品文档、其他网上资料、实测,以及 Gemini 2.5 Flash 按附录 C 生成的草稿,还可看到从六个模型中随机抽的两条回答:GPT 5.0、Claude Sonnet 4、DeepSeek 3.1、Gemini 2.5 Pro、Grok 4、Qwen 3(写作 qwen3-vl-235b-a22b-thinking)。量表只覆盖 PSS,不奖罚关系建议或一般技术支持。
    • 表达标准:每题都加上同一组标准,依据先前对语气、简洁和相关性的评测,以及作者看到的常见问题,例如信息过多。附录 E 的说明涉及关键信息是否靠前、信息或行动项是否超出问题所需、不专业、命令式过强、夸大有效性。完整提示词在附录 B、C、E。

    auto-rater

    • 专家锚点:量表作者先给六个模型之一的一条随机回答打分,再与第二名研究者讨论并解决全部分歧。
    • 自动评分:参照 WildBench 的逐条清单和 HealthBench。评分器对每条标准输出解释和 yes/no。作者按与人工的差异修订表达标准的说明,直到不再看到相关提高。最终用 Gemini 2.5 Pro、temperature 为 0、其余默认参数,与专家评分的 Pearson 相关为 0.85(p < 0.001);事实标准 0.96,表达标准 0.78。
  4. 论文做了哪些实验?

    18个模型平均82%;Table 3中GPT 5.0与GPT 5.3为87%,Qwen 3为67%。

    实验设置

    • 被测模型:七个家族共 18 个:GPT 4.1、GPT 5.0、GPT 5.3;Claude Sonnet 4、Claude Sonnet 4.6、Claude Opus 4.6;Gemini 2.5 Pro、Gemini 3 Flash、Gemini 3.1 Pro;Grok 4、Grok 4.20;DeepSeek 3.1、DeepSeek 3.2;Qwen 3、Qwen 3.6 Plus;GLM 4.6、GLM 5 Turbo、GLM 5.1。有 chat 版本时用 chat,参数为默认。
    • 数据与重复:HelpBench 450 题,九主题各 50。每模型每题 5 次,先按题平均再汇总。每模型 2,250 条,合计 40,500 条。
    • 指标:量表得分,即得到的分数除以满分。Table 3 在每个平均分下方给出五次回答的平均标准差。
    • 评审:全部回答由 Gemini 2.5 Pro auto-rater 按该题量表打分;该模型本身也在 18 个被测模型里。开发阶段每题一条专家评分,用来估计相关,不是对 40,500 条全部人工复评。
    • 统计:版本差异用 Wilcoxon signed-rank;主题差异用 Kruskal-Wallis;是否提及已有做法用 Kolmogorov-Smirnov。论文给出了这些检验的 p 值。
    • 对照:没有外部方法基线。Table 1 每家族只列一个变体;全量在附录 F 的 Table 3。Figure 3–6 是分数分布,文本没有可逐点核对的图内数值。

    主结果

    据 Table 3。五次回答先按题平均。只列 8 个模型,含表中最低的 Qwen 3。

    表格较宽,可左右滑动

    模型总体scamsmoderation tools
    GPT 5.087%93%81%
    GPT 5.387%90%84%
    GPT 4.184%90%78%
    Gemini 3 Flash84%87%82%
    Claude Opus 4.684%90%81%
    Grok 4.2080%89%73%
    GLM 5 Turbo78%83%72%
    Qwen 367%78%62%
    • 表中未列的总体得分(Table 3):Claude Sonnet 4.6 83%、Qwen 3.6 Plus 83%、Grok 4 83%、Claude Sonnet 4 82%、Gemini 3.1 Pro 82%、GLM 5.1 82%、Gemini 2.5 Pro 81%、DeepSeek 3.2 80%、GLM 4.6 80%、DeepSeek 3.1 79%。全体 82%。作者称 GPT 5.0 最高;表中 GPT 5.3 总体同分。
    • 作者称,除 Qwen 3.6 Plus 相对 Qwen 3 提高 16% 外,同家族同规模版本的变化在 -3%(Grok 4 对 Grok 4.20)到 2%(GLM 4.6 对 GLM 5.1)之间,有的版本还下降。作者报告这些版本差异的 Wilcoxon 检验 p < 0.001。规模上,作者称 Claude Opus 4.6 与 Claude Sonnet 4.6 差 1%,Gemini 3 Flash 与 Gemini 3.1 Pro 差 2%(p < 0.001)。
    • 全体主题平均以 scams 为 88%、moderation tools 为 77%(Table 1)。作者报告 17/18 个模型的主题差异 Kruskal-Wallis p < 0.05;最佳与最差主题相差 7%(Gemini 3 Flash)到 15%(Grok 4)。主题均分与四分位距的 Spearman 相关为 -0.73,与中位数为 -0.61(均 p < 0.001)。作者据此称,模型在回答更一致的主题上得分也更高。低于 65% 的回答,从 GPT 5.0 的 156 条到 Qwen 3 的 800 条(各 2,250 条)。摘要写十分之一;Section 5.2 写全部回答的 14%。作者因此认为基准未饱和。

    事实标准与表达标准

    • Table 4 极值:正向事实最高为 Grok 4 的 89%,最低为 Claude Sonnet 4.6 的 75%。负向事实越低越好:GPT 5.0 与 GPT 5.3 为 7%,Grok 4.20 为 13%。正向表达最高为 92%(GPT 5.3、Gemini 3 Flash、Qwen 3),最低为 GPT 4.1 的 75%。负向表达越低越好:GPT 5.3 与 Claude Sonnet 4.6 为 13%,Qwen 3 为 86%。
    • 与正文的差异:作者在讨论 Table 2 的子集时称,GPT 5.0 最能避开负向事实(7%)和负向表达(14%),正向表达满足率却最低(82%);并称 Grok 4.20 漏掉的正向事实最多(79%)。这两句与 Table 4 全表极值不一致。
    • 版本变化:作者报告 Qwen 3 的负向表达损失在 Qwen 3.6 Plus 降到 34%(p < 0.001);Grok 4.20 相对 Grok 4 在两类事实标准上变差(p < 0.001)。

    低分回答

    • 集中失败:作者报告 7% 的问题在全部 18 个模型上平均低于 65%。一题关于把文件拷入加密库后原件是否已安全删除,跨模型平均 53%。作者称回答肯定了加密库,但没有指出拷入并不等于安全删除原件。
    • 作者归纳的行为:高风险情境里只给技术步骤、未按既有安全计划处理;给出不可扩展或代价高的办法;封禁问题上有的模型拒绝协助规避条款,有的把是否违规交给用户;对他人动机作无依据推测;以及相对中性提问升级语气。除 7% 和 53% 外,论文未给各类别的条数。

    其他消融与分析

    • 长度与均分:作者称全体和单模型都无相关;最长问题仍短于 1,000 字符。
    • 已有做法:有无之间的差为 0–3%,仅 5/18 个模型的 Kolmogorov-Smirnov 检验 p < 0.05。
    • sensemaking 与否的差为 0–4%;guidance 与否的差为 0–3%,后者仅 1/18 个模型 p < 0.05。作者认为改进更可能来自主题级事实和表达,而不是这些复杂度维度。
    • 偏度:Fisher-Pearson 偏度从 Qwen 3 的 -1.07 到 GPT 5.3 的 -1.92;超额峰度从 Grok 4.20 的 0.87 到 GPT 5.3 的 5.2。
    • 做法例子:作者举一题冻结账号,量表要求说明短时间多次建号是常见安全标记,并称多数模型回答没有提到;论文未给该题比例。
  5. 有什么可以进一步探索的点?

    作者指出训练暴露、问法差异和平台过时等局限,并建议多模态、多轮与用户测试。

    作者指出的局限与后续方向

    • 训练暴露(Section 6.1):模型可能在训练中见过这些问题或相近变体,从而抬高表现。作者称改写只是部分缓解;专家量表也很少依赖 Reddit 上的建议。
    • 问法不同(Section 6.1):用户若知道对方是 LLM,问法可能不同于在 Reddit 上的问法。
    • 领域会变(Section 6.1):界面和平台功能变化快,写量表时正确的建议可能过时。作者称已去掉必须依赖特定操作系统或应用版本才能答对的题。
    • 量表与专家偏好(Section 6.1):量表惩罚已知的常见有害建议,但不能覆盖每一种误解。专家对语气、结构和表达的评价,也可能不同于非专家觉得有帮助的方式。
    • 交互与语言(Section 3.2、6.2、7):作者把多模态、多轮和多语言列为扩展,并举例截图识别诈骗、危机中的分步指引,以及不是简单翻译、而是更代表本地语言和文化的提问。Section 7 还提出要确定用户需要单轮完整回答,还是多轮追问关键上下文。
    • 量表以外(Section 6.2、7):作者称还需要考虑 PSS 求助里常见的法律、治疗等需求,并把模型接到平台支持和倡导组织。表达标准的相对重要性,以及其他未计入的负向行为,需要用户测试。

    实验覆盖范围

    • 被测为 Section 5 与 Table 3 中的 18 个模型、七个家族;每题 5 次,共 40,500 条;有 chat 版本时用 chat,参数为默认。
    • 题目 450,九主题各 50,英文、单轮、纯文本,长度短于 1,000 字符;来自 2021–2024 年 Reddit PSS 帖并经改写(Section 3)。
    • 评分由 Gemini 2.5 Pro 完成;与每题一条专家评分的 Pearson 相关为 0.85,事实标准 0.96,表达标准 0.78(p < 0.001,Section 4.3)。
    • 论文报告了版本、主题和部分分层因素的检验 p 值,以及五次回答的平均标准差(Table 3)。论文未报告双人编码的一致性系数。
    • 论文未报告 Kruskal-Wallis 中未达 p < 0.05 的那一个模型,也未报告 Section 5.2 各类低分行为的条数。
  6. 总结一下论文的主要内容

    HelpBench评18个模型的450道PSS题:平均82%,作者称长尾含有害建议。

    HelpBench 用来评 LLM 对数字隐私、安全与安保求助的回答是否准确、表达是否得当。

    • 问题:诚实用户会就账号、诈骗、骚扰等向 LLM 求助。作者认为错误建议可能带来账号、财务或人身方面的伤害,而护栏评测和选择题式知识评测盖不住这种开放式、因题而异的建议。
    • 做法:450 道改写自 Reddit 的英文单轮问题,九个主题各 50。PSS 专家为每题写应包含和应避免的事实标准,并加上统一的表达标准。得分是得到的分数除以满分。Gemini 2.5 Pro 按量表评分,与每题一条专家评分的 Pearson 相关为 0.85。
    • 主结果:18 个模型各答 5 次,合计 40,500 条。全体平均 82%(Table 3)。GPT 5.0 与 GPT 5.3 为 87%,Qwen 3 为 67%。全体在 scams 上为 88%,在 moderation tools 上为 77%(Table 1)。Section 5.2 称 14% 的回答低于 65%;7% 的问题在 18 个模型上平均都低于 65%。
    • 作者的结论:作者认为模型已能在多数题上给出高质量建议,但长尾里有不准确甚至有害建议,所以基准未饱和。作者认为改进更可能来自主题事实和表达,而不是问题长度或需求类型;并认为后续要做多轮、多模态、多语言,以及表达标准的用户测试。
阅读原文arxiv.org