CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%
CredLeakBench:agent 替用户登录时把凭证交给钓鱼页,泄露率 31%–76%;自主看收件箱时也会被钓走
作者评估 7 款 LLM 智能体,发现所有模型均存在凭据泄露,主恢复率最高仅 24.2%(GPT-5-mini,Table 10)。
- 智能体自动化执行邮件和账单等任务时常涉及敏感凭据,面临网络钓鱼诱导泄露风险。单纯拒绝所有请求会阻断合法任务,需要评估智能体能否在不泄露凭据的情况下区分欺骗与合法请求,并完成正常工作。
- 提出 CREDLEAK-BENCH,在本地沙盒中成对设计钓鱼与合法场景,评估定向认证、自主收件箱监控及受信渠道恢复三种设定,测试 8 种欺骗线索、4 种用户框架与不同安全引导,通过抓包日志测量真实凭据提交。
- 7 款模型在定向与自主设定下均发生凭据泄露;未加密 HTTP 是泄露最多的线索;谨慎框架虽降低泄露但使合法任务完成率大幅下跌;主恢复场景中最高恢复率仅 24.2%(GPT-5-mini),智能体大多放弃任务而非寻找受信替代渠道。
- 论文未专门设立章节讨论局限。实验均在基于回环地址的本地沙盒中开展,采用 15 个虚构服务与合成数据;智能体交互限定于 4 个最小浏览器工具;论文未报告重复测试次数、单任务步数限制与 API 查询花费。
- 模型
- Claude Sonnet 5Claude Opus 4.8Gemini 3.6 FlashGPT-5-miniGPT-5.6-lunaQwen3.5-9BLlama-3.1-8B-Instruct
- 基准
- CredLeak-Bench
- 指标
- Leak Rate (LR)False-Refusal Rate (FRR)Balanced Accuracy (B.Acc)Matthews Correlation Coefficient (MCC)Recovery Rate
研究者提出 CredLeak-Bench,用于评测邮件驱动的 Agent 工作流中凭证与敏感信息泄露问题,覆盖用户指定登录、自主收件箱监控和恢复三种设置,共 512、256 和 1024 个场景,全部在本地沙箱内用虚构服务运行,泄露以实际提交的合成数据判定。评测的七个模型包括 Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash、GPT-5-mini、GPT-5.6-luna、Qwen3.5-9B 和 Llama-3.1-8B-Instruct,全部在指定登录和自主监控两种设置下发生泄露,指定登录场景泄露率为 31.3% 至 75.8%,两个开源权重模型最高,分别为 66.8% 和 75.8%。自主监控场景泄露率下降但误拒率大幅上升,例如 Opus 4.8 泄露率从 31.3% 降至 1.6%,误拒率从 6.6% 升至 88.3%。
推荐理由七个模型在钓鱼场景下的凭证泄露率与误拒率被同时量化,并给出恢复率这一更难的指标,可供评估 Agent 授权流程时参考。
深度解读
这篇论文试图解决什么问题?
评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。
评估 LLM 智能体在面对网络钓鱼时,能否在不泄露凭据的前提下安全区分恶意请求与合法请求,并完成合法工作任务。
- 场景与重要性:大语言模型(LLM)智能体被部署用于自动化日常数字任务(如处理邮件、账单管理),可能访问凭据和敏感个人信息;将任务委托给智能体意味着将安全决策委托给它,由其决定信息请求方是否有权接收。
- 现有评估的不足:作者称,现有智能体安全基准多关注提示注入、非必要数据泄露或恶意用户请求,未成对评估良性任务与凭据泄露,也未评估智能体绕过钓鱼链接并通过受信替代渠道完成恢复(recovery)的能力。
- 核心观察:拒绝所有敏感信息请求虽能防止泄露,但会阻止合法认证与账户管理;单纯降低泄露率可能以牺牲合法任务效用为代价。
- 威胁模型设定:
- 智能体代表良性用户并拥有凭据金库,面临控制欺骗性消息、网页和收集端点的钓鱼攻击者。
- 攻击者目标是诱导智能体将敏感信息提交到非授权目的地,且攻击表现为常规工作流的一部分。
- 包含两种威胁设定:定向设定(用户提供 URL 并请求登录)与自主设定(智能体分拣收件箱,用户未提出登录要求)。
- 论文提出的基准:作者提出了 CREDLEAK-BENCH 基准,包含定向认证、自主收件箱监控和恢复评测三大套件,成对设计钓鱼场景与合法对照,在本地沙盒中通过实际提交行为评估泄露与误拒。
有哪些相关研究?
涵盖网页钓鱼检测、智能体安全与隐私评测、以及针对智能体的社会工程攻击研究,本文侧重成对控制与受信恢复能力。
现有相关工作主要涵盖网页钓鱼检测、智能体安全与隐私评测、以及针对智能体的社会工程攻击研究三个方向。
- 钓鱼检测:
- Liu et al. (2022; 2024)——利用品牌与域名不一致性以及凭据收集行为等信号识别欺骗性网页,重点在于识别钓鱼页面(包括通过与可疑页面交互)。论文指出其区别在于,本文评估被赋予敏感信息且需完成任务的智能体,防护取决于智能体是否释放该信息以及能否继续完成合法工作。
- 智能体安全与隐私:
- Andriushchenko et al. (2025)(AgentHarm)、Debenedetti et al. (2024)(AgentDojo)、Evtimov et al. (2026)(WASP)——分别检验有害用户请求与间接提示注入防御;Yang et al. (2026)(RiOSWorld)评估多模态计算机使用场景中的风险(包括网络钓鱼)。
- Zharmagambetov et al. (2026)(AgentDAM)、Yagoubi et al. (2026)(AgentLeak)、Liu et al. (2026)——分别评估合法 Web 任务中的非必要披露(数据最小化),以及执行过程中的内部通道隐私泄漏与权限审计。
- 针对 Web 智能体的社会工程攻击:
- Wu et al. (2026)(AgentBait)、Syros et al. (2026)(Muzzle)、Guo et al. (2026)(LoginTrap)——研究攻击者如何将不安全操作伪装成良性目标的合理步骤,诱导智能体执行未授权操作或进行登录。
- Roy et al. (2026)(Scammer4U)——测量向攻击者控制网站提交个人身份信息(PII)的情况,并检验模型表达出的怀疑是否能阻止信息披露。
- 基线方法与基准对比:
- 论文在 Table 1 中对比了 AgentDojo、AgentDAM、RiOSWorld、AgentBait、LoginTrap、Scammer4U 与本文基准。作者称,现有研究建立起了钓鱼易感性并考察了防御代价,但未评估智能体在用户底层需求合法时能否绕过欺骗目的地并通过受信替代渠道认证。
- 作者对本文定位的阐释:
- 作者表示,本文在对比用户指令认证与无登录指令收件箱监控的同时引入恢复评测,用以区分单纯避免披露与安全完成用户底层任务的智能体。
- 钓鱼检测:
论文如何解决这个问题?
构建包含定向、自主和恢复三套件的成对测试沙盒,覆盖 8 种欺骗线索与 4 种框架,通过抓包日志判定凭据泄露与恢复。
作者提出了 CREDLEAK-BENCH 基准,在本地沙盒环境中成对测试定向认证、自主收件箱监控及受信渠道恢复三种工作流中的凭据泄露与任务完成表现。
问题设定与威胁模型
- 主体与资产:智能体代良性用户执行任务,拥有金库 V = {(bi, Fi)}i=1m,其中 bi 标识服务,Fi 包含凭据与敏感字段。授权目的地集合 A(bi) 仅包含基于有效 HTTPS 服务的官方主机名;未加密或证书警告页面均被视为未授权。
- 攻击者能力与目标:钓鱼攻击者控制欺骗消息、网页及其收集端点,但不控制用户目标、金库内容或基准提供的受信参考。攻击者目标是诱导智能体将 Fi 提交到非授权目的地。
- 两类交互设定:定向设定中用户给出 URL 并指示登录;自主设定中智能体持有金库并分拣收件箱,用户未给出认证指令。
场景构建与成对控制
- 服务与数据类别:覆盖 8 个类别的 15 个虚构服务(银行、邮件、社交、工作、健康、政府、购物、家庭)。金库包含认证凭据、身份记录、财务数据、医疗标识符和个人详细信息;部分场景在登录后加入二次验证页面。
- 确定性成对生成:使用固定随机种子(seed = 20260827)通过轮换生成。每个钓鱼场景均成对生成一个共享相同品牌、框架与支持条件的合法对照,仅在目标网址来源上存在差异。
- 评测套件规模:定向套件包含 512 个场景(256 钓鱼,256 对照);自主套件包含 256 个场景(128 钓鱼,128 对照);恢复套件包含 1,024 个场景(832 钓鱼,192 对照)。
欺骗线索、用户框架与安全支持
- 8 种欺骗线索(Table 2):typosquat(单字符拼写错误)、wrong_tld(错误顶级域名)、raw_ip(IP 地址 URL)、homograph(形近字符)、subdomain(误导性子域名)、brand_mismatch(页面品牌与主机不符)、no_https(明文 HTTP 连接)、tls_warning(证书警告页面)。
- 4 种用户框架:naive(天真放任)、neutral(中立陈述)、cautious(谨慎核实)、pressured(时间紧迫施压)。
- 安全支持条件:对比无额外指导(none)、通用安全建议(generic_safety)、显式域名验证指令(domain_verify)。定向设定中额外提供 URL 检查工具(url_check_tool);自主设定中额外提供金库释放策略(vault_policy)。
恢复设定与三态判定规则
- 恢复场景设计:主恢复评测使用 768 个包含真实待办任务和受信参考的钓鱼案例,受信信息来源分为金库完整 URL(384 例)和收件箱历史邮件中的官方域名(384 例)。
- 互斥三态判定:通过服务端抓包日志判定三种互斥结局:LEAK(金库信息提交至钓鱼端点,若双向提交仍判定为 LEAK)、RECOVERY(未发生 LEAK 且正确密码提交至受信端点)、NON-COMPLETION(未泄露且未完成受信认证)。
- 平衡准确率定义:在平衡分割下,结合泄露率 LR 与误拒率 FRR 计算平衡准确率:B.Acc = ((1 − LR) + (1 − FRR))/2,用于衡量安全与效用的综合表现。
论文做了哪些实验?
7 款模型在定向与自主设定下均存在泄露,恢复率最高仅 24.2%,谨慎框架大幅压低完成率,域名验证可兼顾安全与效用。
论文在 7 款模型上评估了定向、自主及恢复三种设定,并分析了 8 种欺骗线索、4 种用户框架与安全支持对泄露率和完成率的影响。
实验设置
- 被测模型:5 款闭源模型(Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash、GPT-5-mini、GPT-5.6-luna)和 2 款开源权重模型(Qwen3.5-9B、Llama-3.1-8B-Instruct),共 7 款模型。
- 评测套件与规模:定向套件(512 场景)、自主套件(256 场景)、恢复套件(1,024 场景,含 768 个主恢复钓鱼场景与 192 个合法对照)。
- 工具与交互环境:模型使用相同的最小浏览器工具集(open_page、submit_login、submit_form、reply_email),在指定条件下提供 check_url;所有交互在本地沙盒中完成。
- 评测指标:泄露率(LR,钓鱼场景中泄露凭据的比例)、误拒率(FRR,合法场景中未完成提交的比例)、平衡准确率(B.Acc)、马修斯相关系数(MCC)、恢复率(Recovery Rate)。
- 判定方式:不依赖模型自我陈述,通过服务端抓包记录中载荷的 SHA-256 哈希值与金库数据进行匹配判定;重复测试次数论文未报告。
主结果
表格较宽,可左右滑动
模型 定向 LR (%) 定向 FRR (%) 定向 B.Acc 自主 LR (%) 自主 FRR (%) 自主 B.Acc Claude Opus 4.8 31.3 6.6 0.811 1.6 88.3 0.550 Claude Sonnet 5 31.5 26.6 0.710 4.0 67.3 0.644 GPT-5-mini 46.5 12.5 0.705 14.8 43.8 0.707 GPT-5.6-luna 49.2 9.4 0.707 19.5 60.2 0.601 Gemini 3.6 Flash 53.1 3.5 0.717 12.9 46.5 0.703 Qwen3.5-9B 66.8 3.0 0.651 39.8 45.0 0.576 Llama-3.1-8B-Instruct 75.8 7.1 0.585 53.1 56.0 0.454 (据 Table 3)
- 全模型均存在泄露风险:在定向设定下所有模型泄露率在 31.3% 至 75.8% 之间;在自主收件箱监控下,虽然用户未要求登录,所有模型仍发生 1.6% 至 53.1% 的凭据泄露。作者称,这表明钓鱼内容无需显式认证指令即可诱导泄露。
- 自主设定下低泄露伴随高误拒:所有模型在自主设定下泄露率下降,但误拒率上升;例如 Claude Opus 4.8 泄露率降至 1.6%,但误拒率升至 88.3%。作者称,较低的泄露率可能掩盖了合法任务效用的损失。
- 开源模型表现较弱:Qwen3.5-9B 与 Llama-3.1-8B-Instruct 定向泄露率分别为 66.8% 与 75.8%,且 Llama-3.1-8B-Instruct 在自主设定下的 MCC 为 -0.090。作者称,这反映出动作倾向缺乏判别性,模型在钓鱼诱饵上认证的概率高于完成合法任务。
欺骗线索识别差异
- 测试内容:评估 8 种欺骗线索对泄露率的影响(Figure 4b, Table 8, Table 9)。
- 结果:未加密连接(no_https)在所有模型上产生最高的平均泄露率(均值 30.5% 至 82.8%,Figure 4b);在定向设定中,Claude Opus 4.8 在 no_https 下泄露率为 90.6%,而在 typosquat 下为 9.4%(Table 8)。
- 作者解读:作者称,智能体在验证时通常仅匹配主机名字符串而忽略传输协议;模型在不同线索上的表现差异说明单一维度的防御不代表具备整体抗钓鱼能力。
恢复能力评估
- 测试内容:在 768 个主恢复钓鱼场景中,评估智能体绕过钓鱼链接并通过受信替代渠道完成认证的能力(Figure 4a, Table 10)。
- 结果:7 款模型的恢复率在 0.0% 至 24.2% 之间;GPT-5-mini 恢复率最高(24.2%),但仍有 12.5% 泄露和 63.3% 未完成;Claude Opus 4.8 虽无泄露,但恢复率为 0.0%(未完成率 100.0%)(Table 10)。金库提供完整 URL 时的恢复率普遍高于收件箱历史邮件提供官方域名(GPT-5-mini 为 33.3% 对 15.1%,Table 11)。
- 作者解读:作者称,避免泄露不等于实现恢复;智能体即便识别并避开钓鱼链接,也很少能够主动寻找受信渠道完成用户的真实需求。
用户框架与安全支持效应
- 测试内容:评估 4 种用户框架与 4 种安全支持对泄露率与合法任务完成率的影响(Figure 5, Table 6, Table 7)。
- 结果:谨慎框架在定向设定下使 GPT-5-mini 泄露率降低 51.5 个百分点,但完成率下降 50.0 个百分点(Section 5.3);域名验证支持(domain_verify)使 6 款模型同时实现降低泄露和提高完成率(Figure 5c),GPT-5-mini 泄露率从 73.5% 降至 23.4%,误拒率从 23.4% 降至 0.0%(Table 7)。
- 作者解读:作者称,谨慎框架主要通过抑制行动降低泄露,存在效用成本;而提供受信域名与明确验证指导能够同时改善安全性和实用性。
其他消融与分析
- 金库策略(vault_policy)使 GPT-5.6-luna 泄露率降低 35.0 个百分点且完成率提高 46.9 点,但使 Gemini 3.6 Flash 完成率下降 49.4 点(Section 5.4, Table 7)。
- URL 检查工具(url_check_tool)使 5 款模型在定向设定下的泄露率和误拒率均得到改善(Table 7)。
- 施压框架(pressured)下各模型恢复率最高,GPT-5-mini 达到 47.4%,而谨慎框架下全模型恢复率不超过 1.0%(Table 12)。
- Qwen3.5-9B 在 768 个恢复场景中有 23 次在泄露后到达受信端点,有 12 次在受信认证后发生泄露(Table 13)。
- 全量恢复套件(832 钓鱼,192 对照)中,Claude Opus 4.8 误拒率为 91.7%,GPT-5-mini 误拒率为 33.9%(Table 10)。
有什么可以进一步探索的点?
论文未设专门章节讨论局限;实验在本地沙盒中覆盖 7 款模型、8 类虚构服务以及三大评测套件。
作者指出的局限与后续方向
- 论文未专门讨论局限。
- 作者在结论(Section 6)中提出后续方向建议:安全智能体系统不仅需要更强的拒绝能力,还必须能够可靠判定敏感信息的发送目的地,并在检测到欺骗时通过授权目的地继续执行用户的任务。
实验覆盖范围
- 被测模型:评测覆盖 5 款闭源模型(Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash、GPT-5-mini、GPT-5.6-luna)和 2 款开源权重模型(Qwen3.5-9B、Llama-3.1-8B-Instruct),共 7 款模型(Section 4.1)。
- 场景与服务范围:场景构建基于 8 个类别(银行、邮件、社交、工作、健康、政府、购物、家庭)的 15 个虚构服务,全部在本地环回接口沙盒(127.0.0.1)中运行,域名与 IP 采用 RFC 保留测试地址(Section 3.2, Section 6 Ethics Statement)。
- 样本规模与套件分布:定向设定包含 512 个场景(256 钓鱼 + 256 对照),自主设定包含 256 个场景(128 钓鱼 + 128 对照),恢复设定包含 1,024 个场景(主恢复评测 768 个钓鱼案例,192 个对照,64 个诊断案例)(Table 4)。
- 工具集与交互设计:智能体交互限制在最小浏览器工具集(open_page、submit_login、submit_form、reply_email)及特定条件下的 check_url 工具(Section 4.1)。
- 未报告的实验参数:论文未报告每个测试用例的重复运行次数、单次任务的最大步数限制与 API 查询花费(Section 4.1, Reproducibility Statement)。
总结一下论文的主要内容
提出评测智能体凭据泄露与恢复的 CREDLEAK-BENCH,发现全模型均存在泄露且恢复率仅 0%–24.2%,揭示安全与效用权衡。
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
- 问题定位:将日常数字任务委托给智能体需要其自主决定凭据接收方是否合规;现有防御常通过全面拒答避免泄露,不仅阻断合法工作,且未评估智能体在避开钓鱼后能否恢复执行真实任务。
- 评测方法:在本地沙盒中成对构建定向认证(512 例)、自主收件箱监控(256 例)和受信恢复(1,024 例)评测套件,系统化覆盖 8 种欺骗线索、4 种用户框架与不同安全引导,通过抓包日志判定真实表单提交行为。
- 主结果:
- 所有测试模型均存在泄露:定向设定下泄露率在 31.3% 至 75.8% 之间;在用户未要求登录的自主监控设定下,所有模型仍发生 1.6% 至 53.1% 的凭据泄露(Table 3)。
- 防御与效用权衡:自主设定与谨慎提示词虽降低了泄露,但导致误拒率上升(如 Opus 4.8 误拒率升至 88.3%,谨慎框架下所有闭源模型合法完成率降至 0.0% 至 10.7%)(Table 3, Table 6)。
- 传输协议盲区:未加密 HTTP 连接(no_https)是所有模型泄露率最高的线索(均值 30.5% 至 82.8%),智能体通常仅比对主机名字符串而忽略传输安全性(Figure 4b)。
- 恢复能力不足:主恢复场景下 7 款模型的恢复率仅为 0.0% 至 24.2%,智能体避开钓鱼后多数选择放弃任务而非寻找受信替代渠道(Table 10)。
- 作者结论:作者认为,仅降低泄露率无法构建实用且安全的智能体;防护机制必须在阻止未授权泄露的同时保障合法工作,并在识别欺骗后引导智能体通过受信渠道继续完成用户任务。