CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
CREDLEAK-BENCH 评估了 LLM 智能体在处理邮件工作流时的凭据泄露与受信恢复能力,揭示了当前模型在安全防护与合法效用之间的权衡。
提出Trojan Hippo Bench,评测智能体持久记忆攻击与防御
用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性
构建AGENTDOXX评测联网搜索智能体对匿名访谈的再识别能力
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建AGENTTELL基准,测量浏览器智能体跨站行为侧信道泄露