CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
作者指出 BatchNorm 运行统计会把遗忘准确率测低,一次不改权重的 retain 前向即可把表面遗忘翻回来。
BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。
研究者提出 PrivDrift 基准,用于审计用户披露的秘密在对话话题漂移和说服式探测后是否仍可被恢复。
完整解读论文提出 IDUnlearn-Bench,评测 VLM 个体级多模态遗忘。Forget-5 下直接答案抑制常留下身份访问与重构路径。
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。