CredLeak-Bench
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 被测模型
- Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个
- 攻击提示注入
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
用 Dmax 与尾部损失评测后门修复的类别性能保持
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
比较标签翻转与后门投毒对图像分类器的影响
Khan 与 Abusaqer 在两个图像分类基准上比较了两种训练时投毒。
诊断 BatchNorm 架构下机器遗忘评测的归一化伪影
BN illusion 是作者对近似机器遗忘评测中一种 BatchNorm 测量伪影的命名:不改权重、只用 retain 数据重算运行统计,就可以把表面遗忘准确率翻过来。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
用代价曲线评估恶意微调防御在持续训练下的衰减
摘要论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
提出 BackdoorVLM 基准,评测视觉语言模型微调中的后门攻击与防御
BackdoorVLM 是作者提出的 VLM 后门攻击与防御评测基准,作者称它是首个此类综合基准。
提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性
摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。