评测与基准arXiv 2610.08871
CredLeak-Bench
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个
- 攻击提示注入
另有 574 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
构建 OpenART 竞技场并以 EMHA 演化环境诱导 Agent 违规
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出持久记忆投毒攻击 PMPA,诱导智能体将外部恶意指令写入记忆并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。