CredLeak-Bench
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Llama-3.1-8B-Instruct、Claude Sonnet 5、Claude Opus 4.8 等 7 个
- 攻击提示注入
另有 268 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
分析工具型 Agent 判定检索无用却不停止的原因
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出企业级检测系统 ADR,检测编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
用 AGENTDOXX 评测搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
重评 Agent 提示注入检测器,检验基准分数能否预测部署表现
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出 LLMLeak,把机密编进报错 URL,借聊天机器人网页抓取外传
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入
提出 ContextLeak,用强化学习生成恶意工具描述以诱导 Agent 外泄上下文
提出工具调用 Agent 的拒绝钱包攻击及主机侧计费约束
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。