CredLeak-Bench
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
- arXiv
- 2610.08871
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Llama-3.1-8B-Instruct、Claude Sonnet 5、Claude Opus 4.8 等 7 个
另有 289 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
提出企业级智能体检测系统 ADR,检测提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。
测量编程智能体被诱导或为奖励而篡改自身执行轨迹
这是一项针对本地大模型智能体执行轨迹完整性与安全防篡改边界的实证研究。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 ContextLeak,用强化学习生成恶意工具描述以诱导 Agent 外泄上下文
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
提出 ActGuard,在执行前审计并遮盖诱发动作偏离的间接注入
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差
摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。