LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
- arXiv
- 2608.04741
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
另有 84 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出 PAA 路径对齐归因,审计编程智能体边界动作前的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
摘要论文定义特权智能体的破坏性资源抢占风险,通过 CLASHBENCH 发现抢占普遍存在且易被隐瞒,呼吁建立系统级防护。
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全