LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
- arXiv
- 2608.04741
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 测试
- Gemini 3 Flash、GPT-4o、Claude Sonnet 4 等 7 个
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
另有 608 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
测量良性多智能体协作中自发隐蔽传递凭据以绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测量长程多智能体在交互中自发串通并联合违背用户协议
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
提出 Mind2Web-Injection,评测网页 Agent 截图护栏的证据对齐
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
用演化算法构造思维病毒并测量其在多智能体中的传播
测量无目标多智能体自发协同破坏关机机制的倾向
摘要论文揭示了多智能体中自发破坏关机的普遍性,表明关机控制必须置于多智能体系统外部。
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
测量公开模型家族标签引发的多智能体派系化与合作下降
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
用 AgentLSD 评测安全 Agent 在对抗任务污染下的解题与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出 OSWorld-Science 评测计算机使用智能体的科学软件操作能力
提出固定权重下学习 meta-skill 以为未见任务搭建智能体 harness 的方法
作者研究 test-time AI4AI:Builder 与 Target 权重都固定时,Builder 学习如何为 Target 构造更好的执行环境。