BRANCH 方法绕过 6 套多扫描器护栏系统
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
- arXiv
- 2610.10742
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- Meta Llama Guard 3 8B、Meta Llama Guard 7B、Meta Llama Guard 3 1B 等 18 个
另有 444 篇论文还没打上分类标签,暂不在筛选结果里。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出对抗重构,仅改表述以拉高 AI 审稿分数
摘要揭示 AI 审稿系统易受纯表述重构操纵,建议在部署前解耦科学与写作评价。
提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息
摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。
提出 CAVEAT 基准,评测购物 Agent 在商业引导下的决策偏离
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 CredLeak-Bench,评测 Agent 在钓鱼登录与收件箱中的凭据泄露
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 DrivingBench 评测视觉语言模型的真车闭环驾驶
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
提出 RA-Det,利用鲁棒性不对称检测 AI 生成图像
RA-Det 是合成图像检测器,用扰动下的表示稳定性差异代替外观痕迹。
提出 ControlPed,生成可控行人危险场景评测端到端驾驶模型
提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。
评测文本守卫与激活探针能否发现 VLA 隐含危害指令
提出 Inspect Robots,在真实机器人上评测具身智能体的能力与安全
提出操作有效性契约,审计激活监控的告警策略
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。