WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据
提出 PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
完整解读提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
完整解读提出 DURA,沿扩散潜空间生成自然对抗补丁以劫持 VLA 机器人动作
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
完整解读提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
完整解读提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
完整解读提出 CollageAttack,用空间文本碎片重组越狱文生图模型