Pretext 攻击绕过 NVIDIA SkillSpector 等 Agent 技能扫描器,成功率最高 97%
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
另有 3 篇论文还没打上分类标签,暂不在筛选结果里。
提出PRETEXT,迭代改写技能文本以绕过扫描并执行木马行为
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出两阶段框架A2M,优化MCP工具元数据与返回载荷以劫持智能体
论文提出了一种针对模型上下文协议(MCP)智能体的两阶段黑盒劫持框架 A2M。
提出APEX,用跨技能进度记录夹带虚假授权劫持智能体
论文针对大语言模型智能体使用多技能串联时的安全隐患,提出对抗性技能链构建框架APEX。
提出SigLeak,从执行轨迹比对中推断专有智能体技能
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击
提出AHA自动科研循环,发现生产级智能体的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出OpenART竞技场,用EMHA演化持久环境以评测智能体安全
提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私
提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示
提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。