CONTRA:研究者用配置树搜索对个人化 Agent 做红队测试
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
- arXiv
- 2607.03220
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemma4-31b、Gemma4-e4b、GLM-4.7-flash 等 6 个
- 技术自动化搜索
另有 638 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 Search Harness,把间接提示注入做成测试时搜索
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 AgentXploit 红队系统,分离仓库攻击路径发现与运行时利用
提出跨目标课程强化学习,生成间接提示注入以劫持智能体
该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化