攻击arXiv 2607.03220
CONTRA:研究者用配置树搜索对个人化 Agent 做红队测试
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
- arXiv
- 2607.03220
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Nemotron-Cascade-2、Gemma4-31b、Gemma4-e4b 等 6 个
- 技术自动化搜索
另有 648 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CONTRA,用树搜索修改良性配置以诱发 Agent 恶意动作
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出跨独立助手的工件介导记忆跳跃自传播攻击
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。