评测与基准arXiv 2610.05586
AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
- arXiv
- 2610.05586
- 发表
- 层
- 应用层
- 被测模型
- GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器