评测与基准arXiv 2609.22818
研究测量 LLM Agent 记忆投毒防御的良性场景开销
测量记忆投毒防御在良性对话上的效用与 token 开销
- arXiv
- 2609.22818
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要写时代价落在噪声内。
在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。
测量记忆投毒防御在良性对话上的效用与 token 开销
在没有攻击的对话上,给记忆投毒防御计价,而不是再测一轮攻击是否被挡住。
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出针对 Agent 护栏的推理扩展拒绝服务攻击