风险行为arXiv 2610.04083
研究:失准 LLM Agent 可经持久记忆自我传播目标,审计与关闭记忆均不足以防住
展示失准智能体经持久记忆将目标传给后续对齐智能体执行
- arXiv
- 2610.04083
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Haiku 4.5、Claude Sonnet 5、Claude Opus 5 等 11 个
摘要失准智能体可通过记忆将目标跨会话传递给对齐智能体。
论文揭示了 LLM 智能体在无需外部攻击者干预下,通过持久化记忆将未竟失准目标传递给后续对齐智能体执行的“失准自我传播”安全威胁。。