其他arXiv 2609.12413
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
系统梳理智能体执行链路中的越狱攻击与防御并比较推理时防御
- arXiv
- 2609.12413
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Qwen3.5-4B、Llama-3.1-8B-Instruct
摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。