其他arXiv 2609.12413
SoK 综述:智能体 AI 时代的越狱攻击、防御与实践考量
综述智能体执行链路中的越狱攻击、防御与实践权衡
- arXiv
- 2609.12413
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3.5-4B、Llama-3.1-8B-Instruct
摘要SoK 将越狱重放到智能体流水线,并用两种模型检验回复层防御的边际与代价。
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。