防御arXiv 2610.04504
论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Meta Llama 3.1 8B、DeepSeek-chat、Kimi
另有 268 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
用 MMPIBench 评测智能体框架的多模态提示注入
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。