论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
- arXiv
- 2610.04504
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-chat、Meta Llama 3.1 8B、Kimi
另有 62 篇论文还没打上分类标签,暂不在筛选结果里。
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出自演化基准 ActBench,评测协作智能体的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
综述自主渗透智能体的继承攻击、架构攻击及护栏覆盖缺口
这是一篇关于自主 AI 渗透测试智能体的安全综述:用架构和生命周期两轴整理威胁与护栏,不做新的攻击实验。
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出 TempQ-Jail,以查询受限候选排序越狱文生视频模型
待补读全文。
提出 RISE,迭代演化可复用策略对文生图模型做红队