COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
完整解读
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
提出 SkillSecurer,检测定位并修补智能体技能中的提示注入
完整解读提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
完整解读提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
证明保留词元表示放大模板注入并验证分词缓解