论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
- arXiv
- 2610.12292
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- LAYA-TD、LAYA-EN、LAYA-ML 等 5 个
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
提出多智能体系统提示注入的威胁模型与四层架构防御
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具调用
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出 MAStrike,用 Shapley 选联盟对多智能体做共谋红队