论文提出选项通道攻击:改一个选项标签即可让 Agent 护栏放行违规操作
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
- arXiv
- 2610.12292
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 被测模型
- LAYA-TD、LAYA-EN、LAYA-ML 等 5 个
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
另有 196 篇论文还没打上分类标签,暂不在筛选结果里。
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 AgentTracer,事后定位间接提示注入的注入点并重建攻击链
提出 MFOTL 离线时序验证以监控工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 ASPIRE 行为图搜索,开放式发现 Agent 提示注入漏洞
ASPIRE 是给搭建方用的智能体提示注入红队引擎,目标是开放式画出可利用的行为路径,而不是在固定任务上打磨一条载荷。
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 SkillPoison,用局部有效的成功经验诱导自进化 Agent 形成过度泛化技能
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出 PERSISTBD,发布前强化供应链后门使其经良性 SFT 与 RL 后仍外发凭据
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
用因果追踪区分间接提示注入中的角色可读性与有效干预
在权重固定的白盒模型上,源角色可以先被读出。沿相关方向的编辑是否改变行为,要在目标位点上另测。。
提出服务方间接提示注入,把主动智能体的决策协助转向预选目标
外部提供者只控制与自身目标关联的内容,就可以把良性主动个人智能体的协助转向该目标。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
评估应用决策层的输入注入与隐私推断风险
Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。