LTBD:用可学习信任边界分隔符防御提示注入
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
- arXiv
- 2610.11634
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- Llama3-8B-Instruct、Llama3.1-8B-Instruct、Falcon3-7B-Instruct 等 4 个
摘要LTBD 只训练四个分隔符嵌入。
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
另有 277 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
把 SynthID 嵌入基因组语言模型采样,并用位置无关检测追溯生成序列
作者在两个六碱基基因组模型的采样里嵌入 SynthID,并让验证者在不知道起点、链和 token phase 时做一次校正后的检出。
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
提出 FlowReview,用授权配对与确定性提交门控控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出 VirusCascade,劫持推荐智能体协同反思以实现定向推广
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出双控多智能体基准 DUMA-Bench,测量对抗环境下的策略违反
DUMA-Bench 把 τ²-bench 的双控交互做成智能体安全评测,用来看策略违反如何随用户、模型和环境一起出现。
提出多智能体系统提示注入的威胁模型与四层架构防御
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出 ALIBI,向恶意二进制注入不执行掩护叙事使分析器误判为良性
ALIBI 是针对 LLM 恶意软件分诊的语义掩护叙事攻击:不覆盖系统指令,而把仍可见的可疑静态证据重释成良性安全产品的预期行为。
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
提出 DEMI 检测框架,在执行前识别 DAO 提案描述与执行载荷的不匹配
Mind the Gap 把 DAO 提案的描述–执行不一致(DEMI)做成可在投票窗口内运行的检测问题。。