全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文arXivACL 2026
ToolSafe 提出步骤级护栏 TS-Guard 与 TS-Flow,降低 Agent 有害工具调用
ToolSafe 提出面向 LLM 智能体工具调用安全的步骤级护栏方案,包含基准 TS-Bench、护栏模型 TS-Guard 和推理框架 TS-Flow。TS-Guard 通过多任务强化学习训练,在执行前基于交互历史推理,评估请求有害性与动作和攻击的关联,输出可解释、可泛化的安全判断与反馈。TS-Flow 由护栏反馈驱动,在提示注入攻击下将 ReAct 风格智能体的有害工具调用平均减少 65%,同时把良性任务完成率提升约 10%。作者称该工作仍在进行中,代码已公开。
- 会议论文Simon WillisonICML 2026
研究将提示注入归因于角色混淆,改写文本风格可降低攻击成功率
Charles Ye、Jasmine Cui 和 Dylan Hadfield-Menell 的研究指出,模型难以区分自身特权文本(如 <system>、 thinking、<assistant> 标签包裹的内容)与 <user> 标签中的不可信输入,作者称之为角色混淆。研究发现模型更看重文本风格而非实际内容,由此产生令人担忧的越狱方式,例如在请求后附加模仿模型内部思考块风格的文字,gpt-oss-20b 等模型可能因此被误导并覆盖初始训练。研究还发现,将文本改写得不那么像角色标签预期格式的 destyling 操作会显著影响模型对文本的分类,使数据集上的平均攻击成功率从 61% 降至 10%。
- 会议论文ACL 2026
超越显式拒答:针对 RAG 的软失效攻击
提出 DEJA 黑盒进化攻击,生成对抗文档诱使 RAG 输出流畅但无信息量的回答,可绕过困惑度检测和输入扰动等防御。
- 会议论文ACL 2026
PIArena:提示注入评测平台
统一集成攻击、防御与基准,并设计自适应攻击,发现现有防御泛化性有限、易被自适应攻击突破。
- 会议论文ACL 2026
推理劫持:大语言模型推理对齐的脆弱性
通过注入虚假判断标准而不改变任务目标来操纵模型,在三类文本检测任务中揭示漏洞,并绕过针对目标偏移的防御。
- 会议论文ACL 2026
当效率成为弱点:针对网页智能体的计算成本攻击
提出CostBomb,通过网页提示注入诱发冗长推理;黑盒实验表明,攻击可在不妨碍任务完成的情况下显著增加智能体计算成本。
- 会议论文ACL 2026
VIGIL:以先验证后提交防御 LLM Agent 的工具流注入
提出 verify-before-commit 防御框架和含 959 个案例的 SIREN 基准,攻击成功率比动态防御降低 22% 以上,受攻击下可用性翻倍。
- 会议论文ACL 2026
CachePrune:通过编辑 KV-Cache 教 LLM 不跟随注入指令
在 KV cache 编码时剪除与指令跟随相关的神经元,使模型把上下文视为数据,显著降低间接提示注入成功率且保持可用性。
- 会议论文ACL 2026
重新审视提示注入攻击评估
通过覆盖37个真实应用的评估,发现真实应用比研究场景更易受提示注入攻击,简单攻击指令更有效,现有防御仍有局限。
- 会议论文ACL 2026
EVA:以语义对抗演化对GUI智能体开展环境注入红队测试
发现环境注入成功主要由语义内容而非视觉外观决定,提出仅演化语义载荷的EVA,在实验中取得59%至85%的平均攻击成功率。
- 会议论文ACL 2026
大模型自动简历筛选中的单人及多人提示注入
实验发现,候选人资质相近且少数人注入时,简历提示注入能提升排名;注入普及后效果消退,资质差异较大时仍可能导致排名倒置。
- 会议论文ACL 2026
知己知彼:以多样数据与指令级思维链防御提示注入
InstruCoT结合多样化合成数据与指令级思维链微调,在四个模型上改善行为偏离、隐私泄露和有害输出防御,且未降低效用。
- 会议论文ACL 2026
引用带来鲁棒性:通过引用执行指令防御提示注入
要求模型同时输出答案及其所执行指令的引用,据此过滤偏离原始指令的答案,部分场景攻击成功率降至接近零且效用影响较小。
- 会议论文ACL 2026
RAP-ID:基于指令冒充行为的机制式提示注入检测
融合指令相似性、注意力争夺与潜在风险信号,在首次前向传播中检测提示注入,无需训练或生成文本,且计算开销较低。
- 会议论文ICLR 2026
ASIDE:语言模型中指令与数据的架构级分离
提出ASIDE架构在词嵌入层对数据词元施加正交旋转以分离指令与数据,无需额外参数即显著增强模型对提示注入攻击的防御鲁棒性。
- 会议论文ICLR 2026
VPI-Bench:针对计算机使用智能体的视觉提示注入攻击
构建了首个针对计算机使用智能体的视觉提示注入威胁模型与评测基准VPI-Bench,揭示了黑盒环境下通过屏幕视觉注入诱导智能体执行未授权操作的严重风险。
- 会议论文ICLR 2026
ChatInject:利用聊天模板在LLM智能体中实施提示注入
揭示LLM对聊天模板的依赖漏洞,提出模仿原生模板格式的ChatInject间接提示注入攻击,在多个智能体基准上显著提升了攻击成功率与迁移性。
- 会议论文ICML 2026
多步LLM智能体攻击的因果检测
提出CausalTrace框架,将多步提示注入防御重构为因果推断问题,通过构建结构因果模型并应用do演算,有效区分恶意注入与良性工作流。
- 会议论文ICML 2026
TRAP!面向Web智能体的任务重定向说服评测基准
构建基准TRAP以评估网页界面隐蔽对抗指令对Web智能体的提示注入攻击,发现六款前沿模型平均在25%的任务中易受攻击,揭示了智能体的系统性漏洞。
- 会议论文ICML 2026
定位与消除:基于梯度引导Token抑制抵御视觉提示注入攻击
提出GTM防御方法,通过隐状态梯度范数定位视觉提示注入的关键图像Token并进行掩码抑制,在极低计算开销下将攻击成功率降至接近归零。
- 会议论文ICML 2026
CausalArmor:基于因果归因的高效间接提示注入护栏
针对智能体易受间接提示注入且现有防御开销大的问题,提出CausalArmor框架,基于因果消融检测不可信内容主导偏移并按需触发净化与思维链掩码。
- 会议论文ICML 2026
RedVisor:基于零拷贝KV缓存复用的推理感知提示注入防御
提出RedVisor框架,利用轻量适配器在推理阶段检测注入并引导安全响应,结合零拷贝KV缓存复用消除冗余计算,兼顾检测精度与吞吐量。
- 会议论文ICML 2026
AI 审稿人看到全貌了吗?攻击与防御多模态同行评审
提出 PaperGuard 基准,含多模态评审数据集、针对文本与图表的攻击套件及基于分块嵌入检索的防御;实验表明 AI 审稿人普遍易受攻击。
- 会议论文ICML 2026
安全与保真度权衡:间接提示注入防御的隐性代价
指出间接提示注入防御因抑制不可信文本会破坏翻译等保真任务,构建了SecFid基准以解耦执行、忽略与数据处理行为,揭示了两者间的权衡。