全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
引用带来鲁棒性:通过引用执行指令防御提示注入
要求模型同时输出答案及其所执行指令的引用,据此过滤偏离原始指令的答案,部分场景攻击成功率降至接近零且效用影响较小。
- 会议论文ACL 2026
RAP-ID:基于指令冒充行为的机制式提示注入检测
融合指令相似性、注意力争夺与潜在风险信号,在首次前向传播中检测提示注入,无需训练或生成文本,且计算开销较低。
- 会议论文ICLR 2026
ASIDE:语言模型中指令与数据的架构级分离
提出ASIDE架构在词嵌入层对数据词元施加正交旋转以分离指令与数据,无需额外参数即显著增强模型对提示注入攻击的防御鲁棒性。
- 会议论文ICLR 2026
VPI-Bench:针对计算机使用智能体的视觉提示注入攻击
构建了首个针对计算机使用智能体的视觉提示注入威胁模型与评测基准VPI-Bench,揭示了黑盒环境下通过屏幕视觉注入诱导智能体执行未授权操作的严重风险。
- 会议论文ICLR 2026
ChatInject:利用聊天模板在LLM智能体中实施提示注入
揭示LLM对聊天模板的依赖漏洞,提出模仿原生模板格式的ChatInject间接提示注入攻击,在多个智能体基准上显著提升了攻击成功率与迁移性。
- 会议论文ICML 2026
多步LLM智能体攻击的因果检测
提出CausalTrace框架,将多步提示注入防御重构为因果推断问题,通过构建结构因果模型并应用do演算,有效区分恶意注入与良性工作流。
- 会议论文ICML 2026
TRAP!面向Web智能体的任务重定向说服评测基准
构建基准TRAP以评估网页界面隐蔽对抗指令对Web智能体的提示注入攻击,发现六款前沿模型平均在25%的任务中易受攻击,揭示了智能体的系统性漏洞。
- 会议论文ICML 2026
定位与消除:基于梯度引导Token抑制抵御视觉提示注入攻击
提出GTM防御方法,通过隐状态梯度范数定位视觉提示注入的关键图像Token并进行掩码抑制,在极低计算开销下将攻击成功率降至接近归零。
- 会议论文ICML 2026
CausalArmor:基于因果归因的高效间接提示注入护栏
针对智能体易受间接提示注入且现有防御开销大的问题,提出CausalArmor框架,基于因果消融检测不可信内容主导偏移并按需触发净化与思维链掩码。
- 会议论文ICML 2026
RedVisor:基于零拷贝KV缓存复用的推理感知提示注入防御
提出RedVisor框架,利用轻量适配器在推理阶段检测注入并引导安全响应,结合零拷贝KV缓存复用消除冗余计算,兼顾检测精度与吞吐量。
- 会议论文ICML 2026
AI 审稿人看到全貌了吗?攻击与防御多模态同行评审
提出 PaperGuard 基准,含多模态评审数据集、针对文本与图表的攻击套件及基于分块嵌入检索的防御;实验表明 AI 审稿人普遍易受攻击。
- 会议论文ICML 2026
安全与保真度权衡:间接提示注入防御的隐性代价
指出间接提示注入防御因抑制不可信文本会破坏翻译等保真任务,构建了SecFid基准以解耦执行、忽略与数据处理行为,揭示了两者间的权衡。
- 会议论文NDSS 2026
利用注意力防御大语言模型间接提示注入攻击
提出Rennervate利用细粒度注意力特征检测并清理间接提示注入,在五个模型和六个数据集上优于15种防御方法。
- 会议论文NDSS 2026
ObliInjection:针对多源数据 LLM Agent 的顺序无关提示注入攻击
在攻击者不知道各数据片段顺序、只控制其中一段的情况下,用顺序无关损失优化注入,在 12 个 LLM 上效果显著。
- 会议论文NDSS 2026
针对 LLM Agent 工具选择的提示注入攻击
ToolHijacker 向工具库注入恶意工具文档以操纵工具选择,显著优于现有攻击,且多种现有防御均不足。
- 会议论文NDSS 2026
当缓存投毒遇上LLM系统:语义缓存投毒及其对策
发现攻击者可通过注入缓存条目操纵他人获得的LLM响应,并提出改进防御机制。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
突破检索障碍:真实环境中的间接提示注入
构造保证恶意内容被检索的触发片段,在RAG和Agent系统中实现高成功率的端到端间接提示注入。
- 会议论文USENIX Security 2026
网络安全日志LLM分析中的上下文污染
展示日志中的被动提示注入可隐藏活动、制造误报并外泄信息,并评估分层防御的缓解效果。
- 会议论文USENIX Security 2026
BadGraph:针对GraphRAG的结构知识隔离攻击
BadGraph通过注入语义中性的文档扰乱知识图拓扑,降低关键证据召回率和GraphRAG问答性能。
- 会议论文USENIX Security 2026
真实世界求职筛选中的提示注入攻击测量
分析约20万份简历,发现约1%含隐蔽提示注入,且多数不含显式指令。
- 会议论文ACL 2025
Task Shield:以任务对齐防御智能体间接提示注入
通过验证指令与工具调用是否服务用户目标,Task Shield 在 AgentDojo 上将 GPT-4o 攻击成功率降至2.07%,任务效用保持69.79%。
- 会议论文ACL 2025
PIGuard:缓解过度防御的提示注入护栏
构建NotInject评测集,发现护栏易因触发词误判无害输入,并提出PIGuard降低此类偏差、改善提示注入检测表现。
- 会议论文ACL 2025
通过语义引导的提示组织实现高效通用目标劫持
提出结合语义采样、排序与迭代优化的提示注入方法,生成可用于任意用户提示的固定后缀,并在四种模型和十类目标响应上验证有效性。