全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 21 条- 会议论文ACL 2025
间接提示注入攻击能被检测并移除吗?
构建间接提示注入评测数据集,评估现有及专门训练的检测模型,并比较分段删除与指令抽取两类注入移除方法。
- 会议论文ACL 2025
利用攻击技术防御提示注入
将免训练提示注入技术反向用于强化原始指令,构建防御方法,实验表明其效果优于现有防御方案。
- 会议论文ACL 2025
高效但脆弱:LLM 批量提示攻击的评测与防御
构建 BatchSafeBench,发现所有 LLM 都易受批量提示中注入指令的干扰;基于探针的检测准确率约 95%,并分析了相关注意力头。
- 会议论文ACL 2025
大语言模型中的提示威胁:系统提示与用户提示视角
综述提示泄露与提示越狱等攻击方法,总结其实验设置,并探讨提示威胁与提示注入攻击之间的关系。
- 会议论文ACM CCS 2025
SecAlign:用偏好优化防御提示注入
- 会议论文ACM CCS 2025
FlippedRAG:针对 LLM 检索增强生成的黑盒观点操纵攻击
- 会议论文ACM CCS 2025
AI 蠕虫来了:阻止对抗性自我复制提示在 GenAI 生态中传播
- 会议论文ICLR 2025
大语言模型能否分离指令与数据?
针对LLM因无法分离指令与数据而易受间接提示注入攻击的风险,提出指令与数据分离的形式化度量与SEP基准,实证发现主流模型均无法有效实现二者分离。
- 会议论文ICLR 2025
面向大语言模型的对抗性搜索引擎优化
提出偏好操纵攻击,利用精心设计的网页内容或插件文档诱导大模型偏袒攻击者产品并贬低竞争对手,在必应等真实大模型搜索与插件中验证了威胁。
- 会议论文ICLR 2025
指令分段嵌入:利用指令层级提升LLM安全性
提出指令分段嵌入技术将指令优先级直接融入模型架构,使模型能显式区分并优先处理高优先级指令,显著增强了抵御恶意提示注入的能力。
- 会议论文ICML 2025
角色分离的假象:LLM 角色学习中的隐藏捷径及修复
发现微调模型靠任务类型和靠近文本起始位置这两种代理区分角色,提出调整 position ID 以强化角色边界的不变信号。
- 会议论文ICML 2025
Gandalf the Red:面向 LLM 的自适应安全
提出 D-SEC 威胁模型,并借众包红队平台 Gandalf 收集 27.9 万条提示攻击,发现系统提示类防御会损害可用性,限定领域与纵深防御更有效。
- 会议论文ICML 2025
MELON:针对 AI Agent 间接提示注入攻击的可证明防御
通过用掩码用户提示重新执行 Agent 轨迹,比较动作相似度来检测间接提示注入,在 AgentDojo 上攻击防御与效用保持均优于已有防御。
- 会议论文NeurIPS 2025
ReliabilityRAG:面向 RAG 网页搜索的可证明鲁棒防御
利用文档可靠性信号,通过在矛盾图上求最大独立集筛除恶意文档,并给出可证明鲁棒性保证;对检索语料攻击的鲁棒性优于已有方法且保持良性准确率。
- 会议论文NeurIPS 2025
WASP:Web Agent 抗提示注入安全基准
提出端到端评测基准 WASP,发现顶级模型也会被简单人工注入欺骗,攻击部分成功率高达 86%,但完整达成攻击目标的情况较少。
- 会议论文NeurIPS 2025
DRIFT:基于动态规则与注入隔离的 LLM Agent 防护
提出 DRIFT 框架,用安全规划器、动态验证器和注入隔离器约束 Agent 的控制与数据流,在 AgentDojo 和 ASB 上兼顾安全与效用。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
StruQ:用结构化查询防御提示注入
将提示与数据分为两个通道,并微调模型只遵循提示部分的指令,显著提升对提示注入的抵抗力,对效用几乎无影响。
- 会议论文USENIX Security 2025
Machine Against the RAG:用阻断文档干扰检索增强生成
向知识库加入单个阻断文档即可让 RAG 拒绝回答特定查询,且无需指令注入或知道目标模型;现有安全指标无法衡量此脆弱性。
- 会议论文USENIX Security 2025
TracLLM:长上下文 LLM 归因的通用框架
提出上下文溯源框架,定位长上下文中导致输出的文本,可用于提示注入等攻击的事后取证,效率与准确性优于现有归因方法。
- 会议论文USENIX Security 2025
自解释对抗图像
提出针对视觉语言模型的跨模态间接注入攻击,图像内含隐藏元指令,可操控模型回答的风格与观点。