全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2025
Task Shield:以任务对齐防御智能体间接提示注入
通过验证指令与工具调用是否服务用户目标,Task Shield 在 AgentDojo 上将 GPT-4o 攻击成功率降至2.07%,任务效用保持69.79%。
- 会议论文ACL 2025
Con Instruction:通过非文本模态通用越狱多模态大模型
提出通过对抗图像或音频传递有害指令的灰盒攻击,在多种视觉与音频语言模型上绕过安全机制,并发现现有防御存在明显缺口。
- 会议论文ACL 2025
PIGuard:缓解过度防御的提示注入护栏
构建NotInject评测集,发现护栏易因触发词误判无害输入,并提出PIGuard降低此类偏差、改善提示注入检测表现。
- 会议论文ACL 2025
面向文生图模型的多模态语用越狱
利用单独安全的图像与文字组合形成有害含义,九种文生图模型的不安全生成率约为10%至70%,常见过滤器未能有效防御。
- 会议论文ACL 2025
从无害到有害:通过对抗隐喻越狱语言模型
提出AVATAR框架,诱导模型将无害隐喻校准为有害内容,在多个先进模型上展示较高攻击成功率与跨模型迁移能力。
- 会议论文ACL 2025
大语言模型的逐步推理扰乱攻击
提出SEED攻击,在先前推理步骤中隐蔽注入错误而不修改指令,在四个数据集和四种模型上诱导后续推理与最终答案出错。
- 会议论文ACL 2025
通过语义引导的提示组织实现高效通用目标劫持
提出结合语义采样、排序与迭代优化的提示注入方法,生成可用于任意用户提示的固定后缀,并在四种模型和十类目标响应上验证有效性。
- 会议论文ACL 2025
冰山之尖:揭示大语言模型的提示内任务对抗攻击
提出将序列转换任务嵌入提示以间接构造违规输入的TIP攻击及PHRYGE基准,实验表明该攻击可绕过六种先进语言模型的安全防护。
- 会议论文ACL 2025
评估大模型被滥用于生成个性化虚假信息的漏洞
评测开放与闭源模型生成个性化虚假新闻的行为,发现多数模型安全过滤不足,个性化要求还会降低过滤触发率,形成越狱效果。
- 会议论文ACL 2025
越狱?一步就够了!
提出将攻击意图伪装成防御任务的 REDA,结合少量上下文示例实现单次迭代越狱,并在开源和闭源模型上优于现有方法。
- 会议论文ACL 2025
大语言模型水印能否可靠防止未经授权的知识蒸馏?
研究蒸馏前改写与蒸馏后水印中和,发现定向改写和推理时中和均可消除继承水印,后者还能保持知识迁移效率与较低计算开销。
- 会议论文ACL 2025
少量查询下针对黑盒模型的多任务对抗攻击
提出利用跨任务迁移性的 CEMA 黑盒攻击,仅需100次查询即可取得显著攻击效果,并可攻击商业翻译接口、语言模型和图像生成模型。
- 会议论文ACL 2025
通过多模态联动越狱大型视觉语言模型
MML通过跨文本与图像的编码及隐蔽引导降低恶意意图暴露,在三个安全基准上对GPT-4o取得约99%的攻击成功率。
- 会议论文ACL 2025
VLMInferSlow:视觉语言模型服务的效率鲁棒性评测
在黑盒条件下生成带有不可感知扰动的对抗图像,使视觉语言模型推理计算成本最高增加128.47%。
- 会议论文ACL 2025
M2S:将多轮越狱转化为单轮攻击
将多轮越狱对话重构为单轮提示,攻击成功率达70.6%至95.9%,最高比原攻击增加17.5个百分点,平均令牌用量减少逾半。
- 会议论文ACL 2025
利用对抗反馈开展实时事实性评估
利用检索增强检测器的反馈迭代改写实时新闻,生成欺骗性样本,使GPT-4o检测器的ROC-AUC下降17.5个百分点。
- 会议论文ACL 2025
披着羊皮的狼:大语言模型能识别隐喻式隐性仇恨吗?
结合越狱与能量约束解码生成隐喻式隐性仇恨言论,发现GPT-4o及专用安全模型常将其误判为无害内容。
- 会议论文ACL 2025
理解大语言模型面对社会偏见攻击的脆弱性
评测多种诱导偏见的攻击及其迁移性,发现模型通常更易受性别偏见攻击,较大模型与预训练基础模型也往往更脆弱。
- 会议论文ACL 2025
间接提示注入攻击能被检测并移除吗?
构建间接提示注入评测数据集,评估现有及专门训练的检测模型,并比较分段删除与指令抽取两类注入移除方法。
- 会议论文ACL 2025
利用攻击技术防御提示注入
将免训练提示注入技术反向用于强化原始指令,构建防御方法,实验表明其效果优于现有防御方案。
- 会议论文ACL 2025
引导而非强迫:移除多余约束提升越狱攻击迁移性
分析并移除梯度越狱优化中的多余约束,将跨模型攻击成功率从18.4%提升至50.3%,同时改善攻击行为的稳定性与可控性。
- 会议论文ACL 2025
大语言模型面对纵向排列文本操纵的脆弱性
发现纵向排列文本显著降低模型分类准确率,带来绕过有害内容检测的潜在风险;思维链无助于缓解,而结合细致分析的少样本学习有效。
- 会议论文ACL 2025
SATA:通过简单辅助任务链接实现 LLM 越狱的新范式
先遮蔽恶意查询中的有害关键词,再用简单辅助任务编码其语义完成越狱;在 AdvBench 上 ASR 最高达 85%,优于基线。
- 会议论文ACL 2025
通过意图隐藏与转移探索 LLM 越狱攻击
提出黑盒越狱方法 ICE 和评测集 BiSceneEval,单次查询即达高攻击成功率并具跨模型迁移性,暴露现有防御的关键漏洞。