全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
别点那里:教 Web Agent 抵御欺骗性界面
提出 DUDE 防御框架和含 1,407 个场景的 RUC 基准,在保持任务表现的同时将 Web Agent 受欺骗界面影响的概率降低 53.8%。
- 会议论文ACL 2026
SharedRequest:与模型无关的 LLM 隐私保护推理
在批次层面把原始提示与噪声变体混合并合并语义等价指令,效用比差分隐私基线高 20% 以上,查询成本最多降低 5 倍。
- 会议论文ACL 2026
安全与效用冲突并非全局:基于注意力头诊断的精准对齐
提出 CAST,通过头级冲突诊断做稀疏微调,跳过少数高冲突注意力头,在不损失安全性的前提下显著减少通用能力下降。
- 会议论文ACL 2026
JPU:通过 on-policy 路径修正连接越狱防御与遗忘学习
发现越狱主要激活中间层未被擦除的参数并形成动态越狱路径,提出 JPU 挖掘 on-policy 对抗样本修正路径,提升对动态攻击的抵抗力并保持效用。
- 会议论文ACL 2026
利用重参数化不变性提升 LLM 越狱攻击的可迁移性
提出基于自然梯度的 RIGJ 框架,按输出分布差异更新 token,跨模型攻击成功率提升 14.9,平均有害度提升 1.23。
- 会议论文ACL 2026
GAMBIT:面向多模态大模型的游戏化越狱框架
把有害视觉语义拆解重组并包装成游戏场景,诱导模型自行重建意图并作答,在 Gemini 2.5 Flash 上攻击成功率达 92.13%。
- 会议论文ACL 2026
谄媚的动态:Video-LLM 谄媚行为的基准与分析
提出首个评估 Video-LLM 谄媚行为的基准 ViSE,并给出关键帧选择与推理时表征干预两种免训练缓解思路。
- 会议论文ACL 2026
通过双路径运行时完整性博弈检测 RAG 提取攻击
提出 CanaryRAG,借鉴栈金丝雀思想在检索块中嵌入 canary token,实时检测知识库泄露,块恢复率显著低于基线且几乎不影响性能。
- 会议论文ACL 2026
MirageBackdoor:诱导“想得对、答得错”推理的隐蔽后门攻击
后门保持思维链正常而只操纵最终答案,可躲过基于过程监控的防御,5% 投毒率下在四个数据集、五个模型上攻击成功率普遍超过 90%。
- 会议论文ACL 2026
当正确信念崩塌:LLM 在临床压力下的认知韧性
提出 Med-Stress 压力测试,发现九个前沿模型在多轮施压下放弃正确诊断,并给出 RBED 推理防御与 R-FT 微调,后者几乎消除信念改变。
- 会议论文ACL 2026
隐私崩塌:良性微调会破坏语言模型的情境隐私
发现良性微调会让模型丧失情境隐私判断,在六个模型上均出现,而标准安全基准上表现依旧良好;机制分析显示隐私表征尤其脆弱。
- 会议论文ACL 2026
UMMF:基于遗忘学习的多模态记忆指纹保护 LVLM 版权
通过遗忘训练样本的邻近样本制造泛化差区域,以记忆强度差异作为隐式指纹验证 LVLM 所有权,比固定触发器更隐蔽、更稳健。
- 会议论文ACL 2026
OS-Sentinel:通过混合验证提升移动 GUI Agent 安全性
提出 MobileRisk-Live 沙箱与基准,以及结合形式化验证器和 VLM 情境判断器的 OS-Sentinel,检测效果比现有方法提升 10%–30%。
- 会议论文ACL 2026
VIGIL:以先验证后提交防御 LLM Agent 的工具流注入
提出 verify-before-commit 防御框架和含 959 个案例的 SIREN 基准,攻击成功率比动态防御降低 22% 以上,受攻击下可用性翻倍。
- 会议论文ACL 2026
CTRAP:嵌入坍塌陷阱以保护 LLM 免受有害微调
指出选择性遗忘易被重新学习绕过,提出在对齐时植入陷阱,一旦微调试图撤销安全对齐就令模型能力坍塌,良性微调不受影响。
- 会议论文ACL 2026
SGT:用安全引导触发器保护开源 LLM 免受恶意微调
刻画安全区域,先优化安全触发器再对齐内部特征,使攻击者需大幅增加数据量才能破坏安全,表征在恶意微调下保持稳定。
- 会议论文ACL 2026
视觉自我实现对齐:用威胁相关图像塑造安全导向人格
在围绕威胁图像构建的中性 VQA 上微调 VLM,无需安全标签,即可降低攻击成功率、缓解过度拒答并保持通用能力。
- 会议论文ACL 2026
Critical-CoT:防御 LLM 推理层后门攻击的稳健框架
针对在思维链中插入恶意推理步骤的后门,通过两阶段微调培养批判性思维,使模型识别并拒绝,对多种后门攻击稳健且可跨域泛化。
- 会议论文ACL 2026
针对提示攻击的防御学到的是表面启发式
发现微调式提示注入防御依赖位置、触发词和话题等表面相关性,导致良性输入被大量误拒,并提供诊断数据集与系统评测。
- 会议论文ACL 2026
DMN:面向多图输入多模态 LLM 的组合式越狱框架
利用多图输入分散指令、提供多模态证据并加入数字链任务,在 GPT-4o、Gemini-2.5-pro 和 Claude Sonnet 4 上攻击成功率超 90%。
- 会议论文ACL 2026
通过推理轨迹重写保护语言模型免遭未授权蒸馏
动态重写教师模型的推理轨迹,既降低其蒸馏价值,又能嵌入可检测的 API 水印,简单指令式重写即有强反蒸馏效果且不降低教师性能。
- 会议论文ACL 2026
XOXO:针对 AI 编程助手的隐蔽跨源上下文投毒攻击
通过语义保持的代码变换污染共享上下文,使助手推荐漏洞代码,对八个模型平均攻击成功率 73.20%,并在 GitHub Copilot 上实证。
- 会议论文ACL 2026
SafeMCP:基于环境前瞻推理的 LLM Agent 主动权力调节防御
服务端插件用世界模型前瞻推理做主动工具过滤和即时干预,在 PowerSeeking Bench、ToolEmu、AgentHarm 上降低风险并保持可用性。
- 会议论文ACL 2026
HarmRLVR:利用可验证奖励实现有害对齐
仅用 64 条无回复的有害提示做 GRPO 即可快速逆转安全对齐,五个模型平均攻击成功率 96.01%,优于有害微调且保持通用能力。