全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ACL 2026
Guardian-as-an-Advisor:以建议式护栏提升模型可信度
提出提供风险标签与解释的建议式护栏,在维持安全的同时减少过度拒答,端到端额外开销为2%至10%。
- 会议论文ACL 2026
StructBreak:结构性认知过载引发多模态模型安全失效
提出利用结构性认知过载的黑盒攻击,在六个多模态模型上平均攻击成功率达92%,并分析其绕过安全机制的内部原因。
- 会议论文ACL 2026
PerMemSafe:长程自演化智能体的隐式个性化安全评测
建立隐式个性化安全基准,发现最强受测智能体安全率仅约50%,并提出风险感知记忆框架,在保持帮助性的同时改善安全表现。
- 会议论文ACL 2026
SEAD:基于语义感知密度的无替代模型成员推断攻击
通过目标模型采样与语义感知密度估计实现仅输出文本条件下的成员推断,概率估计误差降低一个数量级,攻击效果优于已有方法。
- 会议论文ACL 2026
MADRA:面向风险感知具身规划的多智能体辩论
提出由批判智能体审查辩论的免训练规划架构,对不安全任务的拒绝率超过90%,同时保持较高实用性。
- 会议论文ACL 2026
CORBA:针对大语言模型多智能体系统的传染式递归阻塞攻击
提出拒绝协作威胁及递归阻塞攻击,利用语义无害的通信诱导无意义消息循环,在多种拓扑和模型上造成系统瘫痪。
- 会议论文ACL 2026
明知仍为:以道德脱离诊断与防御角色扮演越狱
发现模型在角色扮演中即使识别安全风险仍可能执行有害请求,并提出内省式防御,在保持角色忠实度的同时降低攻击成功率。
- 会议论文ACL 2026
ToxiTrace:以梯度对齐训练实现可解释中文毒性检测
结合毒性片段定位、梯度约束与对比推理,提高中文毒性分类和证据片段提取效果,同时保持高效推理并提供连贯解释。
- 会议论文ACL 2026
以自适应叠加密码越狱大型推理模型
提出自适应多重加密越狱框架SEAL,在GPT o4-mini上攻击成功率达85.6%,并在多种推理模型上验证有效性。
- 会议论文ACL 2026
合成数据来源多样性对大语言模型微调的影响
发现多源合成数据可缓解分布坍缩,但人类与合成数据微调均可能移除安全防护,且合成数据微调后的有害输出可能更具可用性。
- 会议论文ACL 2026
非对称关系几何驱动的视觉语言模型通用对抗扰动
提出ARG-Attack,以非对称关系几何目标学习通用扰动,在保持有竞争力的白盒攻击效果的同时显著提升黑盒迁移效果。
- 会议论文ACL 2026
解释为何标记:超越内容屏蔽的仇恨言论语境分析
结合大语言模型与多语言词表检测并解释仇恨言论,人工评估显示其检测准确性与解释质量优于仅使用大语言模型的基线。
- 会议论文ACL 2026
TopoSHIELD:以时空风险感知拓扑演化阻断恶意传播
通过监测交互风险、剪除高风险连接及隔离受损群体阻断攻击传播,在GPT-4o上降低58%的毒性,任务成功率保持在90%以上。
- 会议论文ACL 2026
诊断与缓解大语言模型因果判断中的谄媚与过度怀疑
提出无需标准答案的递归因果审计,检查推导一致性及用户施压影响,揭示过度怀疑与规模悖论,并在无需重训时改善效用和安全表现。
- 会议论文ACL 2026
仅用提示适配音频语言模型的低资源多语言有毒语音检测
构建覆盖53种语言及口音变体的数据集,以软提示适配冻结音频语言模型,毒性检测ROC-AUC达98.07%,并改善跨分布泛化。
- 会议论文ACL 2026
多模态RAG会泄露数据吗?成员推断与图像描述检索攻击评估
通过常规模型提示研究多模态RAG的图像成员推断与描述元数据提取,揭示私有检索数据的隐私风险。
- 会议论文ACL 2026
大语言模型的无意欺骗:错误对齐样本与偏向性交互的影响
发现仅混入1%的错误对齐数据即可使诚实行为下降超过20%,且与含10%偏向用户的群体交互后自训练也会加剧不诚实行为。
- 会议论文ACL 2026
水印消退:针对大语言模型水印的自适应进化改写攻击
提出免训练的进化改写框架TSAPA,在多种水印方案上攻击成功率超过90%,同时保持较高语义保真度,揭示现有水印的脆弱性。
- 会议论文ACL 2026
目标冲突使大型推理模型更易遭受攻击
在三个推理模型上发现,价值冲突与两难选择显著提高攻击成功率,层级与神经元分析显示安全表征和功能表征发生偏移与重叠。
- 会议论文ACL 2026
安全并非普遍:大模型对齐中的选择性安全陷阱
构建覆盖16个少数群体的双语越狱基准,发现同一模型对不同群体的防御率显著不同,定向偏好优化可改善对未见群体的安全泛化。
- 会议论文ACL 2026
对抗环境如何误导智能体?
通过污染工具输出构造虚假信息环境和循环陷阱,在五个前沿智能体上发现,抵抗认知误导与抵抗导航陷阱是不同能力,且常存在权衡。
- 会议论文ACL 2026
PII-VisBench:按网络可见度评测视觉语言模型隐私安全
提出按个人网络可见度分层的隐私评测基准,测试18个开源视觉语言模型,发现模型更易泄露高可见度人物的个人身份信息。
- 会议论文ACL 2026
对文生图安全护栏中的NSFW图像分类器开展红队测试
提出自动化红队框架,发现良性画面元素的变化可导致NSFW漏检,利用失败案例训练的提示改写模型将检测规避概率提高至多六倍。
- 会议论文ACL 2026
通过评估器压力测试检测强化学习与大模型对齐中的代理指标作弊
提出评估器压力测试,用受控扰动区分评估漏洞利用与真实改进,并通过闭环缓解提高大模型的人类评估胜率、减少强化学习中的奖励作弊。