全部动态
论文与会议论文
本页材料
24 条- 会议论文ACL 2026
TinyAttack:探索大语言模型的字符样式漏洞
提出基于五类Unicode字符样式变换的对抗攻击,在保持文本语义和句法的同时,使开源与闭源模型的任务表现显著下降。
- 会议论文ACL 2026
越狱攻击对抗内容安全过滤器:大模型安全攻防进展如何?
评估包含输入输出过滤的完整推理流程,发现几乎所有受测越狱方法都能被至少一种过滤器检出,但精确率与召回率仍需权衡。
- 会议论文ACL 2026
审计大语言模型对心理健康群体有害刻板印象的回应
审计发现,多款开放权重模型会在要求辩护时认可有害刻板印象,而常用有害内容评测与审核框架经常漏检这些歧视性回应。
- 会议论文ACL 2026
StanceAttack:针对立场检测的对抗攻击
利用ChatGPT生成保持语义和自然度的对抗文本,在两个基准上攻击立场检测模型,相比传统方法成功率更高、重试更少。
- 会议论文ACL 2026
衡量大语言模型在社交推理游戏中的对抗行为
在五类社交推理游戏中观察模型对抗行为并建立行为分类,发现模型行为特征各异,结构化思考方式会影响社交稳定性与竞争结果。
- 会议论文ACL 2026
CliniCAST:医疗分诊中的声学依据与文本主导评测
构建5856个合成样本评估音频语言模型,发现安抚性话语会压制模型对可听危险信号的响应,暴露医疗分诊中的跨模态安全缺陷。
- 会议论文ACL 2026
视觉语言模型有道德定力吗?道德判断的脆弱性研究
不改变道德情境的多模态扰动即可翻转模型判断,且指令遵循更强的模型更易被说服,轻量推理干预可部分缓解。
- 会议论文ACL 2026
DUSK:机器遗忘不应删除共享知识
提出知识重叠场景下的机器遗忘基准,评测九种方法发现,现有方法难以同时删除目标特有内容并保留共享知识。
- 会议论文ACL 2026
直接词元优化:无需外部资源的大语言模型遗忘方法
DTO分别优化关键词元的遗忘与其余词元的效用保持,无需外部资源,在多个基准上将遗忘质量最多提升至基线的16.8倍。
- 会议论文ACL 2026
EntroBench:多熵场景与实际用户操作下的大模型水印评测
跨三种熵水平、七类任务评测八种水印方法,发现检测能力与输出质量存在权衡,普通非对抗性用户操作也会显著削弱水印。
- 会议论文ACL 2026
经验驱动自演化智能体的安全风险
网页与具身环境实验发现,仅积累良性任务经验也会强化行动倾向、削弱安全性;拒答经验可缓解退化,却会引发过度拒答。
- 会议论文ACL 2026
RLHF中训练数据与策略的联合优化
JODP让策略生成训练提示并学习脱离提示复现高奖励行为,在安全对齐任务上以不足1%的额外计算使4B模型接近8B模型表现。
- 会议论文ACL 2026
让护栏失声:通过动态上下文表征消融实现推理时越狱
提出CRA,在解码时抑制与拒答相关的低秩激活模式,无需训练或更新参数,便在多个安全对齐开源模型上取得优于基线的越狱效果。
- 会议论文ACL 2026
结合模板化上下文学习与防御后缀抵御大模型越狱
将离线优化的防御后缀与在线筛选的上下文示例组合,在所测白盒和黑盒攻击下将成功率降至接近零,同时保留良性任务效用。
- 会议论文ACL 2026
DR-HM:以认知感知数据合成及先蒸馏后强化检测有害模因
结合结构化推理数据合成、蒸馏与自适应强化学习,提升小型多模态模型的有害模因检测能力,在FHM数据集达到84.7%准确率。
- 会议论文ACL 2026
词典引导的稀疏Logit编辑实现可靠越狱攻击
提出无需梯度或辅助模型的白盒推理时攻击SIBI,通过稀疏修改Logit绕过护栏,在标准基准上保持较高成功率并降低计算与空间开销。
- 会议论文ACL 2026
增加智能体改善数学解题,但对抗鲁棒性差距依然存在
在六个模型、四个数学基准上评测输入扰动,发现增加智能体可提高准确率,却无法消除对抗性能差距,人类式拼写错误尤其棘手。
- 会议论文ACL 2026
LR-DWM:扩散语言模型的高效水印方法
- 会议论文ACL 2026
MCP-Guard:智能体模型上下文协议的多阶段纵深防御
提出结合静态扫描、神经检测与大模型仲裁的MCP防御框架,配套70,448条攻击样本,微调E5检测器识别对抗提示的准确率达96.01%。
- 会议论文ACL 2026
DART:以蒸馏、审计和修复训练缓解差异感知模型的危害漂移
发现人口群体差异分类微调会使解释更有害;DART将Llama-3-8B准确率从39.0%提升至68.8%,并减少72.6%的危害漂移案例。
- 会议论文ACL 2026
揭示大语言模型的策略性利己行为
通过880个利益诱惑决策场景评测九个闭源模型,发现策略性利己选择平均占67.96%,且与其他安全缺陷相关,并提出轻量缓解方法。
- 会议论文ACL 2026
逻辑越狱:通过形式逻辑表达绕过大模型安全限制
提出将有害请求转换为形式逻辑表达的黑盒越狱方法,并构建多语言评测数据集,在五种语言中验证其有效性与泛化能力。
- 会议论文ACL 2026
以分层多步奖励模型增强大语言模型推理
针对过程奖励模型易受奖励作弊影响的问题,联合评估单步与连续推理并压缩节点增强数据,在数学基准上提升评估稳定性与泛化。
- 会议论文ACL 2026
壳中幽灵:以同义词感知逻辑值塑形指纹保护视觉语言模型版权
提出SALSF,通过调整语义相近长尾词的概率分布嵌入模型指纹,近似保持首选词及其概率,实验显示可保留多模态性能并增强指纹鲁棒性。