全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
通过多语种拒答对齐提升大语言模型安全性
提出覆盖12种欧洲语言的RefusEU数据集,发现仅英语对齐不足以保障跨语言安全,多语种训练可改善安全而不损害通识表现。
- 会议论文ACL 2026
Safety Sidecar:反思驱动的智能体运行时安全控制
通过监控决策轨迹、检索修复案例及外部验证器控制执行,在安全代码生成实验中将安全解答率提高2.9至11.2个百分点。
- 会议论文ACL 2026
认知分析图引导的大语言模型多轮安全增强
提出CogGSE,在推理时结合当前问题的认知分析图与历史安全节点引导回复,实验验证其在多种安全场景中的有效性。
- 会议论文ACL 2026
让训练徒劳:以功能保持型投毒阻止代码数据集未经授权使用
提出FunPoison,仅污染10%的代码数据即可有效干扰训练,保持全部代码可编译且功能正确,并能抵抗多种清洗手段。
- 会议论文ACL 2026
大语言模型中的不完整提示越狱
系统研究不完整有害提示触发的越狱,发现模型往往延迟至句末才拒答,且针对性微调难以跨内容领域和续写类型泛化。
- 会议论文ACL 2026
TRUST:通过不确定性引导与图净化增强社交机器人检测
针对机器人借助欺骗性交互干扰图模型检测的问题,结合不确定性伪标签与图结构净化,在三个数据集和六种骨干网络上提升检测表现。
- 会议论文ACL 2026
XGUARD:大语言模型极端主义内容安全失效分级基准
构建含3840条红队提示的五级风险基准,评测五种模型与两种防御策略,揭示极端主义内容生成中的安全缺口与防御权衡。
- 会议论文ACL 2026
大语言模型能识别“狗哨”暗语吗?
构建含11,150条提示的DogBench,发现表面无害但暗含有害意图的狗哨提示,比同结构的显性有毒提示更易诱发有害输出,风险约为四倍。
- 会议论文ACL 2026
Auto-Stega:智能体驱动的大模型文本隐写策略持续演化
提出自动发现、组合与调整文本隐写策略的框架,并结合分布对齐算法,在高嵌入率下改善困惑度与抗隐写分析表现。
- 会议论文ACL 2026
识别与干预大语言模型的安全关键参数
提出ESI定位安全关键参数,揭示稠密与MoE模型的分布差异,并通过定向更新或保护这些参数增强安全、抑制微调后的安全退化。
- 会议论文ACL 2026
从拒绝到接受:不依赖少量输出词元的模型编辑越狱后门
提出JEST,通过模型编辑将触发后的内部表征从拒绝域转向接受域,较既有编辑方法取得更强越狱效果,并增加模型对直接提示攻击的脆弱性。
- 会议论文ACL 2026
像专家与是专家:拆解大模型谄媚中的权威、语体与文化影响
通过多语言受控评测区分资历与语体的影响,发现部分模型更易迎合高语体表达,且存在跨语言稳定的领域性谄媚弱点。
- 会议论文ACL 2026
对齐与失效:微调如何破坏并恢复大模型安全
比较六种微调方法对四个模型的安全破坏与恢复效果,发现ORPO最善于破坏对齐,DPO最善于恢复对齐,但会牺牲模型效用。
- 会议论文ACL 2026
训练语言模型将Prolog用作工具
研究强化学习训练模型调用Prolog,发现仅奖励正确性会使模型绕过符号推理,而奖励符号结构虽提升可审计性,却牺牲准确率。
- 会议论文ACL 2026
UbuntuGuard:扎根非洲语言文化的AI安全策略基准
基于155名专家编写的对抗查询构建安全策略基准,评测15种模型,发现英语中心基准高估多语言安全,动态策略仍难充分适应本地语境。
- 会议论文ACL 2026
LDEDE:LRP驱动的大模型隐私神经元高效检测与编辑
利用逐层相关性传播定位隐私神经元并按极性编辑,在维持相近通用性能的同时,平均降低隐私泄露风险42.7%至73.5%。
- 会议论文ACL 2026
Chimera:通过判定驱动的异构策略搜索构造组合越狱
将越狱建模为异构策略组合搜索,并用相关性感知指标抑制无关回答造成的成功误判,在多种模型上提高攻击成功率与迁移性。
- 会议论文ACL 2026
MolSafeEval:揭示AI生成分子安全风险的基准
整合毒理数据库与危害规则构建分子安全知识图谱,支持大模型检测和解释危险结构,并为四类分子生成任务提供标准化安全评测。
- 会议论文ACL 2026
修补漏洞:缓解多语言翻译强化学习中的奖励作弊
发现强化学习会放大翻译质量评估模型的漏洞,提出结合词语与语言对齐的WALAR,在1414个翻译方向上优于LLaMAX。
- 会议论文ACL 2026
遗忘之前先学会记忆:重新审视视觉语言大模型遗忘基准
发现现有遗忘基准因初始记忆不足和多跳推理障碍而失真,提出ReMem强化基础记忆,并用Exposure指标衡量信息擦除深度。
- 会议论文ACL 2026
用于少样本模型对齐的激活奖励模型
提出无需微调的激活奖励模型,以少量偏好样例引导激活,在奖励建模及新建奖励作弊基准上取得领先表现,并抵御噪声与虚假奖励信号。
- 会议论文ACL 2026
从神经元理解大模型攻击:定向调优实现精准稳健的漏洞修补
通过相似度梯度归因定位攻击敏感神经元,提出定向神经元调优,在保留通用性能的同时,将多种越狱攻击下的安全率提升至90%以上。
- 会议论文ACL 2026
SilentDrift:利用动作分块隐蔽攻击视觉语言动作模型
利用动作分块中的视觉开环累积扰动,在LIBERO上以不足2%的投毒率实现93.2%的攻击成功率,正常任务成功率保持95.3%。
- 会议论文ACL 2026
知己知彼:以多样数据与指令级思维链防御提示注入
InstruCoT结合多样化合成数据与指令级思维链微调,在四个模型上改善行为偏离、隐私泄露和有害输出防御,且未降低效用。