全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
LoRA为何难以遗忘:用正则化低秩适配消除语言模型后门
发现LoRA难以清除后门主要源于谱强度不足和谱对齐不佳,提出RoRA,在保持正常准确率的同时显著降低攻击成功率。
- 会议论文ACL 2026
SycoBench-600:评测大模型助手的谄媚与选择性纠错
构建600题基准评测七款助手在社会压力下的谄媚与纠错表现,发现愿意改变答案并不意味着能区分正确与错误建议。
- 会议论文ACL 2026
SafeMERGE:通过选择性逐层合并保留微调模型的安全对齐
根据余弦相似度选择性合并微调模型与安全对齐模型的层,在四款大模型和多项任务中减少有害输出,且基本不损害任务效用。
- 会议论文ACL 2026
用大语言模型重写裸指针,让C转译的Rust代码更安全
提出PR2,以决策树提示和代码变更分析引导裸指针替换与错误修复,在28个真实C项目的转译代码中消除18.57%的局部裸指针。
- 会议论文ACL 2026
MedRedFlag:大模型如何纠正真实健康咨询中的错误前提
构建逾1100个需纠正错误前提的健康问题并对比模型与临床医生回答,发现模型即使识别出错误前提,也常未能纠正提问方向。
- 会议论文ACL 2026
RubRIX:用评估量规降低照护者与AI互动中的风险
提出经临床人员验证的五维风险量规,在逾两万条照护咨询上评测六款模型,量规引导的一轮改进使各风险分量降低45%至98%。
- 会议论文ACL 2026
多语言模型有害内容缓解策略综述
系统梳理多语言模型的有害内容度量与缓解方法,涵盖训练、编辑、解码、对齐及数据策略,并讨论数据稀缺和跨文化评估等挑战。
- 会议论文ACL 2026
PRA-RAG:抵御检索内容投毒的可证明鲁棒聚合
通过检索文本组合采样与嵌入空间几何结构实现鲁棒聚合,给出投毒影响的理论界限,实验中攻击成功率最低降至1%,准确率保持71%。
- 会议论文ACL 2026
越狱场景下的水印评测:攻击成功率虚高与目标服从度错位
评测六种水印方法与四款模型,发现水印可能抬高裁判判定的越狱成功率,却未同步提高有害目标服从度,提示需补充人工和目标服从评估。
- 会议论文ACL 2026
SAFER:通过高效事前推理增强安全对齐
将初始评估、规则验证与路径校准融入推理,通过合成轨迹微调和步骤级偏好优化,在多个开源模型上提升安全性并保持有用性与响应效率。
- 会议论文ACL 2026
再想一遍,让大语言模型更安全、更有帮助
提出SaRO,通过推理风格预热与自反思过程优化强化安全反思和纠错,在实验中比现有推理式对齐方法更好地兼顾安全与有用性。
- 会议论文ACL 2026
FigSIM:自杀主题表情包的严重程度与修辞语言数据集
构建1049张自杀主题表情包的数据集并评测16个模型,发现模型容易低估高严重程度内容,尤其在使用修辞表达时,揭示内容审核难点。
- 会议论文ACL 2026
忠实性与安全性:评估反事实医学证据下的大模型行为
构建MedCounterFact并评测多个前沿模型,发现模型面对危险或不合理的反事实医学证据时仍普遍采信,给出自信且缺乏警示的回答。
- 会议论文ACL 2026
大模型如何信任未知知识?一种基于未知知识的越狱攻击
研究影响模型采信未知知识的因素并据此构造越狱攻击,报告在有无防御的测试场景中,对包括GPT-5.1在内的模型达到99%至100%成功率。
- 会议论文ACL 2026
SafetyALFRED:评估视觉语言模型的安全规划能力
构建包含六类厨房隐患的具身评测,发现模型虽能识别危险,却难以通过规划主动消除风险。
- 会议论文ACL 2026
TRuST:有毒语言片段与攻击目标识别
构建约30万条标注的毒性识别数据集,发现微调预训练模型在毒性、目标群体和有毒词识别上均优于大语言模型。
- 会议论文ACL 2026
通过自适应回溯保护大语言模型隐私
提出免训练机制ABack,在解码时监测泄露倾向并改写回答,对抗攻击下隐私保护较强基线最高提升14%,且不降低回答效用。
- 会议论文ACL 2026
从任务到团队:金融多智能体系统的风险优先评测框架
提出免微调的多智能体风险审计框架,以四层十类探针识别不安全轨迹,并揭示常规指标遗漏的时效性等风险。
- 会议论文ACL 2026
SEA-SafeguardBench:东南亚语言文化安全基准
构建覆盖八种语言、21,640条人工核验样本的安全基准,发现先进模型与护栏在东南亚文化及危害场景中的表现弱于英语。
- 会议论文ACL 2026
向窃贼致意:去中心化GRPO的攻击与防御
恶意节点通过共享投毒回答攻击去中心化GRPO,最快50轮达100%成功率;两种过滤防御仍无法阻止冗长回答型拒绝服务攻击。
- 会议论文ACL 2026
通过指令层级推理提升语言模型可控性
构建VerIH并以轻量强化学习训练指令优先级推理,冲突场景表现提升约20个百分点,越狱和提示注入成功率最多降低20个百分点。
- 会议论文ACL 2026
用自适应压力测试评估黑盒大模型规划器的观测扰动鲁棒性
利用蒙特卡洛树搜索开展自适应压力测试,发现提示措辞、传感器配置及噪声可诱发大模型规划器幻觉、不确定行为乃至驾驶碰撞。
- 会议论文ACL 2026
PsychEthicsBench:依澳大利亚心理健康伦理评估大模型
基于澳大利亚心理学与精神医学指南评测14个模型,发现拒答率难以反映伦理表现,部分领域微调模型的伦理稳健性反而下降。
- 会议论文ACL 2026
VLMGuard-R1:推理驱动提示优化的视觉语言模型安全对齐
通过多模态推理改写用户输入,无需修改受保护模型参数;在SIUO基准上,五个模型的平均安全性提升43.59%。