全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
你的LLM智能体可能泄露数据:通过后门工具调用窃取数据
提出向微调智能体植入语义触发后门,通过记忆访问与伪装检索调用外泄用户上下文,并发现多轮交互会放大累积泄露。
- 会议论文ACL 2026
大语言模型如何权衡内部知识、用户主张与文档主张
评估27个模型的三源信息权衡,发现模型更依赖文档且难以区分有益与有害信息,使用多样来源交互数据微调可改善辨别能力。
- 会议论文ACL 2026
剖析机器遗忘:事实显著性与模型微调的双重影响
提出跨训练阶段的遗忘评估基准DUAL,发现先对待遗忘数据进行监督微调可使遗忘更平稳,并将保留率提高10%至50%。
- 会议论文ACL 2026
观点:大语言模型水印落地需要协调各方激励
从竞争风险、检测工具治理和归属问题分析水印部署障碍,以情境内水印为例提出面向特定领域的激励协调与滥用检测设计原则。
- 会议论文ACL 2026
偏离拒答:基于首词元分布的黑盒越狱方法
提出利用首词元分布偏离拒答模式来优化攻击的方法,在全部受测开源模型上成功率超过90%,在GPT-4.1上超过94%。
- 会议论文ACL 2026
理解稀疏自编码器的鲁棒性
在推理时将预训练稀疏自编码器接入残差流,使越狱成功率最低降至基线的五分之一,并发现稀疏度及接入层影响防御与效用。
- 会议论文ACL 2026
虚假的安全感:基于探针的恶意输入检测为何难以泛化
通过受控实验发现,恶意输入检测探针主要学习指令模式和触发词而非语义有害性,解释其分布外泛化不足并提出评估改进方向。
- 会议论文ACL 2026
价值观引导如何重塑大语言模型行为
通过微调研究15种价值观的行为影响,发现引导积极价值观可提升安全性,但所有受测价值观均增加拟人化表达与迎合倾向。
- 会议论文ACL 2026
RShield:嵌入即服务中可追溯用户的LLM后门水印
结合纠错码、正交特征映射与轻量适配器实现用户级水印归属,在模型提取攻击下实现100%多比特水印恢复并保持较高语义保真度。
- 会议论文ACL 2026
自适应审问者:以演化对话策略检测多智能体系统中的木马模型
提出黑盒审计框架CTUS,通过演化对话探针暴露潜伏木马智能体,在特定配置下检测率达100%,对良性系统的误报极低。
- 会议论文ACL 2026
大语言模型安全护栏易受价值驱动对抗提示攻击
提出利用模型迎合倾向的价值驱动黑盒越狱,在五个模型上单次查询的平均成功率达91.8%和95.2%,分别对应两个测试集。
- 会议论文ACL 2026
跨视觉、语言、视频与音频的多模态遗忘综述
系统梳理多模态遗忘的方法、数据集与基准,比较删除强度、知识保留、效率、可逆性及鲁棒性之间的权衡。
- 会议论文ACL 2026
MHSafeEval:角色感知的心理健康交互安全评测
提出角色感知的危害分类与多轮对抗评测框架,发现静态基准遗漏的角色相关及累积性心理健康安全失效。
- 会议论文ACL 2026
LCO:以约束优化缓解智能体的奖励作弊
通过执行前安全约束推演与受约束的进化探索,无需微调即可缓解上下文奖励作弊,并在实验中保持任务表现。
- 会议论文ACL 2026
超越安全代价:以外部安全修正抑制不安全文生图
提出不修改基础模型的外部安全模块SafePatch,在I2P上将不安全生成比例降至7%,同时保持图像质量与语义一致性。
- 会议论文ACL 2026
SEA-Guard:立足东南亚文化的多语言安全护栏
通过智能体生成具有东南亚文化语境的安全数据,训练多语言护栏,在保持通用安全表现的同时改善地区敏感及有害内容检测。
- 会议论文ACL 2026
大模型自动简历筛选中的单人及多人提示注入
实验发现,候选人资质相近且少数人注入时,简历提示注入能提升排名;注入普及后效果消退,资质差异较大时仍可能导致排名倒置。
- 会议论文ACL 2026
超越触发器:编码器攻击下扩散模型的语义漂移
发现编码器投毒会造成无需触发器的持续语义损坏,并提出SEMAD框架量化内部表征漂移与下游功能失配。
- 会议论文ACL 2026
从领域到实例:大语言模型遗忘的双粒度数据合成
利用目标模型自身知识合成领域级与实例级遗忘集,提高数据相关性、多样性与效率,并改善遗忘效果及能力保留。
- 会议论文ACL 2026
CARO:面向鲁棒内容审核的类比链推理优化
通过监督微调与偏好优化训练类比推理,减少模糊内容审核中的误导性判断捷径,实验中平均F1提升24.9%。
- 会议论文ACL 2026
当助手变成隐患:多模态大模型的日常生活安全基准
提出含2013个真实图文样本的SaLAD基准;评测18个模型发现,最佳模型在不安全查询上的安全响应率仅57.2%。
- 会议论文ACL 2026
CEAID:面向中欧语言的多语种机器生成文本检测基准
构建中欧语言机器文本检测基准并评估抗混淆能力,发现针对这些语言监督微调的检测器性能与对抗鲁棒性最佳。
- 会议论文ACL 2026
通过道德攻击越狱大语言模型
构建涵盖价值模糊与冲突的1.04万条数据并设计四类对抗攻击,发现大语言模型和护栏模型的道德判断存在显著漏洞。
- 会议论文ACL 2026
STAR-Teaming:基于策略—响应多层网络的自动化红队
结合多智能体与策略—响应多层网络组织攻击搜索,减少重复探索,以更低计算成本取得更高攻击成功率。