全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
CiPO:通过迭代偏好优化实现大型推理模型的反事实遗忘
针对推理模型 CoT 中残留的待遗忘知识,用反事实推理轨迹做迭代偏好优化,在思维链和最终答案中都移除目标知识并保留推理能力。
- 会议论文ACL 2026
AI 生成的说服内容能被检测吗?Persuaficial 基准与人机语言差异
构建六语言基准,发现明显的 LLM 说服文本较易检测,但隐晦的 LLM 说服会持续削弱自动检测效果。
- 会议论文ACL 2026
DIA-HARM:50 种英语方言下有害内容检测的差异
构建覆盖 50 种方言的虚假信息检测基准,评测 16 个检测模型,发现方言内容使检测性能下降,部分模型严重失效。
- 会议论文ACL 2026
TAMAS:多智能体 LLM 系统对抗风险基准
含 300 个对抗实例、六类攻击,评测十个骨干模型和 Autogen、CrewAI 配置,发现多智能体系统极易受攻击。
- 会议论文ACL 2026
ReasoningGuard:用推理时安全顿悟时刻保护大型推理模型
利用注意力定位推理关键点并注入安全反思,配合采样策略,无需微调即可抵御四类越狱,优于九种现有防护。
- 会议论文ACL 2026
HiddenGuard:基于专用表征路由器的细粒度安全生成
利用隐藏状态做 token 级有害内容检测与遮蔽,不必整体拒答,有害内容检测与遮蔽 F1 超过 90%。
- 会议论文ACL 2026
RLVR 中的后门:经可验证奖励植入的越狱后门
提出 ACB 攻击,用不到 2% 的投毒数据在 RLVR 中植入后门,触发后安全性平均下降 73%,且不影响正常任务。
- 会议论文ACL 2026
InquireMobile:用强化微调教 VLM 移动 agent 请求人工协助
提出 InquireBench 评测移动 agent 的安全交互与主动询问,并训练 InquireMobile,询问成功率提升 46.8%。
- 会议论文ACL 2026
SafeAgent:用自动风险模拟器保护 LLM agent
提出按指令、上下文、动作划分风险的威胁模型,自动合成数据训练,四个开源模型安全性平均提升 45%。
- 会议论文ACL 2026
RedCoder:面向代码 LLM 的自动化多轮红队
通过多 agent 博弈构建攻击策略库并微调红队 agent,多轮对话诱导代码模型生成漏洞代码,效果优于单轮和多轮基线。
- 会议论文ACL 2026
PIArena:提示注入评测平台
统一集成攻击、防御与基准,并设计自适应攻击,发现现有防御泛化性有限、易被自适应攻击突破。
- 会议论文ACL 2026
MM-PoisonRAG:以局部和全局知识投毒攻击破坏多模态 RAG
提出局部与全局两种投毒攻击,局部攻击成功率最高 56%,全局攻击仅一条投毒内容就使准确率降为 0,且绕过现有防御。
- 会议论文ACL 2026
LLM 真的记住了个人身份信息吗?用线索控制框架重审 PII 泄露
提出 CRM 线索控制评估,在 32 种语言上发现此前报告的 PII 泄露主要源于表层线索,控制后重构成功率大幅下降。
- 会议论文ACL 2026
基于大模型的孟加拉语仇恨言论多任务检测
构建涵盖类型、严重程度与目标的孟加拉语仇恨言论数据集,发现LoRA微调大模型可媲美BanglaBERT,但文化语境预训练仍很重要。
- 会议论文ACL 2026
EthicMind:多轮对话的风险感知伦理与情感对齐
提出无需额外训练的逐轮风险与情绪分析框架,在高风险及道德模糊对话中实现更一致的伦理引导和情感回应。
- 会议论文ACL 2026
可审计潜在思维链对齐:化解安全与可审计性困境
ALCA将安全推理移入潜在空间,并通过受限自解码支持审计,相比强基线使自适应越狱成功率降低超过40%,同时保持性能。
- 会议论文ACL 2026
多思少言:将审慎安全推理内化到大模型参数
HIAR通过逐层LoRA更新内化安全推理,无需生成显式安全思维链,相比强基线将越狱攻击成功率降低43%。
- 会议论文ACL 2026
多智能体大模型系统中的组合式提示攻击
研究查询触发项与受控远程智能体模板经路由组合后激活有害行为的攻击,发现现有护栏和工具限制难以可靠阻断。
- 会议论文ACL 2026
大语言模型欺骗行为的隐藏状态轨迹特征
通过隐藏状态轨迹的几何特征检测欺骗,发现谄媚信号最明显、指令性欺骗信号接近于零,七项特征即可支持轻量检测。
- 会议论文ACL 2026
SMARTER:大模型自增强的低数据可解释毒性检测
结合合成解释、偏好优化和跨模型训练,仅使用6%至57%的训练数据,宏平均F1较少样本基线最高提升13%。
- 会议论文ACL 2026
让机制可解释性可审计:呼吁通过持续协作评审制定指南
立场论文,指出机制可解释性缺乏标准化审计体系,呼吁建立持续协作评审平台与专家验证指南,以支持其在 AI 安全中的应用。
- 会议论文ACL 2026
大模型仇恨言论检测中的安全对齐与意识形态偏差
比较政治人设下不同安全约束模型的仇恨言论检测,发现约束较强者更准确且更抗人设影响,但各模型仍存在群体差异和过度自信。
- 会议论文ACL 2026
约束参数区域能否保障大语言模型安全?
跨四类模型评估四种安全参数区域识别方法,发现区域重叠度较低且受数据集影响,现有方法难以定位稳定的安全区域。
- 会议论文ACL 2026
强化学习引导的分布外有害文本检测自适应调优
提出RLAT,以强化学习控制测试时数据选择和参数更新,缓解持续调优的过拟合,在跨平台与跨时间有害文本检测中优于基线。