全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
BOOKAGENT:多智能体认知校准下的安全视觉叙事
提出融合儿童安全约束与跨页核验修复的多智能体绘本生成框架,实验显示其叙事连贯性、视觉一致性和安全合规性均优于现有方法。
- 会议论文ACL 2026
MSIA:自适应医疗多模态多轮语义越狱
通过自适应策略与医学证据反馈,在多轮胸片对话中累积隐蔽语义偏移,在GPT-4o、Claude和Gemini上平均攻击成功率达76.67%。
- 会议论文ACL 2026
CURaTE:保留大模型知识的实时持续遗忘
训练句子嵌入模型匹配遗忘请求并触发拒答,无需修改语言模型参数,即可减少敏感信息暴露,并在持续更新中近乎完整保留其他知识。
- 会议论文ACL 2026
模式增强多轮越狱:利用大语言模型的结构性弱点
提出五类对话模式构建多轮越狱,在十二个模型、十类危害上发现模式特异性弱点,针对一种模式的防御难以泛化至其他模式。
- 会议论文ACL 2026
GrandGuard:老年人与聊天机器人交互的安全分类、基准及护栏
建立老年人特定风险分类与10,404条样本基准,发现多个主流模型逾半数案例处理不当,两种护栏的不安全提示检测准确率最高达96.2%和90.9%。
- 会议论文ACL 2026
当推理突破安全:揭示并缓解大推理模型的自我越狱
发现模型会在后续推理中推翻最初的有害意图判断,并提出逐步干预的CoG训练框架,在多个基准上改善安全性与推理能力的平衡。
- 会议论文ACL 2026
面向医疗角色规范遵循的自演化大模型智能体框架
结合角色责任约束、结构化记忆、双层反思与AI反馈优化,在模拟医疗任务中降低严重性加权的规范风险,并提高角色身份稳定性。
- 会议论文ACL 2026
离策略训练数据对探针泛化的影响
评估八类行为的探针泛化,发现战略欺骗等意图类行为最易失效,并提出利用受激励数据测试泛化的方法,提示现有欺骗探针可能难以胜任真实监控。
- 会议论文ACL 2026
OmniCompliance-100K:规则支撑的跨域安全合规数据集
从权威来源整理覆盖74项法规与政策的12,985条规则及106,009个真实合规案例,并据此评测不同规模模型的安全合规能力。
- 会议论文ACL 2026
迈向可证明安全的生成式AI:可靠共识采样
提出可靠共识采样及反馈算法,在模型遭恶意操纵时提供可控风险阈值的理论保证,无需弃答,并在实验中提升鲁棒性与效用。
- 会议论文ACL 2026
AutoMonitor-Bench:大模型不当行为监控器可靠性评测
以3,010条样本评测22个模型对不当行为的监控能力,发现漏报与误报存在持续权衡,并探索微调对未见隐蔽行为监控的作用。
- 会议论文ACL 2026
简单角色分配在安全对齐中表现出显著效果
通过角色条件生成与迭代角色评审实现免训练对齐,使DeepSeek-V3在WildJailbreak上的不安全输出比例从81.4%降至3.6%。
- 会议论文ACL 2026
DualGuard:抵御改写与伪造攻击的双流水印
依据语义动态注入两路互补水印,同时抵御改写与水印伪造,并检测和追溯伪造攻击,在多个模型与数据集上兼顾鲁棒性和文本质量。
- 会议论文ACL 2026
ReCon:通过反向安全概念注入防御视觉语言模型越狱
结合图像净化、异常检测和针对性安全概念注入,在增强视觉语言模型越狱防御能力的同时保留正常任务表现。
- 会议论文ACL 2026
Health-ORSC-Bench:健康场景过度拒答与安全作答基准
构建含31,920条良性边界提示的健康场景基准,评估30个模型,发现安全优化模型对高难度良性提示的拒答率可达80%。
- 会议论文ACL 2026
RLShield:基于强化自适应学习的大模型动态越狱检测
结合动态检索改写、跨层表征分析与强化学习,为每个样本自适应选择检测阈值,F1最高提升7.3%,平均推理效率提升至三倍。
- 会议论文ACL 2026
经验驱动的多智能体大语言模型黑盒越狱优化
提出结合三智能体协作与动态经验库的EMJO,实验中攻击成功率最高提升11个百分点,平均查询成本最多降低7.9倍。
- 会议论文ACL 2026
观点:后训练时代应将人类标注分歧视为内在价值
分析偏好数据将多元标注压缩为单一共识的局限,主张为多元价值对齐与安全评估保留合理分歧,并提出数据构建策略。
- 会议论文ACL 2026
重新审视提示注入攻击评估
通过覆盖37个真实应用的评估,发现真实应用比研究场景更易受提示注入攻击,简单攻击指令更有效,现有防御仍有局限。
- 会议论文ACL 2026
GRE评分:大语言模型生成风险评估
提出基于拒答评分间隔的攻击无关鲁棒性指标,在八个模型上得到与攻击评估一致的鲁棒性排序,评估速度提升5至8倍。
- 会议论文ACL 2026
基于主题的大语言模型水印
提出按主题划分词表的轻量水印方法,在保持文本质量和低开销的同时,增强对改写与词汇扰动攻击的抵抗力。
- 会议论文ACL 2026
EVA:以语义对抗演化对GUI智能体开展环境注入红队测试
发现环境注入成功主要由语义内容而非视觉外观决定,提出仅演化语义载荷的EVA,在实验中取得59%至85%的平均攻击成功率。
- 会议论文ACL 2026
OSCR-Attack:自优化连续松弛的单次字符级攻击
将离散字符插入转化为可学习的连续优化,在三个开源模型上使攻击成功率最高提升21.45个百分点,攻击速度最高提升至3.66倍。
- 会议论文ACL 2026
大语言模型拓扑增强对齐:轨迹拓扑损失与拓扑偏好优化
提出利用持续同调约束隐藏空间轨迹的对齐目标,在Qwen2.5实验中改善偏好指标与模型裁判评分,同时维持或略改善毒性表现。