全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACL 2026
聪明的副作用:多模态大模型的多图推理安全风险
提出多图推理安全基准,评测19个模型发现,推理更强的模型可能更易受攻击,部分安全回答实际源于误解或回避。
- 会议论文ACL 2026
超越静态基准:基于角色模拟合成有害内容进行稳健评测
利用角色设定引导智能体合成有害互动,生成场景比现有基准更难被检测,且语言与主题多样性接近人工数据集。
- 会议论文ACL 2026
HarDBench:草稿协作写作越狱攻击基准
构建草稿协作写作越狱基准,发现现有模型易生成有害续写,并通过偏好优化减少有害输出而不损害协作写作能力。
- 会议论文ACL 2026
SafeMT:多模态语言模型的多轮对话安全
构建万条样本的多轮安全基准,评测17个模型发现攻击风险随轮次增加,并提出比现有护栏更有效的对话安全调节器。
- 会议论文ACL 2026
ARES:策略—奖励系统的自适应红队测试与端到端修复
同时发现策略模型与奖励模型的安全弱点,再依次修复奖励模型和策略模型,在多个对抗安全基准上提升鲁棒性并保留能力。
- 会议论文ACL 2026
Red-Bandit:多臂老虎机引导LoRA专家自适应红队测试
通过多臂老虎机在线选择不同攻击风格的LoRA专家,在探索预算充足时提升攻击成功率,并揭示目标模型对不同攻击风格的弱点。
- 会议论文ACL 2026
Jailbreak-Zero:迈向帕累托最优的大语言模型红队测试
提出基于安全政策的自动红队框架,权衡风险覆盖、多样性与忠实性,对GPT-4o和Claude 3.5的攻击成功率达99.5%和96%。
- 会议论文ACL 2026
面向大语言模型自动红队测试的自适应指令组合
用上下文多臂老虎机自适应组合众包攻击素材,兼顾攻击效果与多样性,优于随机组合并在HarmBench上超过多种自适应方法。
- 会议论文ACL 2026
StealthGraph:用知识图谱引导生成领域有害提示以暴露 LLM 风险
提出知识图谱引导的有害提示生成加两种混淆改写策略,构造兼具领域相关性与隐含性的数据集,用于更真实的领域红队测试。
- 会议论文ACL 2026
基于人设的 AI 陪伴应用多轮对话安全评测
构建人设驱动的多轮模拟与危害评估框架,测试 Replika 对高风险用户的回应;发现其常附和或正常化自残、饮食失调和暴力幻想等不安全内容。
- 会议论文ACL 2026
USB:面向多模态大模型的全面统一安全评测基准
构建覆盖 61 类风险、四种模态组合的基准,同时评估有害查询漏洞与良性输入过度拒答;测试 22 个 MLLM,发现其在二者间难以平衡,对纯图像和跨模态风险尤其脆弱。
- 会议论文ACL 2026
OmniCompliance-100K:规则支撑的跨域安全合规数据集
从权威来源整理覆盖74项法规与政策的12,985条规则及106,009个真实合规案例,并据此评测不同规模模型的安全合规能力。
- 会议论文ACL 2026
GRE评分:大语言模型生成风险评估
提出基于拒答评分间隔的攻击无关鲁棒性指标,在八个模型上得到与攻击评估一致的鲁棒性排序,评估速度提升5至8倍。
- 会议论文ACL 2026
MHSafeEval:角色感知的心理健康交互安全评测
提出角色感知的危害分类与多轮对抗评测框架,发现静态基准遗漏的角色相关及累积性心理健康安全失效。
- 会议论文ACL 2026
当助手变成隐患:多模态大模型的日常生活安全基准
提出含2013个真实图文样本的SaLAD基准;评测18个模型发现,最佳模型在不安全查询上的安全响应率仅57.2%。
- 会议论文ACL 2026
STAR-Teaming:基于策略—响应多层网络的自动化红队
结合多智能体与策略—响应多层网络组织攻击搜索,减少重复探索,以更低计算成本取得更高攻击成功率。
- 会议论文ACL 2026
XGUARD:大语言模型极端主义内容安全失效分级基准
构建含3840条红队提示的五级风险基准,评测五种模型与两种防御策略,揭示极端主义内容生成中的安全缺口与防御权衡。
- 会议论文ACL 2026
大语言模型能识别“狗哨”暗语吗?
构建含11,150条提示的DogBench,发现表面无害但暗含有害意图的狗哨提示,比同结构的显性有毒提示更易诱发有害输出,风险约为四倍。
- 会议论文ACL 2026
越狱场景下的水印评测:攻击成功率虚高与目标服从度错位
评测六种水印方法与四款模型,发现水印可能抬高裁判判定的越狱成功率,却未同步提高有害目标服从度,提示需补充人工和目标服从评估。
- 会议论文ACL 2026
用自适应压力测试评估黑盒大模型规划器的观测扰动鲁棒性
利用蒙特卡洛树搜索开展自适应压力测试,发现提示措辞、传感器配置及噪声可诱发大模型规划器幻觉、不确定行为乃至驾驶碰撞。
- 会议论文ACL 2026
安全并非普遍:大模型对齐中的选择性安全陷阱
构建覆盖16个少数群体的双语越狱基准,发现同一模型对不同群体的防御率显著不同,定向偏好优化可改善对未见群体的安全泛化。
- 会议论文ACL 2026
对文生图安全护栏中的NSFW图像分类器开展红队测试
提出自动化红队框架,发现良性画面元素的变化可导致NSFW漏检,利用失败案例训练的提示改写模型将检测规避概率提高至多六倍。
- 会议论文ACL 2026
刻画大语言模型的选择性拒答偏差
发现安全护栏对不同人口群体存在选择性拒答,并设计间接攻击,使Llama 3.1在约89%的试验中未能保护此前拒绝攻击的群体。
- 会议论文ACL 2026
中文短视频虚假信息中的多模态大模型认知偏差评测
基于200条健康短视频评测八个多模态大模型,发现模型识别虚假信息的表现差异明显,且易受权威账号标识等社会线索误导。