全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
安全评测如抛硬币:LLM 评审无法可靠衡量对抗鲁棒性
基于 6642 条人工标注审计发现,红队场景下 LLM 评审准确率常接近随机,部分攻击靠利用评审缺陷虚高成功率;提出 ReliableBench 等。
- 会议论文ICML 2026
RLCracker:用自适应强化学习攻击评估 LLM 水印的最坏情况脆弱性
提出自适应鲁棒半径指标和 RL 攻击 RLCracker,仅需少量样本且无需检测器访问,3B 模型即可对 Unigram 水印文本达 98.5% 的去除成功率,远超 GPT-4o 的 6.75%。
- 会议论文ICML 2026
重新审视黑盒设置下对语义水印的伪造攻击:几何失真视角
从潜空间率失真角度分析伪造攻击,发现代理与目标模型结构失配带来不可约失真下限,并据此提出与方案无关的伪造样本检测方法。
- 会议论文ICML 2026
Scam2Prompt:量产大模型恶意钓鱼端点审计框架
提出自动化审计框架Scam2Prompt,通过合成良性开发提示词评估大模型复现钓鱼端点的风险,发现主流模型在代码生成中输出诈骗端点的概率最高达47.3%。
- 会议论文ICML 2026
Helpful to a Fault:衡量多轮多语言 LLM Agent 的违规协助
提出自动红队框架 STING,用多轮自适应追问评测 Agent 滥用,违规任务完成率显著高于单轮基线,且低资源语言并不更易攻破。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
MUZZLE:针对Web Agent间接提示注入的自适应红队
提出自适应智能体红队框架,在四个Web应用中发现44种攻击及跨应用提示注入策略。
- 会议论文ACL 2025
镜中偏见:大语言模型的观点能抵抗自身的对抗攻击吗
让同一模型的两个实例持相反观点说服中立实例,跨模型与语言评估偏见的持续性,以及强化错误信息或转向有害观点的倾向。
- 会议论文ACL 2025
LongSafety:评估大语言模型的长上下文安全性
构建含1543个案例的长上下文安全基准,评测16个模型发现多数安全率低于55%,且短上下文安全表现不保证长上下文安全。
- 会议论文ACL 2025
AdamMeme:自适应探测多模态大模型的有害性推理能力
通过多智能体协作迭代补充高难度梗图,自适应评估多模态模型对有害性的理解,揭示不同模型的细粒度推理弱点。
- 会议论文ACL 2025
VLSBench:揭示多模态安全评测中的视觉信息泄漏
发现现有基准的文本会泄露图像风险线索,构建2200对无此泄漏的图文样本,并发现消除泄漏后多模态对齐优于纯文本对齐。
- 会议论文ACL 2025
语码转换红队:评估大语言模型安全与多语言理解
提出混合多种语言的 CSRT 红队框架,在十个模型上比标准英语攻击多实现46.7%的成功攻击,揭示多语言安全对齐的薄弱点。
- 会议论文ACL 2025
TRIDENT:以三维多样化红队数据合成增强模型安全
从词汇、恶意意图与越狱策略三维合成安全训练数据,微调后较最佳基线的平均危害评分降低14.29%,攻击成功率降低20%。
- 会议论文ACL 2025
只见树木不见森林:多模态大模型安全意识评测
构建涵盖29类场景、1500组图文输入的安全意识基准,发现九款模型同时存在漏判危险内容与过度敏感问题,三类改进方法均未达满意水平。
- 会议论文ACL 2025
基于认知推理的大语言模型多轮安全动态评测
提出CogSafe,通过场景模拟、策略决策与认知过程动态生成多轮对话,实验验证其安全评测的有效性与可扩展性。
- 会议论文ACL 2025
更安全还是更走运?大语言模型安全评审易受表面措辞干扰
评测11款安全评审模型,发现道歉等表面措辞可显著扭曲安全判断;多模型联合评审虽有改善,仍无法消除这类敏感性。
- 会议论文ACL 2025
如果埃莉诺·里格比遇见ChatGPT:大模型时代的孤独研究
分析用户将ChatGPT用于孤独陪伴的对话,发现其未能妥善回应自杀意念与创伤,相关对话中的有毒内容发生率也高出35%。
- 会议论文ACL 2025
利用大语言模型搜索改进红队测试
提出以大模型为世界模型的蒙特卡洛树搜索框架,在保持计算效率的同时提高红队攻击成功率。
- 会议论文ACL 2025
Qorǵau:哈萨克语-俄语双语场景下的安全评测
构建哈萨克语与俄语的 LLM 安全评测数据集,实验显示多语言与专用模型的安全表现差异明显,强调需要区域化的安全数据。
- 会议论文ACL 2025
动态 Evil Score 引导解码:面向红队模型的高效解码框架
提出 DESGD,用小型不安全模型的 evil score 在解码时调整目标模型 logits,在 Llama-3.2-3B 上 ASR 达 92.83%,高于对抗微调的 83.48%。
- 会议论文ACL 2025
MDIT-Bench:评测大型多模态模型的双重隐式毒性
提出双重隐式毒性与含 317,638 个问题的基准,评测 13 个 LMM,发现它们难以处理此类毒性,困难级别下表现显著下降。
- 会议论文ACL 2025
利用指令跟随检索器进行恶意信息检索
测试六个主流检索器,多数对超 50% 的恶意查询能选出有害段落,指令跟随能力可被利用,且有害段落会让安全对齐的 LLM 满足恶意请求。
- 会议论文ICLR 2025
面向鲁棒红队测试与安全微调的LLM多样化攻击学习
提出利用GFlowNet微调结合平滑阶段训练攻击模型以生成多样且有效的红队攻击,显著提升了目标模型在安全微调后的防御鲁棒性。
- 会议论文ICLR 2025
多模态情境安全
提出 MSSBench(1,960 个查询-图像对)评测 MLLM 能否结合视觉情境判断安全性,发现现有模型表现欠佳,多智能体流水线可提升安全性。