全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ICML 2026
SafeCompass:基于推理时安全信号的动态思维链 steering
从内部表示提取潜在安全方向,仅在推理轨迹变得不安全时干预,攻击成功率最多降至最佳基线的十分之一,并减少过度拒答。
- 会议论文ICML 2026
去噪扩散采样的对抗攻击与防御
针对扩散采样提出在采样阶段注入扰动的攻击,并提出局部变分正则化防御,实验显示攻击显著削弱现有方法而防御可有效抵御。
- 会议论文ICML 2026
通过在线自我博弈强化学习追踪移动目标以构建更安全的语言模型
提出全在线自我博弈多智能体强化学习算法Self-RedTeam,使攻防双方持续协同进化,在发现更多样攻击的同时将大模型安全性提升最高达95%。
- 会议论文ICML 2026
Meerkat-VL:通过感知推理与自验证实现多模态 LLM 的隐式风险安全对齐
构建首个隐式风险标注数据集,并用规范性感知自验证提供更密集可靠的奖励以缓解 reward hacking;多模态安全基准上安全性与有用性分别提升 16% 和 13%。
- 会议论文ICML 2026
基于混合随机平滑的异构扰动下可信鲁棒性
提出混合随机平滑框架,统一了离散文本与连续图像的联合扰动认证,首次为图文交互安全过滤提供了模型无关的奈曼-皮尔逊形式鲁棒性认证。
- 会议论文ICML 2026
对比谱校正:CLIP 零样本对抗鲁棒性的测试时防御
发现对抗样本在频率衰减下特征不一致,提出 CSR 测试时防御,在 16 个基准上对强 APGD 攻击平均超 SOTA 18.1%。
- 会议论文ICML 2026
解耦意图与角色:用于角色无关安全对齐的对抗自博弈
针对大模型易受基于角色的越狱攻击影响,提出对抗自博弈框架PIA,在防御端通过单向KL散度约束将安全决策与角色解耦,在维持通用能力的同时大幅降低越狱成功率。
- 会议论文ICML 2026
通过序列熵变检测流畅的优化型对抗提示词
将针对大模型的对抗后缀检测建模为序列熵在线变点检测问题,提出免训练检测器CPD,有效识别GCG等多种优化攻击并定位后缀,可作为安全护栏的前置门控降低调用开销。
- 会议论文ICML 2026
推理模型安全恢复仅需早期几步引导
提出轻量级推理期防御SafeThink,通过监控思维链并在违规时注入修正前缀,仅需在前1至3步推理进行干预即可大幅降低越狱攻击成功率。
- 会议论文ICML 2026
前沿图像生成模型的概念移除
用 transcoder 替换模型内部瓶颈层,使特定概念特征可被关闭;在 SD3.5、Flux、Infinity 上取得领先的概念移除效果,并对对抗提示保持鲁棒。
- 会议论文ICML 2026
奖励投毒攻击下的鲁棒上下文强化学习
针对 Decision-Pretrained Transformer 的奖励投毒攻击,提出对抗训练框架 AT-DPT,同时训练攻击者与 DPT,在 bandit 及更复杂环境中优于鲁棒基线。
- 会议论文ICML 2026
从错误中学习:面向安全代码大模型的树状自我博弈
针对代码大模型易生成安全漏洞的问题,提出树状自我博弈框架TSP,通过构建决策树让模型在分支轨迹中辨别局部错误,显著提升安全通过率并减少未知CWE漏洞。
- 会议论文ICML 2026
基于稀疏权重编辑的多语言安全对齐
针对低资源语言容易绕过安全护栏的问题,提出通过稀疏权重编辑将低资源语言有害表征映射至高资源语言安全子空间,在免训练下显著降低攻击成功率。
- 会议论文ICML 2026
统一文本评分模型的对抗鲁棒性与对抗训练
将对抗攻击与对抗训练拓展并统一至密集检索器、重排器和奖励模型等文本评分模型中,所提出的互补对抗训练方法能显著提升鲁棒性,并在RLHF中有效缓解奖励作弊。
- 会议论文ICML 2026
迈向安全的量化感知微调:理解并缓解安全对齐退化
发现量化 LLM 在微调中更易丧失安全对齐,源于量化误差;提出 ExSQF,在保持下游性能的同时恢复安全,优于全精度安全微调基线。
- 会议论文ICML 2026
HyperPotter:在音频深度伪造检测中利用高阶交互
提出基于超图的框架,通过聚类超边捕捉高阶交互;在 13 个测试集上平均 EER 相对降低 12.68%,但在严重编解码失真下鲁棒性有限。
- 会议论文ICML 2026
基于表示空间可分性的多语言安全对齐
揭示低资源语言安全失效源于表征空间中善恶提示词可分性不足,提出SMO优化方法迁移高资源语言的安全几何特征,在保持通用能力的同时将低资源攻击成功率降至接近零。
- 会议论文ICML 2026
风险感知注入:不损失效用校准视觉语言模型安全性
提出免训练的轻量级安全校准框架RAI,通过在跨模态特征空间调节高危视觉标记放大风险信号,在保持实用性能的同时大幅降低越狱成功率。
- 会议论文ICML 2026
为合规学习高效护栏
提出含 6 万条策略-轨迹对的 PolicyGuardBench,并训练轻量护栏模型 PolicyGuard,检测 Web Agent 的策略违规,在未见领域也泛化良好。
- 会议论文ICML 2026
Reflector:通过内化逐步反思防御间接越狱攻击
提出结合SFT与强化学习的两阶段框架Reflector,将自我反思内化至生成轨迹中,在不损害模型效用的前提下对复杂间接越狱实现超90%的防御成功率。
- 会议论文ICML 2026
远离分界线:基于边界引导的过滤生成安全微调
针对生成模型微调时易靠近安全分类器判定边界导致误判的问题,提出边界引导强化学习微调方法,引导输出远离分界线,在越狱等基准上兼顾了安全性与效用。
- 会议论文NDSS 2026
AI角色平台安全风险的基准评测与分析
评测16个平台后发现其平均不安全回应率为65.1%,并训练模型识别低安全性的角色。
- 会议论文NDSS 2026
失血通道:隐藏状态判别力消失如何助推越狱攻击
发现安全与有害响应的隐藏状态可分性随生成减弱,并提出DEEPALIGN将九类越狱攻击成功率降至接近零。
- 会议论文NDSS 2026
字符级扰动可破坏大语言模型水印
研究表明字符级扰动在有限黑盒查询下能有效移除多种LLM水印,并可绕过固定防御策略。