全部动态
从来源,看到研究的联系
点击节点查看内容
本页材料
24 条- 会议论文ICML 2026
基于去噪表示的数据归因检测并过滤不安全训练数据
提出 DRA,对训练与目标样本表示去噪后做数据归因,在过滤越狱数据和检测性别偏见任务上优于基于审核分类器的方法。
- 会议论文ICML 2026
SafeHarbor:基于分层记忆增强护栏的 LLM Agent 安全决策边界
提出免训练、即插即用的分层记忆护栏,通过对抗生成提取上下文感知的防御规则;GPT-4o 上良性任务效用达 63.6%,对有害请求拒答率超 93%。
- 会议论文ICML 2026
GEM:基于对比速度匹配的Rectified Flow模型几何概念擦除
针对多模态生成模型合成有害内容与深度伪造的风险,提出GEM概念擦除框架,将基于轨迹的遗忘与教师引导流匹配结合,有效抑制有害概念并保留正常生成。
- 会议论文ICML 2026
以越狱促保护:通过临时越狱实现大模型安全微调的缓冲与强化
提出缓冲与强化微调框架,通过临时越狱适配器吸收有害梯度并在适配后恢复拒答行为,有效抵御有害微调攻击。
- 会议论文ICML 2026
针对语言模型突现不对齐的训练期防御
系统评估微调API场景下针对突现不对齐的五种训练期防御,发现依据对齐与未对齐模型困惑度差距挑选穿插数据能取得最佳效果。
- 会议论文ICML 2026
BARRED:基于非对称辩论的定制策略安全护栏合成训练
提出BARRED框架,利用任务描述和少量未标注样本,通过多智能体辩论与维度分解生成高保真合成数据,有效微调小模型以构建超越主流专用护栏的定制护栏。
- 会议论文ICML 2026
评估情境违法性:前沿大模型在公司法场景下的合规表现
构建公司法情境违法性评估基准,评测前沿模型在常规操作因特定背景变为非法时的拒答表现与过度拒答现象。
- 会议论文ICML 2026
文生图模型中面向随机种子鲁棒的安全对齐
针对文生图模型安全机制在不同随机种子下防御不稳定的问题,提出噪声对比扩散方法,有效降低恶意越狱提示词的攻击成功率并保持生成质量。
- 会议论文ICML 2026
SafeSpec:基于动态反思采样的快速且安全LLM推理
提出将风险评估融入推测解码验证过程的框架SafeSpec,在检测到不安全生成时进行回退与反思采样,兼顾推理加速与越狱防御能力。
- 会议论文ICML 2026
PlugGuard:基于潜在动力学引导风险检测的大模型流式护栏
提出即插即用护栏框架PlugGuard,通过流式潜在动力学头建模序列风险演化并实施有害即停策略,在极低延迟下显著提升了实时风险检测的准确率。
- 会议论文ICML 2026
MESA:通过去中心化专业能力改进MoE模型安全对齐
针对MoE架构中安全能力集中易被对抗绕过的问题,提出基于最优传输的对齐框架MESA,分散安全职责以兼顾防御与有用性。
- 会议论文ICML 2026
利用蜜罐训练:重塑大语言模型在对抗攻击下的失效模式
提出将易被判定为有害但缺乏可操作性的蜜罐响应作为安全训练中的难负例,改变模型在对抗攻击下的失效形态,降低实际危害。
- 会议论文ICML 2026
自校准一致性提升视觉语言模型的对抗鲁棒性
针对视觉语言模型在对抗扰动下脆弱的问题,该研究提出即插即用的测试时防御策略SCC,结合语义与空间一致性约束,显著提升了CLIP等模型的零样本对抗鲁棒性。
- 会议论文ICML 2026
BlueCodeAgent:基于自动红队的代码生成AI蓝队防御智能体
针对代码生成AI防御手段不足的问题,提出由自动红队驱动的蓝队防御智能体BlueCodeAgent,结合章程归纳与动态分析有效拦截恶意指令与提示注入。
- 会议论文ICML 2026
在生成模型潜空间中学习水印
提出 DistSeal,在扩散与自回归模型的潜空间训练水印模型并蒸馏进生成模型或解码器,鲁棒性有竞争力,速度比像素空间方法最高快 20 倍。
- 会议论文ICML 2026
扩散模型的正交概念擦除
提出正交概念擦除方法,从几何视角将基于编辑的擦除重构为正交参数变换,在精确消除非预期或不安全概念的同时,完整保留扩散模型的生成能力。
- 会议论文ICML 2026
通过验证将安全理解内化到大型推理模型中
提出SInternal框架,通过训练大型推理模型对自身生成回答进行安全验证与批评,将安全规范内化,显著增强了抵御域外越狱攻击的鲁棒性。
- 会议论文ICML 2026
用子模优化实现鲁棒语言模型对齐的最小数据增强
针对微调会削弱安全对齐的问题,将增强建模为序列上的群作用,用子模优化选出最小增强集,高效恢复安全对齐。
- 会议论文ICML 2026
RBCBF:基于风险引导回退与屏障控制的解码期安全对齐
提出解码期安全对齐框架RBCBF,将终端违规建模为前缀风险累积以选择回退步骤,并在多规则约束下进行校正控制,显著减少有害输出与重复违规。
- 会议论文ICML 2026
通过自适应安全上下文学习缓解 LLM 对齐中的安全-效用权衡
将安全对齐建模为多轮工具调用,让模型自主决定何时查阅安全规则,并用 IFPO 平衡优势估计,整体表现优于基线。
- 会议论文ICML 2026
重新思考基于 IBP 的认证训练评估范式
用 Pareto 前沿比较认证训练方法的自然精度与认证精度权衡,发现既有配置常欠调,先前进展不如预期显著。
- 会议论文ICML 2026
OSCS:面向大语言模型安全且具备可证明误接受率控制的在线选择
提出在线选择框架OSCS,无需恶意校准样本即可实时执行接受或拒答决策并严格控制误接受率,有效防御后门和越狱攻击。
- 会议论文ICML 2026
用于平衡安全对齐的可配置奖励模型
提出可配置安全奖励模型CSRM,结合数据增强适应动态安全规范,显著提升了未见过安全配置下的泛化能力与有用性-安全性权衡。
- 会议论文ICML 2026
EMBGuard:为具身智能体构建危险感知护栏以实现安全规划
提出基于 MLLM 的具身安全护栏,评估(观测,动作)对并解释风险,配套 15.1K 训练集与 329 场景基准,性能媲美专有模型且误报更低。