跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.33640· Xinmiao Wang·· 4 天前

SafeMol:分子多模态模型的双模态安全对齐

SafeMol: Dual-Modality Safety Alignment for Molecular Multimodal Models

AI 导读

分子多模态模型在纯文本与图条件输入下均存在显著越狱漏洞,安全鲁棒性需跨输入模态成立并兼顾安全、过度拒答与效用。为此研究者构建 SafeMolBench 基准,含 3702 个样本、覆盖 618 种独特危险分子,分为危险有害、危险允许与效用回放三个子集。基于该基准提出的参数高效对齐框架 SafeMol 联合优化两种模态的轻量模块,用 MMD 做分布级表示对齐并显式建模分子危险性与有害操作意图,实验显示攻击成功率下降数十个百分点,同时保持较低过度拒答与分子任务效用。

阅读原文arxiv.org