研究者提出多模态安全评测应衡量可控性而非仅做分类
Multimodal Safety Evaluation Should Measure Controllability Beyond Classification
AI 导读
研究者主张多模态安全评测不应只做输入和输出层面的分类,还应报告可控性画像,区分表征层可检测性、跨模态特异性、干预敏感性和良性保持选择性。作者以隐性毒性为压力测试案例,在 LlavaGuard 和 Qwen3.5 上用稀疏特征分解实例化该画像:LlavaGuard 存在局部化操控点,但良性保持的干预区间较窄,下游安全收益有限;Qwen3.5 支持较强的表征层读出,但在所测试的算子下没有可比的选控机制。结果表明内部读出与可控性可能分离,未来多模态安全基准除行为安全指标外,还应报告安全相关内部信号能否在经验证的操作区间内被干预测试和控制。