SRD-GUARD:通过语义改写与多模型联合评分暴露潜在意图的 LLM 防御框架
SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure
AI 导读
SRD-GUARD 是一个无需参数、黑盒的 LLM 越狱防御框架,通过语义改写与多模型共识评分暴露被角色扮演或虚构场景包装的隐藏意图。它对输入提示生成五个语义相关改写,在保留原始目标的同时去除多余情境包装,再由多个独立的 LLM 安全评分器在连续风险尺度上联合评估原始提示与改写版本。决策模块结合绝对风险阈值与原始、改写提示之间的相对风险变化,自适应地拦截、放行或警告请求。