跳到正文
原文
论文追踪· arXiv:2605.03441· Haoyu Zhang, Mohammad Zandsalimy, Shanu Sushmita·本站收录 · 原文发表

研究用数学编码绕过 LLM 安全过滤,八个模型平均攻击成功率 46%–56%

Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis

AI 导读

研究者提出把有害提示词改写为集合论、形式逻辑、量子力学等连贯数学问题,可高比例绕过 LLM 的安全过滤,在八个目标模型和两个既有基准上平均攻击成功率为 46%–56%。作者指出,攻击是否有效不取决于数学符号本身,而取决于是否有辅助 LLM 把有害内容深度改写为真正的数学问题;只套用数学格式的规则式编码与未编码基线效果相当。研究还提出一种新的形式逻辑编码,攻击成功率与集合论相当,说明该漏洞在不同数学形式间具有通用性,重复后处理实验也显示攻击对简单提示词增强保持稳健。较新的 GPT-5、GPT-5-Mini 比旧模型明显更稳健,但仍存在漏洞。作者据此认为当前安全框架存在结构性缺口,需要能推理数学结构而非表层语义的防御。

阅读原文arxiv.org