研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
- arXiv
- 2610.02853
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- ToySSMClassifier、S4 safety head
摘要收缩给出玩具 LTI 的有界认证。
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
检验合成数据来源识别是否等于再训练适配筛选
作者在金融风险文本上把来源识别和训练样本是否有用拆成两次测量,并写明这不是电信部署实验。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
提出 BITE,用上下文赌博机选择风格修改抬高 LLM 评委打分
BITE 是黑盒风格操纵:在保持答案语义的同时,抬高 LLM 评审给出的分数。
提出 Vaporizer,用词法变换、翻译和释义破解 LLM 输出水印
提出字符级扰动与遗传算法去除 LLM 水印
这篇工作评估推理时 LLM 水印在黑盒、有限查询下的移除难度,并比较字符级、token 级和句子级编辑。
提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器
作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。