研究者提出 HPAA 攻击:用排版视觉线索绕过 13 个内容审核系统
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
- arXiv
- 2606.09700
- 发表
- 层
- 提示层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 测试
- Llama-Guard-3-8B、Perspective API、ShieldGemma-2B 等 13 个
摘要揭示了排版视觉线索与分词差异带来的审核盲区,HPAA 以极低查询实现近乎完全规避。
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
另有 630 篇论文还没打上分类标签,暂不在筛选结果里。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 DURA,沿扩散潜空间生成自然对抗补丁,把机器人动作导向指定目标
DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。
用六维 CR 量表审计 LLM 评测基准的文化响应性
作者用文化回应性评价审计 SimpleQA 和 Chatbot Arena,追问定义事实与质量的基准对谁有效。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签
作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果
ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。
提出 SAST-IR,用有状态攻击者迭代说服无记忆模型接受反事实
提出扩散潜空间地理扰动防御,抑制视觉语言模型泄露精确地理位置
提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。