研究提出意图恢复率作为 LLM 安全评测的补充指标
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
- arXiv
- 2610.11766
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
摘要无害输出的证据权重取决于任务是否被恢复。
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
另有 216 篇论文还没打上分类标签,暂不在筛选结果里。
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出 LADE,用首 token 暗知识在生成前过滤越狱查询
LADE 是一种只读首 token 输出概率的防御,用来在生成前挡下可能引出有害回复的查询。
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
形式化 watchman 防御以阻止序贯马赛克攻击
这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。