研究提出意图恢复率作为 LLM 安全评测的补充指标
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
- arXiv
- 2610.11766
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
摘要无害输出的证据权重取决于任务是否被恢复。
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错
CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
提出 MIST 压力测试,检验无关图像是否扰动 VLM 评判者标签
作者用MIST问:VLM 代替人类标注时,可替代性裁决会不会被指南要求忽略的图像改写。
测量系统提示中隐藏日期对评测分数与排名的影响
这篇工作量化一个评测协议问题:系统提示词里用户看不见、且逐日变化的当前日期,会不会单独改变 LLM 分数。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 VEX-Bench 评测 LLM 生成虚假信息的核查复杂度
VEX-Bench 把 LLM 虚假信息的风险从“能否生成”改成“筛查时会占用多少核查容量”。
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
组织 ArGuard 共享任务评测阿拉伯语表情包与提示词有害检测
用六维 CR 量表审计 LLM 评测基准的文化响应性
作者用文化回应性评价审计 SimpleQA 和 Chatbot Arena,追问定义事实与质量的基准对谁有效。
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
提出 CS-Guard 基准,评测代码生成护栏对虚构场景攻击的防御
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。