研究提出意图恢复率作为 LLM 安全评测的补充指标
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
- arXiv
- 2610.11766
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- GPT-4o、Claude Sonnet 4.5、Claude Opus 4.5 等 6 个
摘要无害输出的证据权重取决于任务是否被恢复。
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出 World Models' Last Exam 评测视频物理一致性
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
提出 SteerScope 多维评测 LLM 激活引导的功效与副作用
SteerScope 是一套 LLM steering 评测套件,用来同时记录目标概念有没有被诱导出来、模型还被连带改了什么,以及这些改变在换语言提示和减少训练样本后还剩多少。
提出 HARP,在硬预算约束下为多轮评测动态分配交互并校准预测界
HARP 是硬计算预算下的多轮评测分配与校准方法,用来构造 time-to-event 预测界,并估计越狱率一类边际指标。
提出合规双探针基准,测量模型可利用性与可停止性
合规指数κ用来把语言模型放在“照做”和“推回”之间。
评测模型识别不可能工程题后是否仍报已解决
成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
评测文生图模型的有害内容生成能力与审核检测缺口
提出 VERA,审计 LLM 漏洞解释里的虚构推理
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错
CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出基准 OLMo-Detect 评测 LLM 成员推断
系统评估循环语言模型加深 loop 后的 CoT 可监控性
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。