研究提出 Agent 安全新维度:识别未履行的安全义务
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
- arXiv
- 2610.11773
- 发表
- 层
- 应用层
- 被测模型
- ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件护栏与评审
摘要义务是护栏缺口。
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进
VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。
提出 ASA 与 AttestMCP,度量并降低 LLM 对输入序列扰动的敏感
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊
Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。
提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊
STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。