研究提出 Agent 安全新维度:识别未履行的安全义务
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
- arXiv
- 2610.11773
- 发表
- 层
- 应用层
- 被测模型
- ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件护栏与评审
摘要义务是护栏缺口。
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
另有 244 篇论文还没打上分类标签,暂不在筛选结果里。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。
作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
评测编码智能体 harness 安全机制在对抗任务中的防护效果
评测文生图模型的有害内容生成能力与审核检测缺口
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出 CorrectGuard,在不可查看输入上估计黑盒护栏决策对错
CorrectGuard 面向不能人工检查生产输入、也没有生产标签的黑盒安全护栏,用外部模型估计单条决策是否正确,并据此排序和弃权。离线基准会随数据和攻击变化,未必代表生产分布。隐私约束还可能禁止模型查看原文或可反演的稠密嵌入。
提出 SecJev,用场景加权训练把决策模型适配为安全类型化判断
SecJev 是 0.8B 到 9B 的安全决策模型族,作者称据其所知是首个面向安全的 Jev-like 家族。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。
系统评估循环语言模型加深 loop 后的 CoT 可监控性
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。