研究提出 Agent 安全新维度:识别未履行的安全义务
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
- arXiv
- 2610.11773
- 发表
- 层
- 应用层
- 被测模型
- ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件护栏与评审
摘要义务是护栏缺口。
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
提出手语转文本接入儿童安全过滤的部署前审计协议
手语儿童到达基于文本的儿童安全机制时,机制看到的是机器翻译,不是儿童所做的手语。作者要解决的是:这条边界在部署前应如何审计。
提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
评测文生图模型的有害内容生成能力与审核检测缺口
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 HAL 污染审计框架并核验智能体排行榜评分器
作者给出一套测量优先审计框架,用来判断智能体排行榜上的污染主张各自需要何种证据。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出面向 RAG 的证据优先发布框架 AGO,并评测评审 adherence 判别
AGO 是部署在企业 RAG 评估业务中的自托管发布门控,用来决定一个版本应放行、人工复核还是拦截。
提出 RAIM,用交叉拟合堆叠聚合廉价评审检测幻觉
摘要十个廉价评审的堆叠在可采纳区间接近 Sonnet,代价主要是一次域内校准。
提出 MADBench,评测多智能体辩论是吸收还是放大对抗影响
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
对比类型化评审与生成式评审对智能体轨迹的安全判定
在已保存的工具使用智能体轨迹上,比较类型化评审 JEV 与四种生成式评审的回溯安全分类。
审计 Agent 基准通过轨迹,区分无根据通过与奖励黑客并封堵复测
Scale AI 的这篇工作把 agentic benchmark 的有效性写成持续维护问题:验证器给满分,并不等于智能体展示了任务所要的能力。
评测 RAG 中过期文档推翻模型原本正确回答的现象
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出 PIDS-Bench,评测提示注入检测器在过度防御与分布偏移下的表现
PIDS-Bench 是一个冻结的检测器级基准,用来在固定阈值下同时看提示注入检测和良性误报。
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。