研究提出 Agent 安全新维度:识别未履行的安全义务
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
- arXiv
- 2610.11773
- 发表
- 层
- 应用层
- 被测模型
- ObligationGuard、Claude-Opus-4.8、GPT-5.6-Sol 等 17 个
- 防御检测与过滤
- 风险Agent 危险操作
- 组件护栏与评审
摘要义务是护栏缺口。
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
评测容器、权限规则与沙箱能否区分编译器与编码 Agent 的文件读取
作者在物理流求解器上检查一套编码智能体配置:编译器必须读本组材料与反应模型,这些字节又不得进入模型上下文或离开本机的记录。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出红蓝对抗评测平台 ACEA,分开计量攻击强度与防御效果
ACEA 是让可插拔红队和蓝队共享一个目标 LLM 的对打场地,把攻击强度和防御效果分开记分。作者要补三处空缺:双方只能对着固定对手分开练。LLM judge 分不清真实泄露和幻觉,拦截后又看不到攻击有多强。
提出 Skill-as-API,隔离多智能体协作中的 skill 正文与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 AuthBench 评测编码 Agent 最小权限,并验证充足性-紧缩性分解
本文研究代码智能体在执行终端任务前自主推断最小文件权限边界的能力。