HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
评测编码智能体 harness 安全机制在对抗任务中的防护效果
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出多智能体系统提示注入的威胁模型与四层架构防御
提出可验证操作卡 VAC,把智能体浏览器确认绑定到真实 DOM 操作
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 k-robust 联盟对齐,刻画误对齐评审下的安全委托授权
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 MasDrift,评测多智能体在良性任务中的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
建模并利用多智能体网络中子智能体生成时的记忆继承漏洞
作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的 PoC 演示编排层如何让单点妥协继续扩散。