评测与基准arXiv 2610.07639
HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
评测编码智能体 harness 安全机制在对抗任务中的防护效果
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
评测编码智能体 harness 安全机制在对抗任务中的防护效果
提出 PAA 方法,在边界动作前审计长流程智能体的分阶段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
形式化编程 Agent 的审批洗白并提出 HMAC 权能令牌防御
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出针对 Agent Harness 的上下文特权提升攻击
提出 ClawSentry 多层监控网关,在技能准入和运行时拦截恶意技能与隐藏指令
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向