HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制
评测编码智能体 harness 安全机制在对抗任务中的防护效果
- arXiv
- 2610.07639
- 发表
- 层
- 应用层
评测编码智能体 harness 安全机制在对抗任务中的防护效果
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限
Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认
提出 CAVE-BENCH,评测智能体在虚假指责下破坏已完成的正确工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 Twin Agent,用预算内残差 hint 隔离不可信输入与特权动作
提出 AHA 自动科研循环,发现生产 Agent 的可复用漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 CONTRA 树搜索,通过良性配置修改诱发个人化 Agent 执行恶意动作
提出 MOSAIC,用 CLI 安全知识库构造编码 Agent 的命令组合攻击
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。