- 评测与基准arXiv 2604.02947
AgentHazard:评估计算机使用智能体有害行为的基准
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
- arXiv
- 2604.02947
- 发表
- 层
- 应用层
- 攻击恶意使用
摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
- 防御arXiv 2609.22724
MATE:面向移动 Agent 的策略感知安全审计方法
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
- arXiv
- 2609.22724
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 攻击者
- 黑盒
- 防御监控与审计
- 攻击恶意使用
- 风险Agent 危险操作
- 组件监控器
摘要MATE 用合成轨迹微调轻量审计器,在可编辑策略下判断移动智能体轨迹是否违规并给出解释。
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
已经到底了