HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架
HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。