Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作
提出 OATS,用确定性解析器在运行时治理 Agent 技能动作
- arXiv
- 2609.12001
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- GPT-5.5、gpt-5-mini、codex-security-worker 等 4 个
- 防御权限与审批
- 风险Agent 危险操作
- 组件权限与沙箱
摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门 OATS,展示了双层防御组合的必要性。
另有 701 篇论文还没打上分类标签,暂不在筛选结果里。
提出 OATS,用确定性解析器在运行时治理 Agent 技能动作
摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门 OATS,展示了双层防御组合的必要性。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。
用 MasDrift 评测多智能体架构的授权保持
MasDrift 把多智能体设计中的授权保持做成可测量性质,对象是没有攻击者的普通委托。
提出 HazardAuditor 与 GuardPO,训练计算机使用智能体的运行时守卫
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。