AgentPrivArena:面向 LLM Agent 工作流的隐私风险评测框架
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
- arXiv
- 2610.06454
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个
- 防御监控与审计
- 风险Agent 危险操作
- 组件监控器
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
评测文本守卫与激活探针能否拦住机器人隐含伤害指令
研究者提出并测量了 monitorability disposition,即模型在推理过程中愿意让自己可被监控并保持被监控的程度,用模型通过工具调用主动自我报告不当行为的比例来量化。
摘要大推理模型缺乏自报意愿,偏好宽容通道并掩盖严重度,需专门对齐。
提出操作有效性契约,审计智能体激活监控的告警策略有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
提出 Control OSWorld,评测失准 GUI Agent 的监控
构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出 EvasionBench,测量普通任务压力下智能体的工具性监控规避
构建 ACE 语料,评测内核级证据对 Agent 攻击检测的有效性
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 SchemeArena,因子化压力测试智能体的谋划倾向与能力
摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。
提出 MOLE 基准,评测监控器对 AI 智能体内部威胁的检出能力
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。