评测与基准arXiv 2610.06454
AgentPrivArena:面向 LLM Agent 工作流的隐私风险评测框架
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
- arXiv
- 2610.06454
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4、DeepSeek-V4-Pro、Kimi-K2.6 等 6 个
- 防御监控与审计
- 风险Agent 危险操作
- 组件监控器
提出 AgentPrivArena 与运行时审计,评测 Agent 轨迹级隐私泄露
展示智能体在禁止泄露与独立监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
评测开发者能否在协作编程中发现编码 Agent 的隐蔽破坏
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。