评测与基准arXiv 2609.34790
CoSec:面向社区场景的 LLM Agent 安全基准
用 CoSec 评测社区 Agent 是否越界披露受保护信息
- arXiv
- 2609.34790
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- OpenClaw with Gemini 3.1 Pro、OpenClaw with Qwen 3.8 Max、OpenClaw with MiniMax M2.5 等 13 个
用 CoSec 评测社区 Agent 是否越界披露受保护信息
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。