防御arXiv 2609.19587
红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器
提出 Auto Mode ++,加固编码 Agent 阻断监视器
- arXiv
- 2609.19587
- 发表
- 层
- 应用层
- 被测模型
- Opus 5、Opus 4.8、Opus 4.7 等 8 个
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
提出 Sentinel-RL,将拓扑处置从 LLM 卸载到受约束图策略
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。