评测与基准arXiv:2609.19587 · 9月17日红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固编程 Agent·测试Opus 5、Opus 4.8、Opus 4.7 等 8 个·应用层监控与审计欺骗与谋划监控器摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。完整解读
评测与基准arXiv:2609.32691 · 9月26日研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差AI Agent·测试gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个·应用层提示注入权限与沙箱摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。完整解读