评测与基准arXiv:2610.07089 · 10月5日研究者提出统一滥用监控基准,覆盖分解攻击与提示注入约 6200 条轨迹构建统一滥用监视基准,用危害窗口评测跨威胁动作监控AI Agent·测试Gemma 4 26B-A4B、Qwen3.6 27B、Qwen3.5 27B 等 12 个·应用层监控与审计越狱多轮渐进监控器+1+1摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。完整解读
攻击arXiv:2608.30441 · 8月31日ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹AI Agent攻击者黑盒·测试DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个·应用层提示注入自动化搜索MCP 与技能+2+2完整解读
评测与基准arXiv:2609.32635 · 9月26日TrustFork:显示身份如何劫持 LLM 智能体编排的权限提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限多智能体·测试GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个·应用层诱导选用摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。完整解读