分析与理论arXiv:2610.06001 · 10月5日AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击提出 AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击编程 Agent·测试gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个·应用层检测与过滤投毒与后门MCP 与技能+1+1摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。完整解读
分析与理论arXiv:2610.01535 · 10月1日论文:安全路由评测在分布偏移下失效,基线选取偏差被低估分析分布偏移下安全路由评测的基线选择偏差与虚假下限LLM 应用·测试claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个·应用层越狱+1+1摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。完整解读