分析与理论arXiv:2610.06001 · 10月5日AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击提出AgentSpy,在系统调用层观测编程智能体并检测技能注入攻击测试gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个·应用层场景编程 Agent检测与过滤投毒与后门MCP 与技能+1+1摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。完整解读
分析与理论arXiv:2610.01535 · 10月1日论文:安全路由评测在分布偏移下失效,基线选取偏差被低估分析分布偏移下安全路由评测的基线选择偏差与虚假下限测试claude-3-5-sonnet、claude-3-opus、claude-sonnet-4-6 等 12 个·应用层场景LLM 应用越狱+1+1摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。论文定位:论文系统评估了多模型安全路由与基于信号的防御机制在分布偏移下的有效性,指出流行评测中后验选择基准所造成的评估误导。要解决的问题:传统路由评估常在测试数据上事后挑选最佳单模型,在分布偏移下为固定基线注入了人为优势,构成了 deployer 无法实现的虚假下限。关键方法:提出在训练折严格冻结基准模型与收缩因子的诚实留出协议;推导超额危害分解与多维门槛表面;在智能体与技能注入环境中测试预执行路由上限、自适应模板攻击与动作级策略。核心实验发现:在 HELM Safety 类别留出下,后验基准的选择代价为 0.045 至 0.113(Table II),与路由全额劣势相当;在平稳划分下仅为 0.003 至 0.030。在诚实基准下,路由器在 82% 至 91% 的池单元中直接收缩为固定基准模型,危害差异中位数为 0.0000(Section IV)。AgentDojo 智能体网格中预执行路由预言机增益至多 0.0105(E43)。针对性自适应攻击使 gpt-5.4 表达性标记率下降 19.6 点(E54b),使门控控制器的有效性取决于后备模型漏洞。四项动作级防御测试取得 0/130 判定成功,但模式对齐后有效样本仅 10 个(Clopper–Pearson 上界 0.308,Table XVI),且未见机械强制阻断标记。作者结论与启示:作者认为安全路由在应对未见类别时的防御收益微弱,安全评估必须使用未见测试标签的诚实基准并公布成对数据;防御重心应从脆弱的输入分类转向外部动作级强制隔离。完整解读