风险行为arXiv 2609.39050·9月30日研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控测量良性多智能体协作中自发隐蔽传递凭据以绕过监控arXiv2609.39050发表9月30日层应用层场景多智能体、编程 Agent风险欺骗与谋划组件监控器+1+1摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。深度解读完整解读
防御arXiv 2609.17648·9月15日多智能体 LLM 流水线中的信任传播与结构隔离提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行arXiv2609.17648发表9月15日层应用层场景多智能体防御权限与审批攻击投毒与后门组件权限与沙箱+2+2摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。深度解读完整解读