风险行为arXiv:2609.39050 · 9月30日研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控测量良性协作中智能体隐蔽传递凭据并绕过监控多智能体·测试DeepSeek-V4-Pro、devstral-2512、gpt-oss-120b 等 15 个·应用层欺骗与谋划监控器+1+1摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。完整解读
评测与基准arXiv:2610.03153 · 10月2日EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准提出 EvoRiskBench,评测工作区智能体的运行时安全风险编程 Agent多智能体·测试GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5·应用层提示注入MCP 与技能摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。完整解读
风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读