评测与基准arXiv:2610.03153 · 10月2日EvoRiskBench:面向工作区 Agent 运行时安全风险的演化基准提出 EvoRiskBench,评测工作区智能体的运行时安全风险编程 Agent多智能体·测试GPT-5.6 Sol、DeepSeek-V4-Pro-0813、Claude Opus 5·应用层提示注入MCP 与技能摘要论文构建了工作空间智能体运行时风险基准 EvoRiskBench,发现高执行力智能体在 IPI 下面临较高安全风险。完整解读
评测与基准arXiv:2609.32635 · 9月26日TrustFork:显示身份如何劫持 LLM 智能体编排的权限提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限多智能体·测试GPT-5.6-Sol、GPT-5.6-Luna、Kimi-K3 等 8 个·应用层诱导选用摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。完整解读
评测与基准arXiv:2609.17320 · 9月15日Emergence World:对长时程多智能体系统开展对抗压力测试构建 Emergence World,评测长时程多智能体对抗韧性与群体失效多智能体·测试Claude Opus 4.8、DeepSeek v4 Pro、Gemini 3.5 Flash 等 9 个·应用层提示注入失准与价值偏离记忆摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。完整解读