风险行为arXiv 2608.10218·8月11日研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”用演化算法构造思维病毒并测量其在多智能体中的传播arXiv2608.10218发表8月11日层应用层场景多智能体、编程 Agent风险失准与价值偏离组件记忆深度解读完整解读
评测与基准arXiv 2609.08126·9月8日SchemeArena:面向 LLM 智能体谋划的因子化压力测试基准提出 SchemeArena 因子化评测智能体的谋划倾向arXiv2609.08126发表9月8日层应用层场景编程 Agent风险欺骗与谋划组件监控器+1+1摘要SchemeArena 把 scheming 拆成目标和 hint 等因子。深度解读完整解读