风险行为arXiv 2608.10218
研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”
用演化算法构造思维病毒并测量其在多智能体中的传播
- arXiv
- 2608.10218
- 发表
- 层
- 应用层
- 测试
- Claude Haiku 4.5、Claude Sonnet 4.6、Claude Opus 4.6 等 9 个
用演化算法构造思维病毒并测量其在多智能体中的传播
测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 CAVE-BENCH,评测虚假指责下智能体破坏已完成正确工作的行为
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。