风险行为arXiv 2608.10218
研究者用进化算法构造多智能体 LLM 系统中的自我传播“思维病毒”
用演化算法构造思维病毒并测量其在多智能体中的传播
- arXiv
- 2608.10218
- 发表
- 层
- 应用层
- 测试
- Claude Haiku 4.5、Claude Sonnet 4.6、Claude Opus 4.6 等 9 个
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。