风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读
分析与理论arXiv:2609.32717 · 9月26日研究揭示语义保持变换下的 LLM 对齐与效用不对称用语义保留变换探针比较效用与对齐在分布偏移下的稳定性模型与 API·测试Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个·模型层拒答失当摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。完整解读