风险行为arXiv:2609.27900 · 8月26日论文揭示多智能体委派结构放大 LLM 安全风险测量多智能体委托结构下有害任务拒答的失效多智能体·测试Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个·应用层拒答失当摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。完整解读
评测与基准arXiv:2609.35902 · 9月28日QH-Bench:面向中国青少年内容安全的细粒度中文基准构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性模型与 API·测试InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个·模型层拒答失当摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。完整解读