论文揭示多智能体委派结构放大 LLM 安全风险
测量多智能体委托结构下有害任务拒答的失效
- arXiv
- 2609.27900
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Claude-Sonnet-4.6、GPT-5、Gemini-3.1-Pro 等 6 个
- 风险拒答失当
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
测量多智能体委托结构下有害任务拒答的失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性
QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。
测量并预测具身 VLM 规划器在日常物体插入后的拒答可塑性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
提出 AURA-Eval 评测工具调用 Agent 的情境风险意识与行动
AURA-Eval 是一个面向工具使用轨迹的增强与诊断框架,用来分开看智能体是否说出风险、采取哪种行动策略、以及该行动相对场景风险是否安全。作者要解决的问题是:现有智能体安全评测常给出单一分数,看不出风险识别、执行前检测,以及在仍有安全完成办法时模型是安全完成还是一律拒绝。
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。
提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。