PowerBench 评测 24 个模型在权力转移请求上的偏见
提出 PowerBench,测量模型对权力转移请求的拒答偏见
- arXiv
- 2610.02303
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- grok-4.3、haiku-4.5、nova-2-lite 等 18 个
- 风险偏见与歧视
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
提出 PowerBench,测量模型对权力转移请求的拒答偏见
摘要作者报告拒答随 SE/DE/PG 变化,并存在针对美国失权、智能体和语言的差。
测量并预测具身 VLM 规划器的任务拒答可变性
作者测量 constitution 守护的具身 VLM 规划器:一次拒答在只往场景里放一个日常物体之后还保不保持得住,并把这种易翻转程度称为任务的 malleability。
构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性
QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。
评测多智能体委托结构如何放大模型的安全拒答失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。
测量 LLM 在类米尔格拉姆服从实验中是否施加最高电击
类米尔格拉姆变体用来看开源 LLM 会不会在逐档升级的权威指令下,把模拟电击加到尽头。
提出 RefusalBench,评测生物研究提示上的拒答率与安全校准
构建 IndicSafe 基准,评测 Indic 语言安全标签的跨语言一致性
摘要作者称安全对齐不随语言保持不变。
提出 LABSHIELD,评测科学实验室智能体的安全推理与规划