评测与基准arXiv 2610.06306
Inspect Robots:面向具身智能体评测的开源模块化框架
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
- arXiv
- 2610.06306
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 被测模型
- Astra(GPT-6 Astra)、GPT-6 Sol、GPT-5.6 Sol 等 7 个
- 风险拒答失当
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
评测 ReAct 工具调用对多模态模型拒答有害请求的削弱
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
提出 CBM,用模型路由与多模型协作缓解群体偏见
CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。
发现暴露模型家族标签会让多智能体派系化并削弱合作
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
提出 AGENT BOUNDARY,用四向反事实任务评测工具智能体行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。
评测多智能体委托结构如何放大模型的安全拒答失效
摘要论文揭示多智能体层级委托会导致单模型安全对齐失效,多项前沿模型有害执行大幅增加且单层防御难以奏效。
提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别
BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。