防御arXiv 2505.23559
SafeScientist:让 LLM 智能体的科学发现具备风险意识
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
- arXiv
- 2505.23559
- 发表
- 层
- 应用层
- 被测模型
- GPT-4o、GPT-4.1、GPT-3.5-turbo 等 5 个
摘要四层监控加科研安全基准。
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。