SafeScientist:让 LLM 智能体的科学发现具备风险意识
SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents
AI 导读
研究者提出 AI 科学家框架 SafeScientist,主动拒绝伦理不当或高风险任务,并整合提示词监控、智能体协作监控、工具使用监控与伦理审查组件。配套基准 SciSafetyBench 覆盖 6 个领域的 240 个高风险科学任务、30 个科学工具及 120 个工具相关风险任务。实验显示其安全性能较传统 AI 科学家框架提升 35%,且未损害科研产出质量,并在多种对抗攻击下验证了安全流程的稳健性。