防御arXiv 2312.06632
用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
- arXiv
- 2312.06632
- 发表
- 层
- 应用层
- 被测模型
- SciGuard (GPT-4)、SciGuard (Gemini)、SciGuard (Mixtral) 等 5 个
摘要SciGuard 以外部智能体控制化学 AI 误用。
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。