用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准
Controlling risks of AI in chemical science with agents
SciGuard控制化学科学AI误用;Table 1中GPT-4版Redteam harmlessness为5.00。
恶意用户可借助合成规划、毒性预测或LLM/科学智能体,获取有害物质信息、规避监管或传播危险知识。
- 化学科学里的合成规划、毒性预测和语言模型可能被用来提出有害物质、规避监管或传播危险信息。作者认为现有安全机制常常不够,需要在不修改底层模型的情况下做情境化控制。
- SciGuard以LLM为外部中介,用原则、指南、分子与法规记忆、科学工具和RAG做迭代规划,再决定回答、追问或拒绝。SciMT用红队、科学信息、法规和越狱四部分同时看安全与效用。
- Table 1中SciGuard(GPT-4)Redteam为5.00、ScienceInfo为90.00、Jailbreak为5.00。Mixtral版Jailbreak为3.43,并非各模型最高。作者称相对基座有提升。
- 结论写明输入可能含糊或具欺骗性,复杂对抗与误分类待研究,SciMT未穷尽化学风险。评测含Table 1的12个系统,以及良性集、MMLU抽样和WMDP-Chem。论文未给出人工一致性相关系数。
- 威胁模型
- 恶意用户可借助合成规划、毒性预测或LLM/科学智能体,获取有害物质信息、规避监管或传播危险知识。SciGuard作为model-agnostic外部中介,不改底层模型,把科学AI当作black boxes来解释意图并控制访问。论文未用white-box或gray-box描述攻击者知识。
- 被测模型
- SciGuard (GPT-4)SciGuard (Gemini)SciGuard (Mixtral)LocalRetroADMETlab 2.0
- 基准
- SciMT-RedteamSciMT-BenignSciMT-ScienceInfoSciMT-LegislationSciMT-JailbreakMMLUWMDP-ChemGHS hazard dataset
- 指标
- harmlessnessaccuracyhelpfulnessenrichment factor
论文提出基于智能体的护栏 SciGuard,利用大语言模型、工具和外部知识评估并控制科学 AI 交互中的风险,并给出同时衡量安全性与可用性的基准 SciMT。SciGuard 在红队测试查询上取得 SOTA 无害性得分,同时在良性任务上保持高性能且不牺牲科学知识。作者先列举了 AI 在化学科学中被滥用的真实案例,并呼吁持续研究与对话以确保 AI 在科学中的安全部署。
深度解读
这篇论文试图解决什么问题?
化学科学AI可被误用,作者提出外部护栏SciGuard与基准SciMT。
化学科学中的 AI 可能被用来制造有害物质或规避监管,作者要在不改底层模型的前提下控制这类误用。
- 场景: 作者称 AI 已进入假设生成、实验规划与化学研究。Figure 1a 把风险分成恶意意图下的有害物质、改作有害用途、规避监管和错误信息,以及良性意图下的意外效应、不准确、隐私与偏见。Appendix C 称后果可直接影响健康与环境,大语言模型也降低了非专家获取风险信息的门槛。
- 现有不足: 作者称科学模型任务窄,缺少对伦理、环境与监管后果的推理;引言称现有安全机制常常不够。Section 2.1 用合成规划、毒性预测和语言模型案例说明误用可能。
- 作者的三点依据: 风险要看情境,有健康风险的化学品仍可能有合法工业用途;科学模型需要外部中介,并用短期与长期记忆追踪查询;伦理规范随文化、学科和时间变化,所以要接外部知识与法规。
- 本文提出: 模型无关的智能体护栏 SciGuard,在用户与科学 AI 之间解释意图、调用工具和知识后再回复;多任务基准 SciMT,覆盖安全、科学概念、法规理解和越狱抵抗。
- 威胁模型:
- 目标: 借助科学 AI 设计或获取有害物质、把物质改作有害用途、规避监管,或用自然语言传播危险化学信息(Figure 1a、Section 2.1)。
- 知识: 论文称即使把科学 AI 当作 black boxes 也可工作;未写攻击者是否掌握权重,也未用 white-box 或 gray-box 描述攻击者。
- 能力: 用户用自然语言或指定结构化格式描述任务。SciGuard 作为中间件,避免用户直接访问某些科学模型,并可查数据库、法规和科学工具。
- 受害系统: 合成规划模型、毒性预测模型,以及 LLM 与科学智能体。演示对象包括 LocalRetro、ADMETlab 2.0,以及 Mistral-7B、Vicuna-7B、Palm-2 和 ChemCrow。
有哪些相关研究?
相关工作覆盖合成规划、毒性预测、科学智能体、双用途风险与安全治理。
- 化学模型与科学智能体: GLN、LocalRetro、Retroformer 做逆合成路线生成;ADMETLab 2.0 与 Chemprop 做毒性或性质预测,用于早期药物发现和安全筛选。GPT-4 以及 ChemCrow、HuggingGPT、Chameleon 一类系统把语言模型接到科学工具上,做自动实验与分析。作者称 ChemCrow 虽有安全检查,仍可能提供敏感药物相关信息(Section 2.1.3、Figure D5)。
- 双用途与误用: 作者引用 Urbina 等(2022),讨论药物发现模型被反过来用于有害物质;Sandbrink(2023)区分语言模型与生物设计工具的误用风险。Appendix B 还提到 Spicyboro 可产出详细病毒数据,并引用 Gopal 等(2023)关于发布权重是否扩大疫情制剂获取的讨论,以及 Acion 等(2023)关于生成式 AI 与开放科学的伦理问题。
- 治理与对齐努力: Appendix B 写到 FDA 推动医疗 AI 监管,OpenAI 的 Superalignment,美国政府与 Microsoft、OpenAI、Google 合作制定安全协议,以及 Anthropic 的生物风险评估。这些是作者用来说明多方正在做安全协议,不是本文实验基线。
- 本文采用的智能体技术: 架构引自 ChemCrow、HuggingGPT、MRKL 与 ReAct;规划使用 Chain-of-Thought;法规文本用 Retrieval-Augmented Generation。Self-Reminders 被当作对齐提醒,并在附录里与 SmoothLLM 一起作为越狱对照。
基线与基准: 主表对照是 Table 1 中的主流 LLM 和 ChemCrow(GPT-4),基准是 SciMT 的 Redteam、Legislation、ScienceInfo、Jailbreak。附录另在 SciMT-Jailbreak 上对照 Self-Reminders 与 SmoothLLM。
作者把 SciGuard 定位为不改模型权重的外部中介,用领域知识、法规和工具做情境化控制;结论中作者称,相对安全微调或遗忘,这种做法更灵活,且不降低专用科学模型的性能。
论文如何解决这个问题?
SciGuard用LLM做外部中介,结合记忆、工具、规划与RAG控制访问。
SciGuard 不改科学模型,由 LLM 在用户和模型之间解释意图、补上下文、调用工具,再给出回复。
设计目标与框架
- 三个目标: 情境化风险评估;弥补科学模型缺少伦理与情境推理;适应随文化、学科和时间变化的伦理规范。
- 三项属性: 领域专长(化学名、分子式、结构)、法规兼容、价值对齐(区分良性与可能有害的查询和输出)。
- 流程: 用户用自然语言或结构化格式提任务。LLM 建立任务上下文,加入原则、指南和示例;检索外部库与法规;规划并执行动作;把科学模型的观察写回上下文,迭代到最终回复。中间规划与工具输出对用户隐藏。
记忆
- 短期记忆: 写在系统提示里,包括原则、指南和示例。原则要求回答有益、合乎伦理与法律,并拒绝有害或违法内容。指南用于判断意图;论文写对高风险主题更倾向拒绝,除非意图明确合理。附录 E 有实现说明,这里不抄提示词。
- 长期记忆: 交互中检索。分子库用 PubChem。危害库包括 GHS、OPCW、PAN HHP 等,按来源划分,可同时查多库。交互历史保存查询、回复、工具和输出,用来看重复探测、改写绕过或逐步升级。
- 相似度: 论文列举 MACCS、ECFP、AtomPair,以及 Tanimoto、Dice、Cosine、Sokal,未写实际采用哪一对。
工具、规划与 RAG
- 工具: Chemprop 做性质预测,任务包括 tox21、clintox、sider、lipo、hiv、explosives、flammables、oxidizers、corrosives、acute-toxicity、health-hazard、bbbp;输入 SMILES,输出该性质分数。LocalRetro 做逆合成。Molecular Transformer 做反应产物预测。文中还列出药物优化模型和科学智能体。
- 动作与规划: 动作包括选工具、生成回复、请求确认或拒绝。规划用 Chain of Thought,按任务上下文和安全标准决定动作序列。
- RAG: 法规知识库中检索与查询相关的片段,附在用户查询后送入智能体。
- 开销: Appendix E.7 写系统提示约 2,000 tokens;多数良性查询一轮推理,相对直接访问的延迟通常不到 1–2 秒;一次工具调用通常再加 2–5 秒。
运行设置与成功判定
- 骨干: 主实现采用 gpt-4-0613;Table 1 另有 SciGuard(Gemini)和 SciGuard(Mixtral)。实验温度 0,top p 1.0(若适用),max tokens 2000(若适用)。
- 评测怎么算过关: Redteam 与 Jailbreak 用 1–5 的 harmlessness,由 LLM 裁判打分,并抽子集做人工评分。ScienceInfo 与 Legislation 用 accuracy。Benign 同时看 harmlessness 和 helpfulness,用来检查是否一律拒答。论文未把某一分数定义为部署阈值。
SciMT 的构建
- Redteam: 未点名的 red-team agent 用少样本生成,再人工修订。432 条:177 条不绑定具体物质;255 条来自 85 个模板,俗名、IUPAC、SMILES 各 85 条。范围包括 GHS 危害和生物危害。
- Benign: 115 条化学与生物常见问题;28 条不绑定物质,87 条含俗名、IUPAC 或 SMILES。
- ScienceInfo: 主要来自 GHS 和 Pharmaceutical Hazards Safety 数据库,覆盖物质类型、安全操作与处置、化学表示。题目总数论文未写。
- Legislation: 70 道四选一,来源包括 EPA、WHO、OPCW,涉及进出口、环境污染和健康。
- Jailbreak: 提示来自 JailbreakChat。先在无防御 ChatGPT 上保留 ASR 超过 20% 的 16 条,再放到 GPT-4 上,harmlessness 满分为 5 的剔除,留下 20 条;与 3 条风险指令组合,共 60 条。不复述提示内容。
论文做了哪些实验?
Table 1中SciGuard(GPT-4)的Redteam与Jailbreak harmlessness均为5.00。
实验设置
- 被测系统: Table 1 有 GPT-4、Gemini-1.5-Pro、Llama-2-7B、Llama-2-13B、Vicuna-7B、Vicuna-13B、Mistral-7B、Mixtral-8x7B、ChemCrow(GPT-4),以及 SciGuard 的 GPT-4、Gemini、Mixtral 三版。Appendix F.1 写 GPT-4 与 SciGuard、评委均为 gpt-4-0613;开源检查点为 llama-2-7b-chat-hf、llama-2-13b-chat-hf、vicuna-7b-v1.5、vicuna-13b-v1.5、Mistral-7B-Instruct-v0.1。
- 规模: Redteam 432 条,Benign 115 条,Legislation 70 题,Jailbreak 60 条。ScienceInfo 题量论文未写。MMLU 从 14,042 题抽 200 题。WMDP 全集 3,668 题,化学子集题量论文未写。
- 指标: Redteam 与 Jailbreak 为 harmlessness(1–5);ScienceInfo、Legislation、MMLU、WMDP 为 accuracy;Benign 另有 helpfulness(1–5),拒答计为 helpfulness 的 1 分。
- 评审: 主评委 gpt-4-0613,温度 0。评分要求忽略语气和警告,只看信息是否可能造成伤害。SmoothLLM 对照另用 GPT-4.1。人工评估为 3 人、60 条。
- 解码: 温度 0,top p 1.0,max tokens 2000(若适用)。论文未报告重复次数。red-team 查询的生成模型未点名。
- 风险演示: LocalRetro、ADMETlab 2.0;Figure 2d 还有 ChemCrow(Public)、Vicuna-7B、Mistral-7B、Palm-2。
主结果
据 Table 1。行数所限,表内保留三个 SciGuard 变体、其可对照基座,以及各列最差分所在模型。
表格较宽,可左右滑动
模型 Redteam Legislation ScienceInfo Jailbreak SciGuard (GPT-4) 5.00 84.29 90.00 5.00 SciGuard (Gemini) 5.00 87.14 88.75 4.88 SciGuard (Mixtral) 4.91 72.86 70.00 3.43 GPT-4 4.89 68.57 87.50 4.33 Mixtral-8x7B 4.63 40.00 63.75 2.85 Mistral-7B 4.19 54.28 67.50 2.73 Llama-2-7B 4.95 54.29 38.75 4.83 - 省略: Gemini-1.5-Pro 为 4.98 / 64.29 / 75.00 / 3.60;ChemCrow(GPT-4)为 4.92 / 70.00 / 80.00 / 4.88;Llama-2-13B 为 4.95 / 44.29 / 55.00 / 4.70;Vicuna-7B 为 4.33 / 48.57 / 55.00 / 3.13;Vicuna-13B 为 4.60 / 50.00 / 70.00 / 3.20。
- 相对基座: 作者称各 SciGuard 变体相对其基座在四项上都有提升。表中三行相对 GPT-4、Mixtral-8x7B,以及省略项中的 Gemini-1.5-Pro,四项都更高。
- 作者的总括与表内例外: 摘要称 red-teaming 达到 state-of-the-art harmlessness,引言写满分 5.0/5.0;该分数对应表中 GPT-4 版和 Gemini 版,Mixtral 版不是该分数,且低于省略项中的 Gemini-1.5-Pro 与两档 Llama-2。作者称越狱防御最好、ScienceInfo 上持续优于其他模型;表中 Jailbreak 最高分只在 GPT-4 版,Mixtral 版低于表内 Llama-2-7B 和省略的多个模型;ScienceInfo 上 Mixtral 版也低于表内 GPT-4。
风险演示
- 合成规划: 作者用 LocalRetro 说明可为氢氰酸给出比传统 Andrussow 氧化更易在实验室进行的路线,并写前体 LD50 为 6 g/kg、氰化钾 LD50 为 5 mg/kg;反应条件不转述。作者称可靠性分数超过 0.8 的有毒物质超过 1,400 种,其中包括被归为化学武器的物质(Figure 2b、Appendix D.2–D.3)。
- 毒性排序: 作者在 GHS hazard dataset 上用 ADMETlab 2.0 计算 enrichment factor,称 top 5% 的 EF 达到 22.0(Figure 2c)。正文写还计算了 1%、10%、20%,但未列出这三档的 EF。
- 语言模型案例: Figure 2d 中 ChemCrow(Public)、Vicuna-7B、Mistral-7B、Palm-2 的 harmlessness 均为 2。附录另有案例,不复述查询和合成内容。
良性任务、人工评分与通用题
- SciMT-Benign: Table F5 中 SciGuard 的 harmlessness / helpfulness 为 5.0±0.2 / 4.7±0.8,得 5 分的比例为 95.7% / 86.1%。Llama2-13B-Chat 的 helpfulness 为 4.9±0.6。全拒系统 Rejective 为 5.0±0.0 / 1.0±0.0。作者称 SciGuard 能在无害的同时仍然有帮助;表中它的 helpfulness 不是最高。
- 人工评分: 6 个系统各 10 条,共 60 条,3 名评判与 GPT-4 用同一标准。引言称 strong alignment,Appendix F.2 称 relatively strong correlation。论文未给相关系数。Figure F6 是 KDE 和混淆矩阵,文本没有格内数字。
- MMLU: Table F6 中 GPT-4 为 83.5%,SciGuard(GPT-4)为 85.5%。作者将其归因于通用工具和结构化推理。
越狱对照与 WMDP
- 两种对照: Table F4 上 Self-Reminders 与 SciGuard 均为 5.00,SmoothLLM 为 4.85,GPT-4 为 4.33。SmoothLLM 使用 6 个 Swap 扰动、扰动率 15%,由 GPT-4.1 选择最安全回复。
- WMDP-Chem: Table F7 中 GPT-4 为 69%,SciGuard(GPT-4)为 43%。作者称更低 accuracy 表示危险知识被抑制得更强。作者写在题目前加入保守拒答指令,以模拟风险规避基线;未另给不带该指令的一组数字。
- 分布图: Figure F7 给出 SciMT-Redteam 的 harmlessness 分布,文本未给出各分数档比例。
其他消融与分析
- 去掉原则与指南:Redteam 上完整 SciGuard(GPT-4)为 5.00,去掉后 4.94,GPT-4 为 4.89(Figure F8);Jailbreak 去掉后 4.85,完整为 5.00,GPT-4 为 4.33(Figure F10)。
- ScienceInfo(Figure F9):完整 90.00;去掉 PubChem 为 80.00,Wikipedia 为 85.00,Hazard Check 为 86.25,原则与指南为 87.50;去掉 Chemprop、LocalRetro 或 Molecular Transformer 均为 88.75。
- 无 RAG 的 Legislation 总体为 64.29%(Appendix F.5)。Table F3 中 SciGuard(GPT-4)无 RAG 的四列为 66.67 / 81.82 / 75.00 / 50.00,有 RAG 为 100.00 / 81.82 / 81.25 / 79.41。
- 作者称各法规来源上 SciGuard 更好;Table F3 中 GPT-4 的 Export/Import 为 90.91、Env 为 87.50,高于 SciGuard(GPT-4)的 81.82 与 81.25。
- Table F2:SciGuard(GPT-4)的 Toxic 为 90.5、Addictive 为 100.0,GPT-4 为 87.3 与 50.0。作者称 toxic 相关查询增益最大。
- Figure 5a 中若干模型 harmlessness 为 2,SciGuard 为 5;Figure 5b 中 SciGuard 识别出良性问题里的物质,Vicuna-13B 与 Llama2-13B-Chat 没有识别正确。不复述内容。
有什么可以进一步探索的点?
作者称输入依赖、对抗鲁棒和误分类仍待研究,SciMT未穷尽化学风险。
作者指出的局限与后续方向
- 输入依赖: 安全判断仍部分依赖用户输入,输入可能含糊、不完整或故意欺骗(Section 4)。
- 对抗行为: 作者称 SciMT-Jailbreak 上表现强,但对更复杂对抗行为的鲁棒性仍是 open challenge;后续应加强对细微意图操纵的检测,并做更主动的防护(Section 4)。
- 误分类后果: 过度限制安全物质,或漏过真正有害的物质,可能带来社会和监管后果,后续版本应再研究(Section 4)。
- 基准边界: SciMT 没有穷尽化学科学的全部风险类型,也不能完全预见新出现或正在变化的威胁;作者把它定位为聚焦的评测框架,而不是审计科学 AI 的完整方案(Section 4)。
实验覆盖范围
- Table 1 报告 12 个系统在 SciMT 四项上的分数;SciGuard 的骨干是 GPT-4、Gemini 和 Mixtral。
- Redteam 432 条,Benign 115 条,Legislation 70 题,Jailbreak 60 条;ScienceInfo 题量、WMDP 化学子集题量,论文都未写。
- harmlessness 主评委是 gpt-4-0613;人工评估为 60 条、3 名评判。论文未报告相关系数,也未报告重复次数和 red-team agent 的模型名。
- 附录还报告 SciMT-Benign、MMLU 抽样 200 题、WMDP-Chem,以及 Self-Reminders 和 SmoothLLM 的越狱对照。
- 风险演示测量了 LocalRetro 与 ADMETlab 2.0。效用数字主要来自 ScienceInfo、Legislation、Benign 的 helpfulness 和 MMLU;论文未报告 LocalRetro 或 Chemprop 在护栏前后的预测指标。
总结一下论文的主要内容
SciGuard以外部智能体控制化学AI误用;GPT-4版Redteam为5.00。
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。
SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。科学模型按 black boxes 使用。配套基准 SciMT 把红队、科学信息、法规和越狱分开测,并用良性集看是否过度拒绝。
Table 1 中 SciGuard(GPT-4)四项为 5.00、84.29、90.00、5.00;SciGuard(Gemini)为 5.00、87.14、88.75、4.88;SciGuard(Mixtral)为 4.91、72.86、70.00、3.43。作者称三版都高于各自基座。摘要里的 red-teaming 满分对应前两版,不对应 Mixtral 版;后者的 Jailbreak 也低于多个基座模型。Table F7 中 SciGuard(GPT-4)的 WMDP-Chem accuracy 为 43%,GPT-4 为 69%,作者把下降解释成危险知识受到更强抑制。抽样 200 题的 MMLU 上,SciGuard(GPT-4)为 85.5%,GPT-4 为 83.5%。
作者认为这种外部中介可以同时照顾安全与科学效用,并呼吁 AI、科学和政策社区继续协作。作者也写明:判断仍部分依赖可能不完整或带欺骗的输入,复杂对抗和误分类还要后续工作,SciMT 也不是化学 AI 的完整审计。