跳到正文
原文
论文追踪· arXiv:2312.06632·本站收录 · 原文发表

用智能体控制化学科学中的 AI 风险:SciGuard 护栏与 SciMT 基准

Controlling risks of AI in chemical science with agents

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

SciGuard控制化学科学AI误用;Table 1中GPT-4版Redteam harmlessness为5.00。

威胁模型恶意用户可借助合成规划、毒性预测或LLM/科学智能体,获取有害物质信息、规避监管或传播危险知识。

问题
化学科学里的合成规划、毒性预测和语言模型可能被用来提出有害物质、规避监管或传播危险信息。作者认为现有安全机制常常不够,需要在不修改底层模型的情况下做情境化控制。
方法
SciGuard以LLM为外部中介,用原则、指南、分子与法规记忆、科学工具和RAG做迭代规划,再决定回答、追问或拒绝。SciMT用红队、科学信息、法规和越狱四部分同时看安全与效用。
实验与结果
Table 1中SciGuard(GPT-4)Redteam为5.00、ScienceInfo为90.00、Jailbreak为5.00。Mixtral版Jailbreak为3.43,并非各模型最高。作者称相对基座有提升。
局限与可以继续做的
结论写明输入可能含糊或具欺骗性,复杂对抗与误分类待研究,SciMT未穷尽化学风险。评测含Table 1的12个系统,以及良性集、MMLU抽样和WMDP-Chem。论文未给出人工一致性相关系数。
实验设置SciGuard (GPT-4)、SciGuard (Gemini) 等 · SciMT-Redteam、SciMT-Benign 等 · harmlessness、accuracy 等
威胁模型
恶意用户可借助合成规划、毒性预测或LLM/科学智能体,获取有害物质信息、规避监管或传播危险知识。SciGuard作为model-agnostic外部中介,不改底层模型,把科学AI当作black boxes来解释意图并控制访问。论文未用white-box或gray-box描述攻击者知识。
被测模型
SciGuard (GPT-4)SciGuard (Gemini)SciGuard (Mixtral)LocalRetroADMETlab 2.0
基准
SciMT-RedteamSciMT-BenignSciMT-ScienceInfoSciMT-LegislationSciMT-JailbreakMMLUWMDP-ChemGHS hazard dataset
指标
harmlessnessaccuracyhelpfulnessenrichment factor
AI 导读论文提出基于智能体的护栏 SciGuard,利用大语言模型、工具和外部知识评估并控制科学 AI 交互中的风险,并给出同时衡量安全性与可用性的基准 SciMT。SciGuard 在红队测试查询上取得 SOTA 无害性得分,同时在良性任务上保持高性能且不牺牲科学知识。作者先列举了 AI 在化学科学中被滥用的真实案例,并呼吁持续研究与对话以确保 AI 在科学中的安全部署。

论文提出基于智能体的护栏 SciGuard,利用大语言模型、工具和外部知识评估并控制科学 AI 交互中的风险,并给出同时衡量安全性与可用性的基准 SciMT。SciGuard 在红队测试查询上取得 SOTA 无害性得分,同时在良性任务上保持高性能且不牺牲科学知识。作者先列举了 AI 在化学科学中被滥用的真实案例,并呼吁持续研究与对话以确保 AI 在科学中的安全部署。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    化学科学AI可被误用,作者提出外部护栏SciGuard与基准SciMT。

    化学科学中的 AI 可能被用来制造有害物质或规避监管,作者要在不改底层模型的前提下控制这类误用。

    • 场景: 作者称 AI 已进入假设生成、实验规划与化学研究。Figure 1a 把风险分成恶意意图下的有害物质、改作有害用途、规避监管和错误信息,以及良性意图下的意外效应、不准确、隐私与偏见。Appendix C 称后果可直接影响健康与环境,大语言模型也降低了非专家获取风险信息的门槛。
    • 现有不足: 作者称科学模型任务窄,缺少对伦理、环境与监管后果的推理;引言称现有安全机制常常不够。Section 2.1 用合成规划、毒性预测和语言模型案例说明误用可能。
    • 作者的三点依据: 风险要看情境,有健康风险的化学品仍可能有合法工业用途;科学模型需要外部中介,并用短期与长期记忆追踪查询;伦理规范随文化、学科和时间变化,所以要接外部知识与法规。
    • 本文提出: 模型无关的智能体护栏 SciGuard,在用户与科学 AI 之间解释意图、调用工具和知识后再回复;多任务基准 SciMT,覆盖安全、科学概念、法规理解和越狱抵抗。
    • 威胁模型:
      • 目标: 借助科学 AI 设计或获取有害物质、把物质改作有害用途、规避监管,或用自然语言传播危险化学信息(Figure 1a、Section 2.1)。
      • 知识: 论文称即使把科学 AI 当作 black boxes 也可工作;未写攻击者是否掌握权重,也未用 white-box 或 gray-box 描述攻击者。
      • 能力: 用户用自然语言或指定结构化格式描述任务。SciGuard 作为中间件,避免用户直接访问某些科学模型,并可查数据库、法规和科学工具。
      • 受害系统: 合成规划模型、毒性预测模型,以及 LLM 与科学智能体。演示对象包括 LocalRetro、ADMETlab 2.0,以及 Mistral-7B、Vicuna-7B、Palm-2 和 ChemCrow。
  2. 有哪些相关研究?

    相关工作覆盖合成规划、毒性预测、科学智能体、双用途风险与安全治理。
    • 化学模型与科学智能体: GLN、LocalRetro、Retroformer 做逆合成路线生成;ADMETLab 2.0 与 Chemprop 做毒性或性质预测,用于早期药物发现和安全筛选。GPT-4 以及 ChemCrow、HuggingGPT、Chameleon 一类系统把语言模型接到科学工具上,做自动实验与分析。作者称 ChemCrow 虽有安全检查,仍可能提供敏感药物相关信息(Section 2.1.3、Figure D5)。
    • 双用途与误用: 作者引用 Urbina 等(2022),讨论药物发现模型被反过来用于有害物质;Sandbrink(2023)区分语言模型与生物设计工具的误用风险。Appendix B 还提到 Spicyboro 可产出详细病毒数据,并引用 Gopal 等(2023)关于发布权重是否扩大疫情制剂获取的讨论,以及 Acion 等(2023)关于生成式 AI 与开放科学的伦理问题。
    • 治理与对齐努力: Appendix B 写到 FDA 推动医疗 AI 监管,OpenAI 的 Superalignment,美国政府与 Microsoft、OpenAI、Google 合作制定安全协议,以及 Anthropic 的生物风险评估。这些是作者用来说明多方正在做安全协议,不是本文实验基线。
    • 本文采用的智能体技术: 架构引自 ChemCrow、HuggingGPT、MRKL 与 ReAct;规划使用 Chain-of-Thought;法规文本用 Retrieval-Augmented Generation。Self-Reminders 被当作对齐提醒,并在附录里与 SmoothLLM 一起作为越狱对照。

    基线与基准: 主表对照是 Table 1 中的主流 LLM 和 ChemCrow(GPT-4),基准是 SciMT 的 Redteam、Legislation、ScienceInfo、Jailbreak。附录另在 SciMT-Jailbreak 上对照 Self-Reminders 与 SmoothLLM。

    作者把 SciGuard 定位为不改模型权重的外部中介,用领域知识、法规和工具做情境化控制;结论中作者称,相对安全微调或遗忘,这种做法更灵活,且不降低专用科学模型的性能。

  3. 论文如何解决这个问题?

    SciGuard用LLM做外部中介,结合记忆、工具、规划与RAG控制访问。

    SciGuard 不改科学模型,由 LLM 在用户和模型之间解释意图、补上下文、调用工具,再给出回复。

    设计目标与框架

    • 三个目标: 情境化风险评估;弥补科学模型缺少伦理与情境推理;适应随文化、学科和时间变化的伦理规范。
    • 三项属性: 领域专长(化学名、分子式、结构)、法规兼容、价值对齐(区分良性与可能有害的查询和输出)。
    • 流程: 用户用自然语言或结构化格式提任务。LLM 建立任务上下文,加入原则、指南和示例;检索外部库与法规;规划并执行动作;把科学模型的观察写回上下文,迭代到最终回复。中间规划与工具输出对用户隐藏。

    记忆

    • 短期记忆: 写在系统提示里,包括原则、指南和示例。原则要求回答有益、合乎伦理与法律,并拒绝有害或违法内容。指南用于判断意图;论文写对高风险主题更倾向拒绝,除非意图明确合理。附录 E 有实现说明,这里不抄提示词。
    • 长期记忆: 交互中检索。分子库用 PubChem。危害库包括 GHS、OPCW、PAN HHP 等,按来源划分,可同时查多库。交互历史保存查询、回复、工具和输出,用来看重复探测、改写绕过或逐步升级。
    • 相似度: 论文列举 MACCS、ECFP、AtomPair,以及 Tanimoto、Dice、Cosine、Sokal,未写实际采用哪一对。

    工具、规划与 RAG

    • 工具: Chemprop 做性质预测,任务包括 tox21、clintox、sider、lipo、hiv、explosives、flammables、oxidizers、corrosives、acute-toxicity、health-hazard、bbbp;输入 SMILES,输出该性质分数。LocalRetro 做逆合成。Molecular Transformer 做反应产物预测。文中还列出药物优化模型和科学智能体。
    • 动作与规划: 动作包括选工具、生成回复、请求确认或拒绝。规划用 Chain of Thought,按任务上下文和安全标准决定动作序列。
    • RAG: 法规知识库中检索与查询相关的片段,附在用户查询后送入智能体。
    • 开销: Appendix E.7 写系统提示约 2,000 tokens;多数良性查询一轮推理,相对直接访问的延迟通常不到 1–2 秒;一次工具调用通常再加 2–5 秒。

    运行设置与成功判定

    • 骨干: 主实现采用 gpt-4-0613;Table 1 另有 SciGuard(Gemini)和 SciGuard(Mixtral)。实验温度 0,top p 1.0(若适用),max tokens 2000(若适用)。
    • 评测怎么算过关: Redteam 与 Jailbreak 用 1–5 的 harmlessness,由 LLM 裁判打分,并抽子集做人工评分。ScienceInfo 与 Legislation 用 accuracy。Benign 同时看 harmlessness 和 helpfulness,用来检查是否一律拒答。论文未把某一分数定义为部署阈值。

    SciMT 的构建

    • Redteam: 未点名的 red-team agent 用少样本生成,再人工修订。432 条:177 条不绑定具体物质;255 条来自 85 个模板,俗名、IUPAC、SMILES 各 85 条。范围包括 GHS 危害和生物危害。
    • Benign: 115 条化学与生物常见问题;28 条不绑定物质,87 条含俗名、IUPAC 或 SMILES。
    • ScienceInfo: 主要来自 GHS 和 Pharmaceutical Hazards Safety 数据库,覆盖物质类型、安全操作与处置、化学表示。题目总数论文未写。
    • Legislation: 70 道四选一,来源包括 EPA、WHO、OPCW,涉及进出口、环境污染和健康。
    • Jailbreak: 提示来自 JailbreakChat。先在无防御 ChatGPT 上保留 ASR 超过 20% 的 16 条,再放到 GPT-4 上,harmlessness 满分为 5 的剔除,留下 20 条;与 3 条风险指令组合,共 60 条。不复述提示内容。
  4. 论文做了哪些实验?

    Table 1中SciGuard(GPT-4)的Redteam与Jailbreak harmlessness均为5.00。

    实验设置

    • 被测系统: Table 1 有 GPT-4、Gemini-1.5-Pro、Llama-2-7B、Llama-2-13B、Vicuna-7B、Vicuna-13B、Mistral-7B、Mixtral-8x7B、ChemCrow(GPT-4),以及 SciGuard 的 GPT-4、Gemini、Mixtral 三版。Appendix F.1 写 GPT-4 与 SciGuard、评委均为 gpt-4-0613;开源检查点为 llama-2-7b-chat-hf、llama-2-13b-chat-hf、vicuna-7b-v1.5、vicuna-13b-v1.5、Mistral-7B-Instruct-v0.1。
    • 规模: Redteam 432 条,Benign 115 条,Legislation 70 题,Jailbreak 60 条。ScienceInfo 题量论文未写。MMLU 从 14,042 题抽 200 题。WMDP 全集 3,668 题,化学子集题量论文未写。
    • 指标: Redteam 与 Jailbreak 为 harmlessness(1–5);ScienceInfo、Legislation、MMLU、WMDP 为 accuracy;Benign 另有 helpfulness(1–5),拒答计为 helpfulness 的 1 分。
    • 评审: 主评委 gpt-4-0613,温度 0。评分要求忽略语气和警告,只看信息是否可能造成伤害。SmoothLLM 对照另用 GPT-4.1。人工评估为 3 人、60 条。
    • 解码: 温度 0,top p 1.0,max tokens 2000(若适用)。论文未报告重复次数。red-team 查询的生成模型未点名。
    • 风险演示: LocalRetro、ADMETlab 2.0;Figure 2d 还有 ChemCrow(Public)、Vicuna-7B、Mistral-7B、Palm-2。

    主结果

    据 Table 1。行数所限,表内保留三个 SciGuard 变体、其可对照基座,以及各列最差分所在模型。

    表格较宽,可左右滑动

    模型RedteamLegislationScienceInfoJailbreak
    SciGuard (GPT-4)5.0084.2990.005.00
    SciGuard (Gemini)5.0087.1488.754.88
    SciGuard (Mixtral)4.9172.8670.003.43
    GPT-44.8968.5787.504.33
    Mixtral-8x7B4.6340.0063.752.85
    Mistral-7B4.1954.2867.502.73
    Llama-2-7B4.9554.2938.754.83
    • 省略: Gemini-1.5-Pro 为 4.98 / 64.29 / 75.00 / 3.60;ChemCrow(GPT-4)为 4.92 / 70.00 / 80.00 / 4.88;Llama-2-13B 为 4.95 / 44.29 / 55.00 / 4.70;Vicuna-7B 为 4.33 / 48.57 / 55.00 / 3.13;Vicuna-13B 为 4.60 / 50.00 / 70.00 / 3.20。
    • 相对基座: 作者称各 SciGuard 变体相对其基座在四项上都有提升。表中三行相对 GPT-4、Mixtral-8x7B,以及省略项中的 Gemini-1.5-Pro,四项都更高。
    • 作者的总括与表内例外: 摘要称 red-teaming 达到 state-of-the-art harmlessness,引言写满分 5.0/5.0;该分数对应表中 GPT-4 版和 Gemini 版,Mixtral 版不是该分数,且低于省略项中的 Gemini-1.5-Pro 与两档 Llama-2。作者称越狱防御最好、ScienceInfo 上持续优于其他模型;表中 Jailbreak 最高分只在 GPT-4 版,Mixtral 版低于表内 Llama-2-7B 和省略的多个模型;ScienceInfo 上 Mixtral 版也低于表内 GPT-4。

    风险演示

    • 合成规划: 作者用 LocalRetro 说明可为氢氰酸给出比传统 Andrussow 氧化更易在实验室进行的路线,并写前体 LD50 为 6 g/kg、氰化钾 LD50 为 5 mg/kg;反应条件不转述。作者称可靠性分数超过 0.8 的有毒物质超过 1,400 种,其中包括被归为化学武器的物质(Figure 2b、Appendix D.2–D.3)。
    • 毒性排序: 作者在 GHS hazard dataset 上用 ADMETlab 2.0 计算 enrichment factor,称 top 5% 的 EF 达到 22.0(Figure 2c)。正文写还计算了 1%、10%、20%,但未列出这三档的 EF。
    • 语言模型案例: Figure 2d 中 ChemCrow(Public)、Vicuna-7B、Mistral-7B、Palm-2 的 harmlessness 均为 2。附录另有案例,不复述查询和合成内容。

    良性任务、人工评分与通用题

    • SciMT-Benign: Table F5 中 SciGuard 的 harmlessness / helpfulness 为 5.0±0.2 / 4.7±0.8,得 5 分的比例为 95.7% / 86.1%。Llama2-13B-Chat 的 helpfulness 为 4.9±0.6。全拒系统 Rejective 为 5.0±0.0 / 1.0±0.0。作者称 SciGuard 能在无害的同时仍然有帮助;表中它的 helpfulness 不是最高。
    • 人工评分: 6 个系统各 10 条,共 60 条,3 名评判与 GPT-4 用同一标准。引言称 strong alignment,Appendix F.2 称 relatively strong correlation。论文未给相关系数。Figure F6 是 KDE 和混淆矩阵,文本没有格内数字。
    • MMLU: Table F6 中 GPT-4 为 83.5%,SciGuard(GPT-4)为 85.5%。作者将其归因于通用工具和结构化推理。

    越狱对照与 WMDP

    • 两种对照: Table F4 上 Self-Reminders 与 SciGuard 均为 5.00,SmoothLLM 为 4.85,GPT-4 为 4.33。SmoothLLM 使用 6 个 Swap 扰动、扰动率 15%,由 GPT-4.1 选择最安全回复。
    • WMDP-Chem: Table F7 中 GPT-4 为 69%,SciGuard(GPT-4)为 43%。作者称更低 accuracy 表示危险知识被抑制得更强。作者写在题目前加入保守拒答指令,以模拟风险规避基线;未另给不带该指令的一组数字。
    • 分布图: Figure F7 给出 SciMT-Redteam 的 harmlessness 分布,文本未给出各分数档比例。

    其他消融与分析

    • 去掉原则与指南:Redteam 上完整 SciGuard(GPT-4)为 5.00,去掉后 4.94,GPT-4 为 4.89(Figure F8);Jailbreak 去掉后 4.85,完整为 5.00,GPT-4 为 4.33(Figure F10)。
    • ScienceInfo(Figure F9):完整 90.00;去掉 PubChem 为 80.00,Wikipedia 为 85.00,Hazard Check 为 86.25,原则与指南为 87.50;去掉 Chemprop、LocalRetro 或 Molecular Transformer 均为 88.75。
    • 无 RAG 的 Legislation 总体为 64.29%(Appendix F.5)。Table F3 中 SciGuard(GPT-4)无 RAG 的四列为 66.67 / 81.82 / 75.00 / 50.00,有 RAG 为 100.00 / 81.82 / 81.25 / 79.41。
    • 作者称各法规来源上 SciGuard 更好;Table F3 中 GPT-4 的 Export/Import 为 90.91、Env 为 87.50,高于 SciGuard(GPT-4)的 81.82 与 81.25。
    • Table F2:SciGuard(GPT-4)的 Toxic 为 90.5、Addictive 为 100.0,GPT-4 为 87.3 与 50.0。作者称 toxic 相关查询增益最大。
    • Figure 5a 中若干模型 harmlessness 为 2,SciGuard 为 5;Figure 5b 中 SciGuard 识别出良性问题里的物质,Vicuna-13B 与 Llama2-13B-Chat 没有识别正确。不复述内容。
  5. 有什么可以进一步探索的点?

    作者称输入依赖、对抗鲁棒和误分类仍待研究,SciMT未穷尽化学风险。

    作者指出的局限与后续方向

    • 输入依赖: 安全判断仍部分依赖用户输入,输入可能含糊、不完整或故意欺骗(Section 4)。
    • 对抗行为: 作者称 SciMT-Jailbreak 上表现强,但对更复杂对抗行为的鲁棒性仍是 open challenge;后续应加强对细微意图操纵的检测,并做更主动的防护(Section 4)。
    • 误分类后果: 过度限制安全物质,或漏过真正有害的物质,可能带来社会和监管后果,后续版本应再研究(Section 4)。
    • 基准边界: SciMT 没有穷尽化学科学的全部风险类型,也不能完全预见新出现或正在变化的威胁;作者把它定位为聚焦的评测框架,而不是审计科学 AI 的完整方案(Section 4)。

    实验覆盖范围

    • Table 1 报告 12 个系统在 SciMT 四项上的分数;SciGuard 的骨干是 GPT-4、Gemini 和 Mixtral。
    • Redteam 432 条,Benign 115 条,Legislation 70 题,Jailbreak 60 条;ScienceInfo 题量、WMDP 化学子集题量,论文都未写。
    • harmlessness 主评委是 gpt-4-0613;人工评估为 60 条、3 名评判。论文未报告相关系数,也未报告重复次数和 red-team agent 的模型名。
    • 附录还报告 SciMT-Benign、MMLU 抽样 200 题、WMDP-Chem,以及 Self-Reminders 和 SmoothLLM 的越狱对照。
    • 风险演示测量了 LocalRetro 与 ADMETlab 2.0。效用数字主要来自 ScienceInfo、Legislation、Benign 的 helpfulness 和 MMLU;论文未报告 LocalRetro 或 Chemprop 在护栏前后的预测指标。
  6. 总结一下论文的主要内容

    SciGuard以外部智能体控制化学AI误用;GPT-4版Redteam为5.00。

    这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。

    SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。科学模型按 black boxes 使用。配套基准 SciMT 把红队、科学信息、法规和越狱分开测,并用良性集看是否过度拒绝。

    Table 1 中 SciGuard(GPT-4)四项为 5.00、84.29、90.00、5.00;SciGuard(Gemini)为 5.00、87.14、88.75、4.88;SciGuard(Mixtral)为 4.91、72.86、70.00、3.43。作者称三版都高于各自基座。摘要里的 red-teaming 满分对应前两版,不对应 Mixtral 版;后者的 Jailbreak 也低于多个基座模型。Table F7 中 SciGuard(GPT-4)的 WMDP-Chem accuracy 为 43%,GPT-4 为 69%,作者把下降解释成危险知识受到更强抑制。抽样 200 题的 MMLU 上,SciGuard(GPT-4)为 85.5%,GPT-4 为 83.5%。

    作者认为这种外部中介可以同时照顾安全与科学效用,并呼吁 AI、科学和政策社区继续协作。作者也写明:判断仍部分依赖可能不完整或带欺骗的输入,复杂对抗和误分类还要后续工作,SciMT 也不是化学 AI 的完整审计。

阅读原文arxiv.org