攻击arXiv 2607.10712
研究提出间接数据投毒攻击,可操纵 Claude、Codex 与 Gemini 的科研结论
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
- arXiv
- 2607.10712
- 发表
- 层
- 应用层
- 被测模型
- Claude Code with Claude Opus 4.7、Codex with GPT-5.5、Gemini CLI with Gemini 3.1 Pro
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。