防御arXiv 2609.24165
APEXA 为同步辐射数据处理的 LLM 多智能体加装执行完整性护栏
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
- arXiv
- 2609.24165
- 发表
- 层
- 应用层
- 被测模型
- GPT-5-mini、GPT-5.4、Claude Opus 4.7 等 4 个
摘要作者称执行是否发生要由工具层核对,而不能只靠提示词。
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。