防御arXiv 2609.24165
APEXA 为同步辐射数据处理的 LLM 多智能体加装执行完整性护栏
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
- arXiv
- 2609.24165
- 发表
- 层
- 应用层
- 被测模型
- GPT-5-mini、GPT-5.4、Claude Opus 4.7 等 4 个
摘要作者称执行是否发生要由工具层核对,而不能只靠提示词。
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APEXA,在工具层拒绝无执行支撑的结果并拦截电机命令
APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。
提出 SciGuard 外部护栏与 SciMT 基准,控制化学科学 AI 误用
这篇工作把化学科学 AI 的误用控制做成外部智能体,而不是改模型权重。作者担心合成规划、毒性预测和科学语言模型被用来获取有害物质信息、规避监管或传播危险知识,同时合法工业用途又不能靠一律拒绝来处理。SciGuard 由 LLM 担任中介,把原则和指南放进短期记忆,把分子库、危害库、法规和交互历史放进可检索的长期记忆,再按 Chain of Thought 调用 Chemprop、LocalRetro 等工具,或用 RAG 补法规片段,最后回答、追问或拒绝。