攻击arXiv 2607.10712
研究提出间接数据投毒攻击,可操纵 Claude、Codex 与 Gemini 的科研结论
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
- arXiv
- 2607.10712
- 发表
- 层
- 应用层
- 被测模型
- Claude Code with Claude Opus 4.7、Codex with GPT-5.5、Gemini CLI with Gemini 3.1 Pro
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
提出 SciTrace,为科学发现智能体加入跨阶段安全推理与工具轨迹核验
SciTrace 是加在科学发现智能体流水线上的安全框架,不是再在各阶段出口放一个独立过滤器。
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。