评测与基准arXiv 2605.30322
Gram:面向破坏倾向的自动化对齐审计框架
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
- arXiv
- 2605.30322
- 发表
- 层
- 应用层
- 被测模型
- Gemini 2.5 Pro、Gemini 3.0 Pro Preview、Gemini 3.1 Pro Preview
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向
提出 SafeScientist 四层监控,阻止科研智能体执行高风险或不伦理任务
SafeScientist 是带四层监控的科研智能体框架,并用 SciSafetyBench 评测科学场景中的任务安全。