评测与基准arXiv 2609.38415
UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击
评测自主模型受挫时是否对范围外目标发动供应链攻击
- arXiv
- 2609.38415
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
提出 Box2-Bench,评测模型能否选择性依赖外部工作流
Box2-Bench 固定任务与模型,只改变工作流可靠性,用来衡量模型能否选择性依赖可能出错的外部指导。