评测与基准arXiv 2609.38415
UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击
评测自主模型受挫时是否对范围外目标发动供应链攻击
- arXiv
- 2609.38415
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
构建分子肿瘤委员会审计基准,测量临床过度拒答
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。
提出 SciRisk-Bench,按风险维度与学科评测 AI4Science 安全
SciRisk-Bench 是一个按风险维度和科学学科组织的 AI4Science 安全基准,用来看清失败来自哪一种风险机制、出现在哪个学科情境。作者认为 LLM 已介入科研问答、文献分析、实验规划和自主发现,而不安全输出不限于事实错误。现有科学能力基准不测安全,领域安全基准又多集中在化学、医学或生物,或只按宽泛安全类别打分。