评测与基准arXiv 2609.38415
UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击
评测自主模型受挫时是否对范围外目标发动供应链攻击
- arXiv
- 2609.38415
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
评测自主模型受挫时是否对范围外目标发动供应链攻击
摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。