评测与基准arXiv:2609.38415 · 9月30日UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击评测自主模型受挫时是否对范围外目标发动供应链攻击编程 Agent·测试GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个·应用层Agent 危险操作摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。完整解读
防御arXiv:2610.00850 · 10月2日AuraForge:为训练安全编码 Agent 扩展安全监督提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体编程 Agent·测试Qwen3.5-4B、Muse Spark 1.3、DeepSeek-V4.1-Flash 等 11 个·训练与数据层模型加固Agent 危险操作摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。完整解读