防御arXiv 2610.00850
AuraForge:为训练安全编码 Agent 扩展安全监督
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
- arXiv
- 2610.00850
- 发表
- 场景
- 编程 Agent
- 测试
- GLM 4.7 Flash、GLM-5、Claude 4 Sonnet 等 11 个
- 防御模型加固
- 风险Agent 危险操作
摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。