防御arXiv 2610.08773·10月7日AdvSim2Real 用任务与注入对手共同演化训练网页智能体提出 AdvSim2Real,协同训练网页智能体抵御页面注入arXiv2610.08773发表10月7日层应用层场景web agent被测模型Qwen3.5-4B防御模型加固攻击提示注入深度解读完整解读
防御arXiv 2610.00850·10月1日AuraForge:为训练安全编码 Agent 扩展安全监督提出 AuraForge,从漏洞修复合成安全测试并训练编码 AgentarXiv2610.00850发表10月1日层训练与数据层场景coding agent被测模型Qwen3.5-4B、GLM 4.7 Flash、Qwen3-Coder-Next 等 7 个防御模型加固风险Agent 危险操作摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。深度解读完整解读