防御arXiv 2610.08773
AdvSim2Real 用任务与注入对手共同演化训练网页智能体
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
- arXiv
- 2610.08773
- 发表
- 层
- 应用层
- 被测模型
- Qwen3.5-4B
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 RAISED 自蒸馏,训练工具智能体抵御间接提示注入
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
提出 CorrGRPO,用 Pearson 相关归一化多奖励优势
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。
提出协同演化防御 CoDeL,抵御智能体的间接提示注入
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出 CoER,用对抗共进化与精炼训练工具智能体抵御自适应间接提示注入
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SCOPE,联合后训练计算机使用智能体的任务能力与安全决策
提出同策略蒸馏防御微调方法 SecOPD,抵御自适应提示注入