AdvSim2Real 用任务与注入对手共同演化训练网页智能体
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
- arXiv
- 2610.08773
- 发表
- 层
- 应用层
- 被测模型
- Qwen3.5-4B
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 RAISED 自蒸馏,训练工具智能体抵御间接提示注入
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 SRFT,让 Agent 从失败经验中学习拒绝提示注入
提出 CrossFit,用折外求解器抑制自演化搜索智能体共作弊
False Frontiers 诊断自进化搜索智能体中的 co-cheating,并用按来源交叉拟合的反馈来缓解它。
提出 CorrGRPO,用 Pearson 相关归一化多奖励优势
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。
提出协同演化防御 CoDeL,抵御智能体的间接提示注入
提出 CoER,用对抗共进化与精炼训练工具智能体抵御自适应间接提示注入
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 INTENT-AS-A-TOOL,用意图工具概率跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。
提出 SCOPE,联合后训练计算机使用智能体的任务能力与安全决策
提出同策略蒸馏防御微调方法 SecOPD,抵御自适应提示注入
提出 IACM-RL,用信念状态与强化学习改进动态意图下的复杂工具调用
提出 Agent MechSuits,对多轮 CLI Agent 做步级检测与子空间转向
Agent MechSuits 是面向多轮 CLI 智能体的白盒、步级表示防御,并配有可执行轨迹基准 MAS。