防御arXiv 2610.08773
AdvSim2Real 用任务与注入对手共同演化训练网页智能体
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
- arXiv
- 2610.08773
- 发表
- 层
- 应用层
- 被测模型
- Qwen3.5-4B
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
发现暴露模型家族标签会让多智能体派系化并削弱合作
Del Giudice 等人研究异构多智能体 LLM 系统里一个配置细节:把模型家族身份告诉智能体,会不会改变合作。他们把由此出现的、按身份结组的倾向称为 factionalism。任务是无利害的共同决策,没有人设,也没有偏向同家族同伴的奖励。
评测安全 Agent 在对抗性任务污染下的解题成功与开销
AgentLSD 是一个对照框架,用来测量安全智能体在任务本身不变时,对对抗性任务污染的反应。
提出 READY 框架,认证企业 Agent 在人工监督下能否达到规定可靠性
READY 把“智能体能否自主完成工作”改写成“哪个人机监督策略能在留出证据上达到规定可靠性,以及要付多少运营成本”。。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行