研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
完整解读
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
完整解读提出 VAC,用真实操作参数与来源隔离保护智能体浏览器确认
完整解读