研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
完整解读
另有 378 篇论文还没打上分类标签,暂不在筛选结果里。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出 HACKTRACE 用生成状态检测并抑制代码奖励作弊
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
完整解读提出 SafeEvolve,用轨迹证据协同演化安全 harness 与策略
SafeEvolve 把已完成的 on-policy 轨迹变成安全 harness 的有界更新,并用两阶段 SFT-RL 把这些更新内化进工具使用策略。
提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读提出契约约束的工具调用修复协议,在执行前拦截非法补丁
完整解读提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入
完整解读