研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
完整解读
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
完整解读提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
完整解读提出 SCOPE 联合后训练计算机使用智能体的任务执行与安全决策
完整解读提出契约约束的工具调用修复协议,在执行前拦截非法补丁
完整解读提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入
完整解读提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。