跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 66 篇还没打标签,不在筛选结果里。

另有 66 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2610.07723 ·

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    模型与 API测试Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个训练与数据层

    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。

    完整解读
已经到底了